机柜定制电源首先要满足本地法规与数据中心标准,建议在设计初期确认所托管机房的电压、频率(台湾常见为60Hz,但机房供电可能为三相220/380V或其他),并遵循相关国家/国际标准(如CNS、IEC规范)以及机房运营商的接入规范。
物理层面要考虑的要点包括:配电容量与回路数(每个机柜应标注额定功率和峰值)、线路保护(断路器与漏电保护)、接地与等电位连结、线缆走向与穿管要求、以及机柜后方可用空间与通道载流量。定制时应明确每条电源回路的断路器容量、线缆规格与插座类型(如IEC C13/C19或本地标准)。
此外,要与机房运维同步确认上游电源部署(是否提供A/B双路进线)、配电单元(PDU)类型(智能型或被动型)、以及机柜内是否允许安装电池柜或小型UPS等特殊设备。对环保与噪音有额外要求时,也要在机柜定制阶段明确冷却与隔音间距。
合规文件:供电参数说明、消防/防火隔离要求、接地证书。
物理约束:线缆通道、空开位置、PDU安装面板、配电箱尺寸。
常见拓扑包括A/B双路供电、N+1或2N UPS配置与市电+发电机组合。推荐做法是:机柜采用A/B两路独立供电,每一路分别接入不同的机房配电母线,并通过独立配电单元(PDU)下发到机柜内的设备,确保单一路故障不影响整机柜可用性。
在UPS层面,根据业务重要性选择N+1或2N:对业务关键且不能中断的集群建议采用2N或2(N+1),以实现完全独立的双回路冗余;对容忍短时间服务降级或有应用层冗余的场景,可采用N+1以平衡成本与可用性。
发电机与自动切换(ATS)应当与UPS联动,市电中断时ATS切换到发电机供电,同时UPS承担切换过渡以避免瞬断。设计时需考虑发电机启动时间、燃料保障、并网/孤岛工作模式以及谐波与励磁控制对UPS的影响。
A路市电 → UPS_A → PDU_A → 服务器A相电源;B路市电 → UPS_B → PDU_B → 服务器B相电源;市电异常 → ATS触发发电机,全局供电切换由UPS与ATS协调完成。
选择UPS时应关注容量、拓扑(在线双变换在线式最常见)、效率(负载在常态时的效率值)、并机/热插拔能力、输入输出电压与频率范围、波形与谐波抑制能力(THDi/THDv)、以及支持的通信协议(SNMP、Modbus、HTTP API等)以便整合到机房监控平台。
PDU方面优先考虑:是否为智能PDU(实时电流、电压、功率监控)、是否支持远程开关/电源循环(对单台服务器远程重启非常重要)、单相或三相分配能力、插座布局与可用插口类型、以及额外的安全与过载保护功能。对高密度机柜,建议使用垂直智能PDU并预留冗余插口。
运维特性上要考虑设备的MTTR、厂商服务响应时间、在台湾的备件与技术支持能力、是否支持本地认证检验以及设备的防护等级。智能监控与告警策略应能够与机房NOC联动,支持短信/邮件/API告警。
UPS容量应留有25%-40%的冗余余量以应对未来扩容;PDU建议按线路计算并配合断路器分级管理;优先选择支持并联扩展与热插拔的UPS以便运维。
电力只是可用性的一部分,需与网络、冷却与监控联动。建议在机柜与集群层面实现以下配合措施:服务器使用双电源并分别接A/B两路;网络交换机与路由器同样采用冗余设备并多路径互联;冷却系统(CRAC/Chiller)应与电源冗余互相支持,避免在电源切换时出现冷却不足导致设备降频或触发热关机。
在监控方面要部署PDUs、UPS、ATS、发电机与环境传感器(温湿度、烟雾、水浸)统一上报到一个NOC平台,配置阈值告警与自动化响应策略(例如在单一路故障时自动降低非关键工作负载)。负载均衡与集群调度层面可以配置容灾策略:当某一机柜或机房电源退化时自动迁移工作负载到健康节点。
此外,建议采用电力质量监测(PQ)与能效评估(PUE)周期性评估,及时发现谐波、功率因数偏低或不平衡三相等问题,减少电力设备寿命损耗并提高可用性。
集成SNMP/REST告警到自动化工单系统,支持远程PDU断电/通电操作并记录每一次电源操作日志。
上线前要做全面的切换演练:包括单一路断电、UPS故障、发电机并联/切换、PDU单点断电、以及机柜内单台服务器仅使用一侧电源运行等场景。每次演练都要记录响应时间、日志、业务影响并制定改进措施。
日常维护应包括定期检查电池健康(UPS电池内阻/容量测试)、发电机负载测试(按厂商建议周期进行满载或部分负载运行)、断路器与接线的热成像检测、PDU与UPS固件更新与补丁管理、以及线缆整理与标签核对。对关键设备建议做巡检清单并纳入CMDB管理。
同时建立故障回复SOP与应急预案:明确谁负责切换、谁通知上游/下游、如何降载与回切、防止双重切换导致并网风险(例如发电机并网操作要遵循并网同步流程)。定期做桌面演练与至少每年一次的实机切换演练,确保团队熟悉流程。
