📖 本文首发于知乎专栏,欢迎关注我的知乎主页一起交流:《数据中心真正的成本:不看完整张总账,你花出去的每一分钱都是糊涂账》→ 查看知乎原文
先讲一个让我记到今天的故事。
几年前有个客户,做金属加工,找我配一整套机房。我把方案递过去——几十台机柜、精密空调、UPS、配电、布线,连带整体设计一起报了个价。他拿回去,别的公司拿一份"相近方案"来对比,光在精密空调这一项上就压了我好几万,最后整套都是从别人家走的低价货。我劝过他一句话:"一套机房,价格不是看你今天掏多少,是看它这十年帮你花多少、省多少。"
他没听。
设备装上,第一年相安无事。第二年问题来了:这台"便宜"的空调是定频的、能效低,长年满负荷傻转,机房电费蹭蹭往上涨;接着因为冷热通道没做好、机柜排布不对,冷气吹出来一半被热风卷走了,他又临时加了两台挂机补冷。到第三年,他算了笔总电费,单独来找我喝茶,说了一句我现在还常跟客户复述的话:
"老高,我当年在这套设备上省的那几万,这两年光电费,早就赔进去三倍了。"
这就是我今天想跟你认真算的一笔账。大多数人谈数据中心,眼睛只盯着建设成本——机柜多少钱、空调多少钱、UPS 多少钱。这没错,但它只是冰山浮在水面上的那一小角。
水面下,是运维成本、能耗成本、延展成本,它们才是真正的"大头"。
这一行有个业内基本共识,很多外行不知道:一座数据中心,一辈子的总投入里,建设成本往往只占不到 20%,剩下 80% 以上,是它建成之后、日复一日、年复一年烧掉的钱。
这篇文章,我把数据中心从立项到退役,分六个阶段,一笔一笔把账给你摊开。全文没有参数、没有参数表,全部是老板看得懂的账本算术。看完之后,你再去立项、去砍价、去做预算,会完全是另一个思路。
一、第一笔账:建设成本,为什么只占不到五分之一
先建立一个基本框架。数据中心的全生命周期成本,业内通常拆成这么几个板块(这是 TCO,Total Cost of Ownership,全生命周期总拥有成本的标准拆法):
- 建设成本(CapEx,资本性支出):一次性掏的钱——场地、土建、设备采购、安装调试。
- 运营成本(OpEx,运营性支出):年年都在掏的钱——电费、维保、人力、耗材、软件授权。
大多数人做决策,脑子里只有 CapEx。老板问"这个机房要花多少钱",财务算出来一个建设预算,批了,建了,然后就以为"钱花完了"。
真正要命的是 OpEx。 它不像建设成本那样"一锤子"那么醒目,它是钝刀子割肉,一个月一个月、一张张账单地流走,等你回过神,已经是一个远超建设成本的数。
我给一个通用量级的参照。一个中型企业自有机房(100 平米左右、三四十个机柜、几十台服务器),假设建设期一次性投了 150 万。它十年下来的电费、维保、人工,加起来是多少?
- 电费:这是最大的黑洞。按机房常年 20 万瓦、电费均价 8 毛 5 算,一年就是 14.9 万,十年 149 万。
- 维保:精密空调、UPS 的年度维保,加上故障零配件,一年算 4 万,十年 40 万。
- 人力:哪怕只有一个专职运维加一个兼职,一年 15 万,十年 150 万。
就这三项,十年 339 万,已经是建设成本 150 万的 2.26 倍。 而且我这还没算硬件折旧、软件授权、扩容改造、以及大故障造成的业务损失。
所以结论很硬:你怎么省今天这 10% 的设备钱,都不如怎么把接下来十年每年那 10% 的电费、维保钱降下来重要。 这不是鸡汤,是算术。
这一节先把框架立在脑子里,接下来我带你一个阶段一个阶段地看,钱到底是怎么漏掉的。
二、第二笔账:需求测算,错一点,后面全是钱
全生命周期成本的第一个决定点,发生在你还没买任何设备的时候。这一步叫需求测算,也叫容量规划。
我见过太多机房,问题不是设备不好,是当初的容量估错了。而且这个"估错"往往有两个方向,没一个省心。
第一个方向:估大了,设备一直"空转着亏钱"。
很多老板买设备的时候怕不够用,宁可多买。这心态没错,但钱在默默漏。我举一个最典型的例子。
UPS,机房的心脏。很多场景下,UPS 和它配套的电池,是机房建设成本里最贵的一块之一。但 UPS 有一个很多人不知道的特性:它的运行效率,和负载率强相关。 一台 UPS 满载(比如 90% 负载)时效率能到 96%,可如果它只带着 15% 的负载跑,效率可能掉到 85% 甚至更低。
这是什么概念?意味着你花大价钱买的一台"大马拉小车"的 UPS,省下的 5% 到 10%,不是白省,而是白白变成了热量和电费。
而且这种"隐性浪费",平时你根本感觉不到。UPS 好好地亮着绿灯,谁也不知道它在偷偷吃电。只有等到月底电费单出来,你才会隐约觉得"这电费怎么年年都在涨"。
第二个方向:估小了,机房建成就"卡死",扩建比新建还贵。
这个方向更疼。因为你一旦估小了,机房建成投产之后,设备加不进去。加不进去怎么办?不是在隔壁再隔一间,是要重新布线、重新做配电、重新做制冷——这些活都得在"不停电、不断网"的前提下干,难度和成本都比最初新建时翻倍。
所以我常跟客户讲一句话:好的容量规划,不是"够用就行",也不是"越多越保险",而是"今天的钱不白花,明天的空间留得住"。 这是全生命周期成本的第一根杠杆。杠杆压对了,后面十年都省心;压错了,从第一天就开始漏钱。
三、第三笔账:电费,数据中心最被低估的那头"吞金兽"
如果全生命周期成本里只能拎出一项来讲,那一定是电费。
前面说了,它往往是运营成本里最大的一块。但很多人对电费有认知误区,天天把它当"固定成本"——觉得机房嘛,开着就得用这么多电,天经地义,没什么好省的。
这个想法错得最厉害。 电费恰恰是机房成本里最值得、也最容易被优化的一块。而且优化它的办法,绝大多数并不需要换设备、花大钱。
先讲一个概念:PUE(Power Usage Effectiveness,电能使用效率)。
PUE = 机房总用电量 ÷ IT 设备用电量。它衡量的,是"你用了 1 度电算服务器,结果整个机房实际烧了 2 度电,多出来的那 1 度,是制冷、配电、照明这些辅助设施吃掉的"。
PUE 越接近 1,说明电越省;越接近 2,说明你有一半的电费在"打水漂"。
老的、没优化过的机房,PUE 常常在 2.0 甚至 2.5。这意味着,你服务器真正用电的部分,可能只有你账单的四成,剩下六成,全花在了"给它降温、给它配电"上。而一座做得好、做了冷热通道隔离、气流组织优化、用上智能制冷的机房,PUE 可以降到 1.3 甚至更低。
这一里一外,差多少? 我给你算一笔最直观的。
一个机房,IT 负载 100kW(也就是服务器净用电功率)。假设电费 8 毛 5 一度,一年 8760 小时。
- 如果 PUE 是 2.0,一年总电费 = 100kW × 2.0 × 8760h × 0.85 元 ≈ 148.9 万元。
- 如果 PUE 是 1.4,一年总电费 = 100kW × 1.4 × 8760h × 0.85 元 ≈ 104.2 万元。
一年光靠"把电用得更聪明",不是换更贵的空调,就是差出 44.7 万。 十年就是 447 万。
这 447 万,可能比你这座机房建设成本的一半还多。所以我这里要反复强调一件事,也想请你记牢:
买机柜、买空调,省的是"今天的一次性投入";把 PUE 降下来,省的是"未来十年年年可省的钱"。后者才是真正的大钱。
那么怎么降 PUE?核心技术点不多,就几个(这里点到为止,具体方案我们另文拆解):冷热通道物理隔离、机柜排布方向对不对、地板送风还是上送风、空调是不是跟着负载走而不是满负荷傻转、有没有智能动环监控去动态调。这些里,很大一部分,不需要你花大价钱买新设备,需要的是一个负总责的、真正懂机房整体设计的人。
四、第四笔账:运维,花钱养它,是为了不花更大的钱
很多老板有个很典型的心态:机房哪需要什么运维?设备买回来,扔在那,它自己不就转了嘛。
这个心态,是全生命周期成本里最贵的一个误区。
我要跟你讲清楚一个逻辑:运维的钱,本质上是"买保险"的钱,而且是全世界最划算的一种保险。 它花出去,不是为了"让机房转起来",机房本来就转得起来;它花出去,是为了让机房 365 天都不出那一次大事故。
大事故的代价,跟日常运维的费用,根本不是一个数量级。
我举一个行业里很典型的损失场景,把数字摊开。假设一个中型电商机房,一张订单的处理都依赖这套系统,一次全站宕机:
- 直接损失:4 小时不能接单、不能发货,按这家店一天流水几十万折下来,损失就是好几万到十几万。
- 间接损失:服务器硬盘过载损坏、数据没及时备份丢失,恢复要花几天,人力、外包恢复费用,又是一笔。
- 隐性损失:客户在你这下单失败,扭头去了别家;一次宕机,跑掉的可能是不再回来的客户。
加起来,一次大事故的代价,可能就是十几万到几十万。 而一个靠谱的运维体系(哪怕做不到 7×24,做到关键巡检 + 监控告警 + 定期保养),一年可能就花十几万。
这账怎么算都划算:一年十几万,买一生的平安。 这跟买汽车保险是一个道理——你年年交保费,心里可能嘀咕"这钱白交了",可一旦真出了事,那点保费救回来的,是几十倍的损失。
运维的钱花得值,关键在"预防"两个字,而不是"抢救"。同样花钱,花在"提前发现、提前换掉一根老化线缆",和花在"半夜跳闸、烧了一柜服务器之后抢救",这俩是完全不同的两种投入。前者是成本,后者是损失——而且是本可以避免的损失。
所以我要反反复复跟做老板的朋友讲这一句:别把运维当成本看,把它当时效看。从全生命周期看,它是最能帮你"省钱"的一笔开支。
五、第五笔账:延展,最容易被忽略、却往往最贵的一笔
这一笔,99% 的人在做预算时根本不会列进去,但它恰恰是全生命周期成本里最容易被低估的一笔——延展,也就是机房的扩容、改造、搬迁、退役。
前面第二节我说过,需求测算估小了很疼,因为它直接连着延展这个坑。这里再往下挖一层:机房不是一次性建完就锁死的,它是会"长大"的。 而每一次"长大",都是一笔新的钱,而且往往比当初多花。
我见过最多的三种"延展成本":
第一种:扩容。 业务涨了,要加服务器。加服务器就得加机柜,加机柜就得加配电、加制冷。如果当初机房没留出"白空间"(冗余空间)、没留够电力余量、没预埋好布线,这时候就只能拆墙、改电、重拉线——在不停机的机房里施工,随时有出事故的风险,工钱还贵一倍不止。
第二种:设备生命周期更替。 精密空调的压缩机、UPS 的电池组、这些是有寿命的。UPS 电池一般 3-5 年就得换,一套电池组换下来也是好几万。这些钱不算在建设成本里,但它实实在在属于机房一辈子要花的钱。很多老板只算了"买 UPS",没算"养 UPS"。
第三种:搬家和退役。 企业搬办公楼,机房跟着搬,这个搬迁的工程量和风险,不亚于重建一个小机房。真要到了"退役"那一步,设备残值要处理,可能还要花钱做环保报废(尤其是电池,属于危废品,随便扔是违法的)。
这三笔,单独看每一笔可能不算大,但它们叠起来,往往是机房全生命周期里最"看不见"的一大块。
所以我在前面反复强调"留余地、留白空间",原因就在这里——你今天多留的那点物理空间和电力余量,不是浪费,是为明天的延展省下一大笔钱。 短视的人只看建设预算,长线的人看的是十年总账。
六、第六笔账:把六笔加起来,算一个总账
现在,我把前面六笔,合成一个直观的总账模型,让你一眼看清:钱都去哪了,哪里值得花钱,哪里可以省钱。
我以一个虚构但符合行业典型的中型企业自有机房为例,尺寸约 100 平米、30 个机柜,把它十年的全生命周期成本拆开(数字是估算量级,用于看比例,不做精确报价):
| 成本类别 | 投入(估算,单位/万元) | 占十年总成本比(估) | 特点 |
|---|---|---|---|
| ① 建设成本(场地/土建/设备/安装) | 150 | 约 24% | 一次性,显性,老板最关注 |
| ② 设计/需求测算失误的修正 | 20 | 约 3% | 隐性,估错就从这里漏 |
| ③ 十年电费(含 PUE 损耗) | 150~300 | 约 30%~40% | 最大的山头,最可优化 |
| ④ 十年运维(人力+维保+监控) | 150 | 约 24% | 买"平安"的钱,别省错地方 |
| ⑤ 延展/改造/搬迁/退役 | 60~100 | 约 10%~15% | 最容易被忽略,最怕"当初没留余地" |
(注:不同规模、不同地域电费,比例会浮动,但"建设成本占比低、能耗+运维是大头"这个总体格局,在数据中心行业是普遍成立的。)
从这张表,你能看出三个结论,它们是我做这一行二十年最想让你记住的话:
第一,别把目光锁定在"建机房那一下"。 建设成本只占四分之一左右,你为它精打细算一个月,可能还不如把未来的电费和运维抓好。
第二,电费是最大的优化空间。 它占三成以上,而且不用换设备就能降。把它当成"固定成本、认命了",是你对成本最大的失职。
第三,运维的钱要舍得花、要花在预防上。 它是全生命周期里"投入产出比最高"的一笔——花小钱,防大事故。
七、结尾:真正的专业,是替你算十年后的账
写到这里,回到开篇那套"看着便宜"的机房。
那个客户后来明白了:一套机房,贵不贵,看的不是它今天卖你多少钱,是它未来十年帮你花掉多少电、省掉多少故障、留出多少余地。
这也正是我做这一行二十年,最想跟所有老板讲的一句话:
你花钱买的,从来不应该是一台机柜、一台空调、一台 UPS;你应该买的,是一个肯替你算十年总账的、真正负责任的整体方案。
真正有水平的数据中心服务商,跟你谈的第一件事,不是"这台柜子卖你多少钱",而是"你这个机房,未来十年打算怎么长、怎么省、怎么不出事"。后者才是值钱的地方,前者只是顺带。
所以,下一次你再准备建机房、买东西,先别急着比价、砍价。先停下来,问自己三个问题:
- 这个机房的十年总账,我算过没有?
- 电费这块,我有没有优化的空间?
- 出了事,谁替我兜底?
这三个问题想清楚了,你会发现,花的每一分钱,都比从前明白。
数据中心是一笔十年账。把账算清楚,才谈得上把机房建好。