100兆瓦的AI数据中心,实际只能用80兆瓦。那20兆瓦空着呢,电费照付,GPU空转,谁都捞不到好处。英伟达说这事儿得改。
9月16日的AI Infra Summit上,英伟达甩出了一个叫DSX的平台。两件武器:一个叫MaxLPS,一个叫Flex。它们不卖GPU,但能让GPU卖得更多——因为电网容量是有限的,谁能把每兆瓦榨干,谁的GPU才有人买单。
问题摆在那儿:Hopper和Blackwell这批老GPU还得服役好几年才能退役,新GPU拼命往机房里塞,但电网跟不上节奏。英伟达HPC和AI超大规模基础设施高级总监Dion Harris在采访时说:
在数据中心和AI工厂这个量级,我们真的是在想怎么从每吉瓦里多榨一点性能出来。
DSX MaxLPS先解决沟通问题。机柜、电池、冷却分配单元、冷水机这些硬件平时各说各话,谁也不知道对方在干嘛。要是空气处理系统知道某个机柜实际吃多少电,就能按需调速,不用一直满转。一个细节的改动,可能省下十几个百分点的电。
说起来简单,做起来难。让几十家不同厂商的设备说同一种语言——这事儿喊了好多年,真正落地是AI带来的。更省电的数据中心能产出更多token,更多token意味着更多收入,前提是有人愿意按token付费。
英伟达自有优势:它的GPU是当下最紧俏的硬通货,设备厂商得听它的。Harris说:
DSX Exchange本质上是个API,让我们能拿到核心系统之外的信息。我们能拿到Vertiv、施耐德电气这些DSX Ready供应商提供的资产数据,还有楼宇管理系统。
英伟达和Lambda做了实测:同样功率预算下,原本只能塞16个节点的机柜,现在塞进19个。整个集群吞吐涨24%,每瓦性能涨幅差不多。
效果是数据中心不用再过度配置了,能看清全局、控住全局。
DSX Flex解决电网冲击。AI训练和推理对电网的影响是实打实的——突然一波推理高峰,可能让附近居民区电压抖一下。
英伟达和Emerald AI、Silicon Valley Power合作演示:电网高峰时,数据中心主动让出部分电力,关键负载照常跑。听起来耳熟对吧?这技术叫需求响应,早就有了。谷歌去年就宣布过类似方案——电网压力大了,暂停非关键AI工作负载。
但英伟达走得更远。Harris解释:
这让电网运营商、配电线路所有者可以不那么保守地分配容量,因为他们知道你有能力在特定窗口内削峰,不用留那么多缓冲。
电网不需要扩容量,但AI数据中心能盖更多——只要承诺"高峰时段让一让"。
削峰不意味着断电。关键负载照跑,不重要的可以暂停,也可以迁移到周边有富余的数据中心。业内管这个叫"追太阳"——把负载追着电价和电网余量跑。
但DSX有个边界问题。它只对用英伟达验证硬件的AI工厂友好。要是混进了d-Matrix、SambaNova这些第三方加速器,事情就复杂了。Harris承认:
合作伙伴要扩展支持,得做点软件集成,不是每颗芯片都能像我们的那样做到那么细粒度的控制。
至于AMD的Instinct GPU?基本只能用其他数据中心管理系统复制DSX的能力了。
这才是关键。DSX不只是省电工具,是英伟达给客户下的又一个套——你买了我的GPU,我顺便帮你省电;你省了电,电网批更多容量;电网批了容量,你买更多GPU。闭环成型,对手进不来。
The Register点破了:
在榨干既有电网容量之外,DSX是英伟达的又一座围墙花园,确保客户继续买它的设备。
英伟达不再只是卖GPU的公司了。它开始卖整套AI工厂的操作系统,从硬件到电力调度,全包。
AI的尽头不是更聪明的模型,是更稳的电网。谁把电网管明白了,谁才真正掌控下一代AI的基础设施。
英伟达这步棋,下得很安静,但很狠。