惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
S
SegmentFault 最新的问题
N
Netflix TechBlog - Medium
Vercel News
Vercel News
F
Fortinet All Blogs
量子位
博客园 - Franky
酷 壳 – CoolShell
酷 壳 – CoolShell
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MongoDB | Blog
MongoDB | Blog
Y
Y Combinator Blog
GbyAI
GbyAI
博客园 - 三生石上(FineUI控件)
Apple Machine Learning Research
Apple Machine Learning Research
爱范儿
爱范儿
月光博客
月光博客
Recent Announcements
Recent Announcements
人人都是产品经理
人人都是产品经理
Hugging Face - Blog
Hugging Face - Blog
D
DataBreaches.Net
H
Help Net Security
阮一峰的网络日志
阮一峰的网络日志
D
Docker
WordPress大学
WordPress大学

Java for You

AI写了80万行Rust,最值得学的却是它花十倍精力读代码 - Java for You - java4u 部署大模型别先选GPU,先回答你愿意承担多少运维 - Java for You - java4u 语音AI为什么总抢话?用VAD和打断机制做对实时对话 - Java for You - java4u AI每次提交都查漏洞,真正的升级是把证明链放进评审 - Java for You - java4u 把评测员请进AI实验室,独立性反而更难证明了 - Java for You - java4u 《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u
AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for ...
蜗牛 · 2026-09-16 · via Java for You

屏幕上的代码

AI基础设施的新瓶颈不只是GPU,而是园区能拿到多少稳定电力。NVIDIA 9月15日公布的两个现场结果说明:把任务优先级、机架功率和电网信号放进同一套调度系统,既能在用电紧张时主动降载,也可能在不扩容电力的前提下提高Token吞吐。对云厂商和大模型团队来说,这比单看芯片峰值更接近真实产能。

发生了什么

在加州圣克拉拉,NVIDIA的Eos AI工厂接收Silicon Valley Power发出的需求响应信号。合作方Emerald AI的Conductor平台按预先定义的工作负载等级,让可等待任务降速或改期,同时维持高优先级推理。官方称系统已响应超过200次信号;一次展示中,功率在一分钟内从4兆瓦降到3兆瓦。

另一组结果来自GPU云厂商Lambda。它在五个机架、19个节点上测试DSX MaxLPS:19个节点以约85%的功率策略运行,与16个满功率节点保持相同设施预算。NVIDIA披露,集群吞吐从约每秒400万Token升至500万,增加24%,每瓦性能提升23%。这些是合作方在特定HGX B200环境中的结果,不应外推为任意模型、集群和电价条件下的固定收益。

mermaid diagram

技术上真正改变了什么

传统机房常按单机最坏功耗预留电力,优点是稳,代价是许多节点并不会同时达到峰值,形成“有GPU但不敢一起开”的搁浅容量。动态功率分配持续观察节点负载,把没有用满的功率余量转给需要的节点。训练与推理的功率曲线不同,批处理又比在线请求更容易延后,因此调度对象不只是硬件,还包括服务等级目标。

这里有三层控制:GPU和机架层负责功率封顶;集群层决定节点与作业的资源份额;设施层响应电网、制冷和价格事件。只优化其中一层会遇到反作用:降低GPU功率可能拉长任务时间,暂停训练可能造成检查点开销,在线推理若缺少容量保护则会抬高尾延迟。所谓“每兆瓦Token”,本质是把这些代价放进一个产出指标,而不是证明Token本身等价于有效工作。任务完成率和用户等待时间仍要单独核算,业务价值也不能省略。

对开发者和企业的影响

开发团队很快会感受到新的资源契约。过去提交作业只写GPU数量和显存,今后还可能写功率弹性、最晚完成时间、可否抢占和恢复成本。一次离线微调可以在电价高时暂停,但面向客户的实时Agent若被同样处理,就会直接违约。

具体场景是夜间生成一批商品描述:任务可在凌晨前完成,允许短暂停顿;而同一集群上的搜索问答要保证首Token延迟。调度器收到降载信号后,应先保存批处理检查点,再限制其功率,不能简单平均削减每张卡。

我的判断与边界

我的核心判断是:AI基础设施竞争正在从“买到多少GPU”转向“在电力、网络和延迟约束下交付多少可用任务”。这会让调度软件、检查点、队列设计和业务分级获得与芯片同等重要的位置,也可能使可延迟的训练任务成为电网调峰资源。

但官方数字仍有四个边界。第一,24%来自19节点对16节点的特定比较,不是单节点提速。第二,功率下降不等于总能耗同比例下降,任务延长会改变累计电量。第三,Token吞吐没有衡量答案质量与业务成功率。第四,NVIDIA称下一代适合环境可容纳更多GPU或获得更高吞吐,其中包含预测,需等待独立部署验证。

可立即执行的检查表

  • 给训练、离线推理、在线推理分别标注可暂停时长与延迟目标。
  • 记录节点实际功率而非只看额定功率,找出长期未使用的余量。
  • 在小集群做80%、90%、100%功率上限对照,比较吞吐、耗时和能耗。
  • 测试暂停、检查点和恢复,确认降载不会丢失数小时训练进度。
  • 同时看每兆瓦Token、每任务成本、尾延迟和正确率,避免单指标优化。
  • 把厂商结果视为假设,在自己的模型、批量与网络拓扑上复现。

若团队没有机架级遥测、任务优先级或可恢复检查点,不适合直接做自动电网响应;先完善可观测性更重要。若负载主要是毫秒级交易或医疗实时服务,也不应为追求电价收益频繁抢占。

如果算力必须随电价和电网波动,你会优先暂停训练、批处理还是在线推理?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。