惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

I
InfoQ
博客园 - 司徒正美
爱范儿
爱范儿
F
Fortinet All Blogs
J
Java Code Geeks
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
腾讯CDC
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
S
SegmentFault 最新的问题
Microsoft Security Blog
Microsoft Security Blog
T
The Blog of Author Tim Ferriss
V
V2EX
L
LangChain Blog
aimingoo的专栏
aimingoo的专栏
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog
Blog — PlanetScale
Blog — PlanetScale
GbyAI
GbyAI
A
About on SuperTechFans
有赞技术团队
有赞技术团队
Y
Y Combinator Blog

Java for You

AI写了80万行Rust,最值得学的却是它花十倍精力读代码 - Java for You - java4u 部署大模型别先选GPU,先回答你愿意承担多少运维 - Java for You - java4u 语音AI为什么总抢话?用VAD和打断机制做对实时对话 - Java for You - java4u AI每次提交都查漏洞,真正的升级是把证明链放进评审 - Java for You - java4u 把评测员请进AI实验室,独立性反而更难证明了 - Java for You - java4u 《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u
NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型 ...
蜗牛 · 2026-09-12 · via Java for You

深色笔记本

企业部署大模型时常问“该选哪个最强模型”,NVIDIA自己的供应链案例却给出另一个答案:一个针对业务决策训练的30B模型,在内部开发基准上明显超过更大的通用模型。差距不一定来自参数,而来自企业终于把专家当时看见什么、为什么这样选、结果如何,变成了可训练的数据。

发生了什么

NVIDIA在9月10日发布与Palantir合作的供应链技术案例。其硬件系统涉及大量零部件、供应商和制造地点,团队每周需要决定把稀缺材料分配到哪里,以缩短从零件到可用算力的时间。

量化部分由NVIDIA cuOpt处理,把问题表示成混合整数线性规划,考虑制造能力、物料依赖、到货时间和客户承诺。但历史回测显示,人类规划专家经常优于纯数学模型,因为他们还知道邮件沟通、天气、地缘事件和供应商会议中的信息。

团队因此记录每次分配决定、当时理由、预期结果和真实结果,再在治理环境中对Nemotron 3.5 Lightning 30B进行后训练。官方称,专用模型在内部开发基准上达到86.7%的分配决策准确率,比更大的Nemotron 3 Ultra高31.2个百分点。这个数字来自特定内部任务,不能外推为通用模型能力排名。

真正的资产是决策轨迹

传统企业数据通常只保存结果:买了多少、卖了多少、库存还有多少。模型若要学习专家判断,还需要保存决策发生时可见的证据、选择理由和后续结果。否则它只能看到“做了A”,不知道当时为什么没有做B。

mermaid diagram

评测方式也很关键。团队回放历史决策时,只给模型当时已经知道的信息,并隐藏未来结果,再比较模型建议、专家判断和实际表现。这避免了“拿未来信息回答过去问题”的数据泄漏。

为什么小模型可能胜过大模型

通用模型拥有广泛知识,却不了解一家公司的部件编码、制造约束和隐性决策习惯。专用模型参数更少,但任务边界更窄,训练样本更接近真实输入和评价标准。它不是整体更聪明,而是在一条明确跑道上接受了针对性训练。

这不代表每家公司都应该马上微调模型。很多团队甚至没有稳定记录专家理由,只有散落在聊天、邮件和个人经验中的结论。直接训练只会把口径不一、事后解释和历史偏见一起固化。

还要区分“专家做出的决定”和“后来证明有效的决定”。如果只拿历史操作做监督数据,模型学到的是组织过去怎么做;加入真实结果,才有机会判断那次选择是否值得复制。即便如此,结果也可能受运气和外部事件影响。训练样本最好同时保存可见证据、备选方案、置信度和事后结果,而不是把每次历史决定都贴上“正确答案”。

我的判断是,企业AI项目的第一步不应是采购训练集群,而是设计决策记录。让专家在工作过程中以低摩擦方式留下“输入、决定、理由、结果”,这份数据既能用于复盘,也能成为未来模型的评测集。没有评测集,就无法判断专用模型究竟在学习规律,还是复制历史习惯。

适用边界与实践建议

这套方法适合重复发生、结果可以观察、专家判断有规律可循的任务,例如库存分配、设备维护优先级和风险审核。不适合样本极少、结果多年后才出现,或价值判断无法压缩成统一正确答案的决策。

评测还应按时间切分,而不是随机打乱历史记录。相邻几周的供应链状态非常相似,随机划分可能让训练集和测试集包含几乎相同的局面,得到虚高分数。更可信的方法是用较早时期训练,用完整的后续时期测试,并在政策、供应商或产品世代发生变化后单独报告表现。企业数据会漂移,去年正确的经验可能正是今年需要摆脱的惯性。

团队可以先做一个不训练模型的版本:

  1. 选择每周重复出现的一类决策。
  2. 连续记录四周的输入、备选项、决定和理由。
  3. 事后补充结果,但保留当时信息快照。
  4. 用旧案例测试通用模型,并让专家盲评建议。
  5. 只有当错误模式稳定、数据足够一致时,再考虑后训练。

模型从人类反馈中学习,不等于模型在生产中自动重训。重要决策仍需版本控制、审批和回滚,不能让反馈闭环变成无人监管的自我强化。

你所在团队最值得沉淀成训练数据的专家判断是什么?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。