

























2026 年 4 月 25 日,DeepSeek 官方宣布,DeepSeek-V4-Pro API 在 2026 年 5 月 5 日 15:59 UTC 前限时 75% OFF。如果只是一次促销,这条消息未必值得单独写;更关键的是,官方把降价、1M context,以及 Claude Code、OpenCode、OpenClaw 的接入更新放在了同一条信息里。
这说明它在面向的,不只是普通聊天用户,而是已经在做 coding agent、长工作区、长链路工具调用的开发者和团队。官方给出的接入要求也很具体:Claude Code 需要把模型设为 deepseek-v4-pro[1m] 才能启用 1M context,OpenCode 需要升级到 v1.14.24+,OpenClaw 需要升级到 v2026.4.24+。
另一条来自第三方的推文进一步给出了一组更敏感的数据:在 1M context 下,V4-Pro 的每 token 计算量据称只有 DeepSeek-V3.2 的 27%,KV cache 只有其 10%。这不是官方技术文档,因此还需要谨慎对待,但它至少解释了为什么这次讨论会迅速从“模型能力”转向“部署经济性”。
长上下文过去一直有一个现实问题:不是不能做,而是太贵,贵到很多团队只能在 demo 或少量高价值任务里使用。真正卡住 agent 普及的,往往不是模型会不会读 100 万上下文,而是你能不能承担长期运行、并发承载、上下文驻留和显存占用的账。
如果上述第三方数据接近事实,影响会集中在几个非常具体的地方:
真正重要的点不是“便宜了”,而是“长上下文 agent 到底跑不跑得起”第一次被推进了采购和架构决策层。对做基础设施的人,这和一次常规模型升级不是一回事。
这里最容易出现的误解,是把“75% 折扣”直接等同于“已经是同类最优解”。现有材料还不能支持这个结论。
原因有三个:
27% 计算量与 10% KV cache 来自第三方推文,不是当前材料里的官方文档所以更稳妥的判断是:这次事件把“长上下文是否值得大规模上生产”从抽象讨论变成了可测试的问题,但还没有把答案一次性给完。
我更建议三类团队优先做小规模验证:
相反,如果你的场景主要是短对话问答、轻量生成、偶发工具调用,这次消息未必会立刻改变你的产品结构。你当然能从降价中受益,但这不是最值得你关心的核心变量。
不要先问“要不要全面切模型”,先问“我们的成本真正花在哪里”。一个比较务实的验证框架是:
1. 选 2 到 3 个确实依赖长上下文的任务,而不是拿短问答做测试。 2. 同时记录任务完成率、平均延迟、上下文命中率、失败重试率和总成本。 3. 单独观察长会话后段质量是否下降,因为很多 agent 问题不是出在第一步,而是出在第十步之后。 4. 把“能开 1M context”和“应该默认开 1M context”分开判断。
这次消息最值得认真看的地方,不是一次促销,而是它让长上下文第一次更像一笔能被精算、能被 rollout、也能被复盘的生产投资。对真正做 agent 的团队来说,这比任何一句“模型更强了”都更重要。 #DeepSeek #长上下文 #AIAgent #模型定价 #AI基础设施
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。