惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

F
Fortinet All Blogs
WordPress大学
WordPress大学
The Cloudflare Blog
云风的 BLOG
云风的 BLOG
博客园 - Franky
D
Docker
小众软件
小众软件
阮一峰的网络日志
阮一峰的网络日志
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Engineering at Meta
Engineering at Meta
MongoDB | Blog
MongoDB | Blog
U
Unit 42
M
MIT News - Artificial intelligence
B
Blog
GbyAI
GbyAI
C
Check Point Blog
P
Proofpoint News Feed
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
雷峰网
雷峰网
IT之家
IT之家
Google DeepMind News
Google DeepMind News
V
V2EX
Stack Overflow Blog
Stack Overflow Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
75%折扣 - 少数派
2026-04-26 · via 少数派

这次到底发生了什么

2026 年 4 月 25 日,DeepSeek 官方宣布,DeepSeek-V4-Pro API 在 2026 年 5 月 5 日 15:59 UTC 前限时 75% OFF。如果只是一次促销,这条消息未必值得单独写;更关键的是,官方把降价、1M context,以及 Claude CodeOpenCodeOpenClaw 的接入更新放在了同一条信息里。

这说明它在面向的,不只是普通聊天用户,而是已经在做 coding agent、长工作区、长链路工具调用的开发者和团队。官方给出的接入要求也很具体:Claude Code 需要把模型设为 deepseek-v4-pro[1m] 才能启用 1M contextOpenCode 需要升级到 v1.14.24+OpenClaw 需要升级到 v2026.4.24+

另一条来自第三方的推文进一步给出了一组更敏感的数据:在 1M context 下,V4-Pro 的每 token 计算量据称只有 DeepSeek-V3.227%KV cache 只有其 10%。这不是官方技术文档,因此还需要谨慎对待,但它至少解释了为什么这次讨论会迅速从“模型能力”转向“部署经济性”。

为什么这次值得关心

长上下文过去一直有一个现实问题:不是不能做,而是太贵,贵到很多团队只能在 demo 或少量高价值任务里使用。真正卡住 agent 普及的,往往不是模型会不会读 100 万上下文,而是你能不能承担长期运行、并发承载、上下文驻留和显存占用的账。

如果上述第三方数据接近事实,影响会集中在几个非常具体的地方:

  • 同样的 GPU 资源上,能承载更多并发用户
  • 更长上下文不再只存在于“理论支持”,而可能进入默认配置
  • 持久工作区、长会话 coding、跨多步工具调用的产品形态更容易成立
  • serving 成本下降后,团队更有可能把长时 agent 从试验品推进到正式功能

真正重要的点不是“便宜了”,而是“长上下文 agent 到底跑不跑得起”第一次被推进了采购和架构决策层。对做基础设施的人,这和一次常规模型升级不是一回事。

真正该怎么判断

这里最容易出现的误解,是把“75% 折扣”直接等同于“已经是同类最优解”。现有材料还不能支持这个结论。

原因有三个:

  • 输入材料没有给出折扣前后绝对价格,无法直接和其他模型横向比较
  • 27% 计算量与 10% KV cache 来自第三方推文,不是当前材料里的官方文档
  • 现有信息没有覆盖质量、延迟、稳定性、失败率这些真正影响生产迁移的指标

所以更稳妥的判断是:这次事件把“长上下文是否值得大规模上生产”从抽象讨论变成了可测试的问题,但还没有把答案一次性给完。

哪些人该立刻试,哪些人不用急

我更建议三类团队优先做小规模验证:

  • 做 agent infra 的团队,尤其是已经在算 GPU 并发和显存账的人
  • 做长工作区产品的团队,比如长会话编程、持续研究、复杂项目协作
  • 需要长链路工具调用的团队,因为上下文驻留成本会直接影响可用性

相反,如果你的场景主要是短对话问答、轻量生成、偶发工具调用,这次消息未必会立刻改变你的产品结构。你当然能从降价中受益,但这不是最值得你关心的核心变量。

我建议怎么应对

不要先问“要不要全面切模型”,先问“我们的成本真正花在哪里”。一个比较务实的验证框架是:

1. 选 2 到 3 个确实依赖长上下文的任务,而不是拿短问答做测试。 2. 同时记录任务完成率、平均延迟、上下文命中率、失败重试率和总成本。 3. 单独观察长会话后段质量是否下降,因为很多 agent 问题不是出在第一步,而是出在第十步之后。 4. 把“能开 1M context”和“应该默认开 1M context”分开判断。

这次消息最值得认真看的地方,不是一次促销,而是它让长上下文第一次更像一笔能被精算、能被 rollout、也能被复盘的生产投资。对真正做 agent 的团队来说,这比任何一句“模型更强了”都更重要。 #DeepSeek #长上下文 #AIAgent #模型定价 #AI基础设施