惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
美团技术团队
腾讯CDC
V
V2EX
G
Google Developers Blog
博客园 - Franky
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
阮一峰的网络日志
阮一峰的网络日志
Microsoft Azure Blog
Microsoft Azure Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
T
The Blog of Author Tim Ferriss
Recent Announcements
Recent Announcements
Google DeepMind News
Google DeepMind News
罗磊的独立博客
C
Check Point Blog
MyScale Blog
MyScale Blog
aimingoo的专栏
aimingoo的专栏
F
Fortinet All Blogs
酷 壳 – CoolShell
酷 壳 – CoolShell
V2EX - 技术
V2EX - 技术
The Last Watchdog
The Last Watchdog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
有赞技术团队
有赞技术团队
Security Archives - TechRepublic
Security Archives - TechRepublic
S
Security @ Cisco Blogs
W
WeLiveSecurity
D
DataBreaches.Net
Forbes - Security
Forbes - Security
V
Visual Studio Blog
P
Proofpoint News Feed
S
Secure Thoughts
H
Help Net Security
Cloudbric
Cloudbric
云风的 BLOG
云风的 BLOG
Microsoft Security Blog
Microsoft Security Blog
N
News and Events Feed by Topic
Schneier on Security
Schneier on Security
Engineering at Meta
Engineering at Meta
Attack and Defense Labs
Attack and Defense Labs
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
S
Security Affairs
L
LangChain Blog
Last Week in AI
Last Week in AI
Martin Fowler
Martin Fowler
Hacker News: Ask HN
Hacker News: Ask HN
H
Heimdal Security Blog
M
MIT News - Artificial intelligence
The Register - Security
The Register - Security

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
“我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好
Tina · 2026-04-27 · via InfoQ - 促进软件开发领域知识与创新的传播

2026 年 4 月 23 日,OpenAI 做了两件事:发布了 GPT-5.5,并把价格翻了一倍。

按常理,这应该是属于 OpenAI 的一天。全新预训练架构“Spud”的首个公开版本,SOTA 级的基准测试成绩,SemiAnalysis 在第一时间给出了“GPT-5.5 已经抵达前沿”的评价。但翻看定价页面,开发者很难不算账:每百万输出 token 收费 30 美元,比前代 GPT-5.4 贵了一倍,甚至比一贯以昂贵著称的 Claude Opus 4.7 还要贵出一截。

而仅仅过了不到一天,4 月 24 日,DeepSeek 把 V4 的模型权重扔到了 HuggingFace 上。MIT 开源协议,100 万 token 上下文窗口,以及一个极其低廉的价格:输出 token 每百万 3.48 美元。

大概只有 GPT-5.5 的十分之一。

科技博主兼 AI 系统架构师 Sean Donahoe 在今天凌晨发了一条帖子。他写道:

“DeepSeek V4 Pro 在编码基准测试中击败了 Claude Opus 4.6 和 GPT-5.4......今天早上,我把 Claude Code、Codex、Cursor、Aider,以及我用的所有其他编程智能体全部指向了 DeepSeek 端点。不用 OpenRouter,不用代理,原生 API。我的月账单将下降 90% 以上,而且效果比昨天还好。”

这条帖子实际上有两个看点。第一,发帖人是重度 AI 编程用户,却几乎一夜之间完成迁移,月账单会从几千美元降到几百美元。第二,他不只是说便宜,还强调效果没有变差,反而更好:“输出质量提高了,而不是下降,这一点已经通过内部测试以及多个公开基准验证”。

DeepSeek 出手之后,价格成了第一变量

过去三个月,模型竞争激烈。几乎每周都有一家头部模型厂商发布新的 coding checkpoint,GLM-5.1、Qwen3.6-Plus、Kimi K2.6、Composer 2、Gemini 3.1 Pro,都在强调同一件事:agentic coding、长任务、多步骤规划。

进入 4 月,圈子里一直在讨论两个代号:Anthropic 的“Capybara”和 OpenAI 的“Spud”。4 月 23 日,GPT-5.5 正式发布,成为基于“Spud”的公开版本。对 OpenAI 来说,这是 GPT-4.5 之后一次很关键的预训练模型更新,外界期待很高,价格也不低。有分析指出,虽然 NVIDIA 和 OpenAI 都提到 GPT-5.5 在 10 万台 GB200 NVL72 集群上“训练”,但这里的“训练”更准确地说是强化学习的后训练阶段。真正的预训练,仍然是在 Hopper 平台上完成的。

但只过了不到 24 小时,DeepSeek V4 开源。模型竞争一下子不只是在比谁更强,也开始比谁更便宜。

OpenAI 的旗舰模型过去通常比 Anthropic 更便宜,但这一次不一样了:GPT-5.5 的 API 定价为每百万输入 token 5 美元、每百万输出 token 30 美元,比前代 GPT-5.4 贵了一倍,甚至比 Claude Opus 4.7 的输出定价还贵出一截。

更值得注意的是,OpenAI 为 GPT-5.5 设计了一套复杂的定价分层。除了标准 API 之外,OpenAI 还提供了一个优先级(priority)套餐,价格是标准档的 2.5 倍。如何为“更快的 token”收更多钱,正在变得越来越关键。这里需要说明的是,priority 和 fast mode 是两回事。fast mode 只是给出一些相对模糊的承诺,比如“价格贵 6 倍,速度大约快 2.5 倍”;而 priority 提供的是更保守但更明确的 SLA(例如:99% 的时间里吞吐量超过 50 tokens/s)。

这还没算 GPT-5.5 Pro——专为科学研究和长程推理设计的版本,输入/输出定价分别为每百万 token 30 美元和 180 美元,瞄准的不是日常编码场景,而是前沿科研用例。

标准版和 Pro 版都提供多档推理强度:xhigh、high、medium、low 以及 non-reasoning,本质是在成本与能力之间做取舍。从 strawberry/o1 那一代开始,这一点已经很明确了:推理强度越高,结果通常越好,但消耗的 token 更多,响应时间也更长。

在 GPT-5.5 发布前一周,Anthropic 刚刚推出 Claude Opus 4.7。相比 4.6,Opus 4.7 更像一次小幅升级,没有带来明显质变。

Token 计数方式的更新,是这次定价变化里最关键的一点。4.7 使用了新的 tokenizer,通过更细粒度的切分来换取性能提升,但代价是整体 token 用量会上升。官方也直接承认,这会带来最高约 35% 的 token 增长——换句话说,价格也等于变相上涨了 35%。

然后 DeepSeek V4 来了。

V4 系列包含两个模型:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。前者参数规模为 1.6T 总参数 / 49B 激活参数,后者为 284B / 13B。相比 V3(671B / 37B)是一次升级,而 Flash 是一个更轻量的下探版本。这使得 DeepSeek-V4-Pro 成为目前规模最大的开源权重模型

把价格拉出来对比,差距大到让人无法忽视。简单算一笔账:同样处理一百万输入 token 和一百万输出 token,GPT-5.5 的合计成本是 35 美元,Claude Opus 4.7 是 30 美元。而 DeepSeek-V4-Pro 是 5.22 美元。如果输入命中缓存,输入价格进一步降至每百万 token 0.145 美元,同样这笔账就变成了 3.625 美元。

也就是说,在标准定价下,DeepSeek-V4-Pro 的成本大约是 GPT-5.5 的七分之一、Claude Opus 4.7 的六分之一。如果缓存命中,差距进一步拉大——大约是 GPT-5.5 的十分之一、Claude Opus 4.7 的八分之一。

真正把价格压到“近零地带”的,是 DeepSeek-V4-Flash。V4 Flash 的 API 输入价格每百万 token 仅 0.14 美元,输出价格 0.28 美元,合计 0.42 美元。缓存命中后进一步降至 0.308 美元。同等输入输出量下,Flash 的成本不到 GPT-5.5 和 Claude Opus 4.7 的 2%——便宜了 98% 以上,几乎只有对方的百分之一。

如果把当前主流模型的定价放在一张表里看,这种分化更加直观:

更重要的是,DeepSeek V4 走的是 MIT 开源协议。这意味着开发者完全可以把模型部署在自己的服务器上,不走 API 调用,直接绕开 token 计费逻辑。对于有合规要求、数据不能出域的场景,这个选项的权重甚至超过价格本身。

V4 相比 V3 的核心进展,是上下文窗口从 128k 提升到了 1M。因此,这一代的技术优化几乎都围绕长上下文展开,包括:

  • Compressed Sparse Attention(CSA):压缩稀疏注意力

  • Heavily Compressed Attention(HCA):高压缩注意力

  • Manifold-Constrained Hyper-Connections(mHC):流形约束超连接

对应的效果是:“在百万 token 上下文场景下,DeepSeek-V4-Pro 的单 token 推理 FLOPs 仅为 V3.2 的 27%,KV cache 仅为 10%。”也就是说,KV cache 减少了 90%。这个幅度甚至超过了上个月 Google TurboQuant 的论文,对 NAND Flash 产业链来说,是个需要警惕的信号。

在工程层面,DeepSeek 还在 DeepGEMM 中开源了一个 Mega-Kernel,宣称支持 NVIDIA GPU 和华为 Ascend NPU。可以看出,他们的目标之一,是未来在 Ascend 上承载一部分推理流量。官方 API 页面还提到,受限于高端算力,目前 V4-Pro 的服务吞吐仍有限,预计下半年昇腾 950 超节点批量上市后,Pro 价格会大幅下调。

业界实测效果

三款模型,三种定价逻辑:OpenAI 在涨,Anthropic 在偷偷涨,DeepSeek 则直接掀桌。如果只看数字,选择几乎没有悬念。

不过,DeepSeek 自己也承认,和顶尖选手之间还有距离。他们在技术报告里写道:“通过增加推理 token 的使用量,DeepSeek-V4-Pro-Max 在标准推理基准上优于 GPT-5.2 和 Gemini-3.0-Pro,但仍略逊于 GPT-5.4 和 Gemini-3.1-Pro,距最前沿模型大约还有 3 到 6 个月的差距。”

那么,实际效果如何呢?

在 Sean 宣布全面迁移的同一天,AI 研究员 Rohan Paul 和他的团队做了一个测试:给 DeepSeek V4 Pro 和 GPT-5.5 同一份提示词,开发一个完整的卡丁车竞速游戏,全部塞进一个 HTML 文件。

提示词严苛到像一份游戏策划需求书:Canvas 渲染,方向键和 WASD 双套操控,加速、刹车、漂移、倒车一个不能少。物理引擎从零手写,摩擦力、最高速度、转向灵敏度全部要调。赛道有路面、草地、弯道和窄路,冲上草地减速,撞墙弹回。至少 3 辆 AI 对手,自动沿赛道行驶,速度各异。道具系统要有金币、加速板和随机道具箱。画面全用 Canvas 形状手绘,漂移拖痕、加速尾焰、屏幕震动,一个视觉效果都不落。音效用 Web Audio API 合成,倒计时、碰撞、冲线都要出声。UI 要完整:标题画面、3-2-1 倒计时、实时 HUD、结束排名。

最终的数据对比是这样的:

DeepSeek V4 Pro 输出了近两倍的 token,但便宜了 4.3 倍。至于两个游戏跑起来分别是什么样子,我们直接上视频,你自己体验。

如果说卡丁车测试考察的是“能不能做一个完整产品”,那同一天另一个测试考察的则是更微妙的东西——审美。做出来的页面“好不好看”,任何人都能一眼判断。

中文技术社区的一位开发者用同样的提示词、同样的工具,让 DeepSeek V4 Pro 和 GPT-5.5 各自生成一个 Apple 风格的天气界面。提示词给了一个很高的起点:

“你是 Apple Inc 的顶级 UI 设计师,以 iOS 18 的设计风格(毛玻璃效果、高斯模糊、动态渐变、细腻阴影)创建一个单个 HTML 文件。实现横板天气页面,包含 4 个并排的动画天气卡片:晴天(太阳光线、动态光晕)、大风(飘动云朵、摇曳树木、风线)、暴雨(下落雨滴、形成水洼、闪电)、暴雪(下落雪花、堆积效果)。卡片需深色背景,支持按钮切换天气状态,实现流畅交互和微动效。代码必须可直接运行,美观度优先。”

工具也完全统一,两个模型生成时,用的都是 Claude Code。你猜哪个是 DeepSeek 的?

不过,在日常问题上,DeepSeek 确实更强:

科技博主 Simon Willison 有一个习惯:每次 DeepSeek 发布新版本,他都会用同一句提示词 “Generate an SVG of a pelican riding a bicycle”,生成一张鹈鹕骑自行车的 SVG。这次 V4 发布,他照例做了一遍,也照例把历代结果放在一起。

从 2025 年 3 月的 V3,到 8 月的 V3.1,再到 12 月的 V3.2,以及现在的 V4,每一版都比上一版更像样。早期的鹈鹕歪歪扭扭,脚踏板对不准,自行车架子也松散。到了 V3.2,车架结实了,鹈鹕也开始像个正经骑手。这次 V4-Flash 又往前走了一步:链条画出来了,前轮加了反光片,翅膀搭在车把上,脚也踩到了踏板上。总之,是一次比一次好。

DeepSeek-V3-0324

DeepSeek-V3.1

DeepSeek-V3.2

DeepSeek-V4 Flash

DeepSeek-V4 Pro

DeepSeek 在 V4 发布当天,用一句话表明了他们对这些讨论的姿态——“不诱于誉,不恐于诽,率道而行,端然正己。”

这也恰好解释了这只鹈鹕一年来的轨迹。

参考链接:

https://x.com/rohanpaul_ai/status/2047762509474726285

https://simonwillison.net/2026/apr/24/deepseek-v4/

https://linux.do/t/topic/2045480

https://venturebeat.com/technology/deepseek-v4-arrives-with-near-state-of-the-art-intelligence-at-1-6th-the-cost-of-opus-4-7-gpt-5-5

https://www.facebook.com/groups/techtitansgroup/posts/1642732440387401/