惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
腾讯CDC
J
Java Code Geeks
博客园 - 【当耐特】
Microsoft Azure Blog
Microsoft Azure Blog
V
Visual Studio Blog
人人都是产品经理
人人都是产品经理
博客园 - Franky
博客园 - 聂微东
阮一峰的网络日志
阮一峰的网络日志
美团技术团队
云风的 BLOG
云风的 BLOG
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
U
Unit 42
雷峰网
雷峰网
B
Blog RSS Feed
博客园_首页
量子位
F
Fortinet All Blogs
罗磊的独立博客
H
Hackread – Cybersecurity News, Data Breaches, AI and More
酷 壳 – CoolShell
酷 壳 – CoolShell
C
Check Point Blog

青萍叙事

小程序用户注册完就不来了?我总结了 3 个召回策略 手机上就能克隆自己的声音,5 秒音频就够了 做了一个免费工具,被骂到不再维护,一人企业的现实困境 手把手教你给短视频配音,全程不花钱 签到、邀请、任务中心,一个小程序日活增长的完整复盘 什么都想做,是一人企业最贵的病 小程序上线30天,注册量超过了网站一整年 注册验证码被刷了一整夜,论接口限流的重要性 通过Hermes搭建AI驱动的全自动安全封禁系统 博客被攻击之后,我部署雷池防火墙给网站穿上防弹衣 个人博客第一次被攻击,评论区被植入恶意代码全记录 青萍AI图床:AI 生图接口文档 真心建议做一人企业的你,先把统一认证搞定 从个人公众号迁移到企业公众号经验总结 豆包千问集体下线智能体,是时候拥抱 Hermes Agent 了 配音兼职渠道怎么找?5 种渠道和 1 个避坑提醒 宝妈声音兼职去哪接单:三个平台横评,最后一个免费入驻每日自动派单 Hermes 浏览器工具:让 AI 替你操作网页 Hindsight for OpenCode:给每个项目装上专属记忆库 Hermes v0.17.0 最值得升级的理由:一个进程,管所有 Profile 音频可视化:从波形到视频的三种实现路径 Hermes 定时任务实战 真人配音兼职怎么找:几个渠道对比,末尾推荐一个免费入驻的 AI语音技术到底能做什么 AI漫剧之配音篇 用 Hermes Agent 搭了一条内容生产线 Hermes Gateway 飞书连接断开排查 2026精选5款热门AI配音软件 用 Hermes 打造 LLM Wiki 知识库:Karpathy 方法实战指南 用 Hermes 打造个人知识管理系统
DeepSeek V4-Flash 正式版来啦,原生支持 Response API
青萍叙事 · 2026-07-31 · via 青萍叙事
AIDeepSeekResponseAPI

前言

7 月 31 日,DeepSeek V4-Flash 正式版 API 上线公测。

比起模型本身的性能提升,这次更新里有个容易被忽略但很重要的变化,原生支持了 Response API 格式,还专门适配了 Codex。

可能有人会问,之前不是已经有 Chat API 了吗,为什么又来一个 Response API?

它俩到底差在哪?今天就来聊聊。

先说结论

Chat Completions API 是目前最通用的接口,几乎所有大模型平台都兼容,适合做对话类应用。

Response API 是 OpenAI 在 2025 年推出的新一代接口格式,设计上更贴近 Agent 场景,内置了联网搜索等工具,流式输出也是全新的事件驱动模型。

DeepSeek 这次选择跟进 Response API,核心目的是让 Codex 这类编程工具能零改造接入。

两个 API 长什么样

先看看两者的基本调用方式。

Chat API 你传一个 messages 列表,每条消息有 role 和 content,模型返回一个 completion。

Response API 你传一个 input,可以是纯字符串,也可以是一个 item 列表。另外多了个 instructions 参数,用来放系统指令,跟 messages 里的 system 消息是同一件事,只是换了个位置。

看起来差不多,但底层设计思路差别很大。

真正的区别在哪

内置工具

Chat API 的 tools 只支持 function,也就是你自己在代码里定义的函数。

如果你想联网搜索,得自己实现,模型只负责告诉你”我需要搜索”,剩下全靠你的后端去调。

Response API 直接内置了 web_search 工具,服务端帮你执行搜索,结果自动喂回给模型。

你只需要在 tools 里声明一个 web_search,模型自己决定什么时候搜、搜什么、怎么用结果。

这对 Agent 场景来说省了很多事,不用再手搓搜索逻辑了。

流式输出

Chat API 的流式输出比较朴素,服务端不断推 SSE 数据块,最后以 data: [DONE] 结尾。

你收到的是一段一段的文本增量,自己拼起来就行。

Response API 换了一套完全不同的事件驱动模型。

每个事件都有明确的类型,比如 response.created(响应已创建)、response.output_text.delta(文本增量)、response.reasoning_text.delta(思维链增量)、response.function_call_arguments.delta(函数调用参数增量)。

流以 response.completed 或 response.failed 结束,没有 data: [DONE]。

好处是你能精确知道模型在干什么,是在思考、在输出正文、还是在调用工具,不用猜。

思维链处理

Chat API 里思维链是通过 message 里的 reasoning_content 字段返回的,跟正文混在一起。

Response API 把思维链独立成了一个 reasoning 类型的 item,跟 message、function_call 平级。

这意味着你可以单独读取思维链内容,单独做处理,不用从消息体里去捞。

对需要展示推理过程的 Agent 应用来说,这个设计干净很多。

状态管理

两个 API 都是无状态的,服务端不存储会话历史。

区别在于,Response API 的设计天然支持 future state(有状态扩展),比如 OpenAI 原版支持 previous_response_id 来串联多轮对话。

不过 DeepSeek 目前不支持这个参数,多轮对话还是得客户端自己维护完整上下文。

Codex 适配

这次更新的另一个重点是 Codex 适配。

Codex(OpenAI 的编程工具)默认使用 Response API 格式跟模型通信。

之前 DeepSeek 只提供 Chat API,想用 Codex 的话需要额外的转换层。

现在 DeepSeek 原生支持了 Response API,开发者不用改 Base URL,直接在 Codex 配置里把模型换成 deepseek-v4-flash 就行。

官方还提供了 apply_patch 这个特殊的 custom 工具,专门给 Codex 的代码补丁功能用的。

对独立开发者来说,这意味着多了一个高性价比的编程 Agent 后端选择。

价格和限制

V4-Flash 的定价延续了 DeepSeek 一贯的路线。

百万 tokens 输入 1 元(缓存命中只要 0.02 元),输出 2 元。

并发限制 2500,比 V4-Pro 的 500 高了五倍。

注意有个峰谷定价机制,北京时间每天 9:00 到 12:00、14:00 到 17:00 是高峰时段,价格翻倍。

如果你想省钱,错峰用就行。

该选哪个

如果你只是做聊天机器人或者简单的文本生成,Chat API 完全够用,兼容性也最好。

如果你在做 Agent、需要联网搜索、用 Codex 编程、或者需要精细控制思维链的展示,Response API 是更好的选择。

两个 API 可以共存,不用非此即彼。

DeepSeek 表示 V4-Pro 将在 8 月初也支持 Response API,到时候选择面会更宽。

你打算用 Response API 还是继续用 Chat API?

有没有遇到过 Agent 开发里工具调用太麻烦的问题?

评论区聊聊你的选择。