惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

SecWiki News
SecWiki News
罗磊的独立博客
U
Unit 42
I
InfoQ
B
Blog RSS Feed
Google DeepMind News
Google DeepMind News
J
Java Code Geeks
Blog — PlanetScale
Blog — PlanetScale
The GitHub Blog
The GitHub Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
B
Blog
S
SegmentFault 最新的问题
V
Visual Studio Blog
Engineering at Meta
Engineering at Meta
Microsoft Security Blog
Microsoft Security Blog
月光博客
月光博客
Vercel News
Vercel News
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
A
About on SuperTechFans
博客园 - 三生石上(FineUI控件)
博客园_首页
腾讯CDC
F
Fortinet All Blogs
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Hugging Face - Blog
Hugging Face - Blog
MongoDB | Blog
MongoDB | Blog
阮一峰的网络日志
阮一峰的网络日志
D
Docker
N
Netflix TechBlog - Medium
云风的 BLOG
云风的 BLOG
Apple Machine Learning Research
Apple Machine Learning Research
Microsoft Azure Blog
Microsoft Azure Blog
Martin Fowler
Martin Fowler
人人都是产品经理
人人都是产品经理
酷 壳 – CoolShell
酷 壳 – CoolShell
爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
V
V2EX
Last Week in AI
Last Week in AI
博客园 - 司徒正美
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
IT之家
IT之家
L
LangChain Blog
WordPress大学
WordPress大学
Y
Y Combinator Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
M
MIT News - Artificial intelligence
The Cloudflare Blog
T
The Blog of Author Tim Ferriss
宝玉的分享
宝玉的分享

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
DeepSeek-Lane:在 Cursor 内使用 DeepSeek V4 模型
guangzan · 2026-05-12 · via 博客园_首页

如果你是 Cursor 用户,刚看到 DeepSeek V4 发布,打算把它配置成 Composer 的后端模型,大概率会碰到这个错误:

{
  "error": {
    "message": "reasoning_content in the thinking mode must be passed back to the API.",
    "type": "invalid_request_error"
  }
}

这个报错通常在第二轮对话就出现——Cursor 发起工具调用后,DeepSeek 的 API 直接返回 400。根本原因在于 DeepSeek 的思考模式(thinking mode)有一个特殊要求:当对话中包含工具调用时,后续请求必须原封不动地回传此前积累的 reasoning_content 链条。而 Cursor 在处理工具调用请求时,直接丢弃了这个字段,导致校验失败。

我因此做了 deepseek-lane,一个运行在本地的轻量代理,专门负责在 Cursor 与 DeepSeek API 之间补全缺失的 reasoning_content,同时提供流式推理展示、ngrok 公网隧道等一系列实用功能。

架构总览

直观起见,先用一张图展示代理在整个请求链路中的位置与处理流程:

flowchart LR A[Cursor IDE] -->|HTTP 请求| B[deepseek-lane<br/>本地代理] B -->|规范化 & 注入 reasoning_content| C[上游 API<br/>DeepSeek / opencode] C -->|流式响应| B B -->|SSE 累加 & 推理展示| A B -->|持久化 reasoning 链| D[(SQLite 缓存)] C2[ngrok] -->|公网 HTTPS 隧道| B

请求首先到达代理而非直接发往上游 API。代理对载荷进行规范化处理、从 SQLite 缓存中查找并注入缺失的 reasoning_content,然后将转换后的请求转发给上游。收到流式响应后,代理逐块累积 SSE 事件、将推理 token 镜像为 Cursor 可见的 Markdown 折叠块,同时把新的推理内容写回缓存以供后续请求使用。

下面逐一展开每个环节背后的设计考量。

问题剖析:为什么偏偏是 reasoning_content 出问题?

要理解这个问题的本质,需要先搞清楚 DeepSeek 思考模式下工具调用对话的完整生命周期。

正常对话流程

一次包含工具调用的完整对话大致遵循以下时序:

sequenceDiagram participant U as 用户 participant C as Cursor participant D as DeepSeek API U->>C: 提问 C->>D: 请求(含 messages) D->>C: 响应(含 reasoning_content + tool_calls) C->>D: 工具调用结果(需回传 reasoning_content) D->>C: 最终回复 C->>U: 展示答案

关键在于第三步:当 DeepSeek 在第一轮回复中返回 reasoning_contenttool_calls 之后,客户端在下一轮请求中必须reasoning_content 原样带回。这不是可选的——API 层有严格的校验逻辑,一旦缺失就直接返回 400。

Cursor 这边发生了什么

Cursor 本身是一个对 OpenAI 兼容 API 做了一层封装的 IDE 客户端。它在构造后续请求的 messages 数组时,会保留 rolecontenttool_callstool_call_id 等核心字段,但 reasoning_content 不在它的关注范围内——于是直接丢弃。等到第二轮请求发出去,DeepSeek 一校验就炸了。

代理的切入点

deepseek-lane 恰恰在这个环节介入:它缓存每一轮上游返回的 reasoning_content,在接受 Cursor 的后续请求时检查是否有缺失,如果有就从缓存中注入。对 Cursor 而言,它只是在和一个普通的 OpenAI 兼容 API 对话;对 DeepSeek 而言,它收到的请求字段是完整的。

核心机制一:请求规范化——不只是注入 reasoning_content

在代理收到 Cursor 请求后,第一步是规范化。这一阶段主要完成三件事:

1. 字段裁剪

Cursor 发出的请求可能携带一些 DeepSeek API 不支持的字段(比如某些 OpenAI 特有参数)。代理通过白名单机制裁剪载荷,只保留上游真正需要的字段:

const SUPPORTED_REQUEST_FIELDS = new Set([
  "model", "messages", "stream", "stream_options",
  "max_tokens", "response_format", "stop", "tools",
  "tool_choice", "thinking", "reasoning_effort",
  "temperature", "top_p", "presence_penalty",
  "frequency_penalty", "logprobs", "top_logprobs", "user",
  "seed", "n", "logit_bias",
]);

prepareUpstreamRequest 函数遍历 Cursor 请求中的所有字段,只保留白名单内的部分。对于 messages 数组中的每条消息,同样按角色对应的字段集合过滤——例如 assistant 消息允许保留 reasoning_content,而 usersystem 消息不需要这个字段。

2. 旧版 API 兼容转换

部分早期客户端可能还在使用 functions / function_call 而非 tools / tool_choice。代理在规范化阶段自动完成格式转换,确保无论客户端实现如何,上游都能正确解析。

3. 推理内容注入

这是最关键的一步。代理在收到 Cursor 请求后,检查 messages 数组中每条 assistant 消息是否携带 reasoning_content。如果某个 assistant 消息含有 tool_calls 却缺少 reasoning_content,代理就从本地缓存中查找并补全:

export function prepareUpstreamRequest(
  body: ChatCompletionRequest,
  config: ProxyConfig,
  store: ReasoningStore
): PreparedRequest {
  // ...遍历 messages,对每条 assistant 消息检查 reasoning_content...
  const cacheEntry = store.get(lookupKey);
  if (cacheEntry) {
    // 从 SQLite 缓存中命中,注入缺失的 reasoning_content
    msg.reasoning_content = cacheEntry.reasoningContent;
  }
  // ...
}

PreparedRequest 类型中还包含一个 omittedToolCallIds 字段,记录因缓存缺失无法恢复的工具调用 ID。如果配置了 missingReasoningStrategy: 'reject',代理会在发现缓存缺失时直接拒绝请求;默认的 recover 策略则会继续处理并通过系统消息告知模型上下文存在截断。

核心机制二:推理缓存与会话隔离

reasoning_content 的缓存管理是整个系统最精妙的部分——它必须在「精确匹配」和「容错弹性」之间找到平衡。

为什么需要会话级隔离

在多标签页或多项目并行使用时,Cursor 可能同时维持多个独立对话。不同对话可能产生完全相同的 tool_call_id(比如都以 call_1 开头)。如果缓存只看 tool_call_id,跨对话的数据污染将不可避免。因此代理使用对话上下文的 SHA-256 哈希作为命名空间,确保缓存映射只在同一会话内有效:

export function conversationScope(
  messages: ChatMessage[],
  namespace = ""
): string {
  const scopeMessages = messages.map(canonicalScopeMessage);
  const payload = namespace
    ? { namespace, messages: scopeMessages }
    : scopeMessages;
  return sha256(JSON.stringify(payload));
}

canonicalScopeMessage 将每条消息规整为仅含 rolecontentnametool_call_idprefixtool_calls 的结构,排除 reasoning_content 本身(否则会形成循环依赖),然后对整个消息列表做哈希。两条不同对话虽然都有 call_1,但各自的上下文哈希值截然不同,自然不会互相干扰。

便携缓存键:跨作用域恢复

会话作用域并非一成不变。比如用户在对话中开启新的 Composer 会话,上下文可能发生变化,导致此前的缓存键命中失败。为此代理会为每条缓存记录尝试计算跨作用域的便携别名。具体而言,它取当前消息列表中找到最后一个 user 消息的位置,从该位置往前回溯直到遇到另一个 user 消息(或到达列表开头),将这段连续的对话片段作为备用键。当主键匹配失败时,便携别名提供二次匹配机会,大大提高了缓存的复用率。

SQLite 持久化与过期策略

缓存使用 SQLite 本地存储,支持可配置的 TTL(过期时间)和行数上限。即使代理重启,之前的推理链依然可以恢复——只要旧请求再次命中相同的对话上下文。

KV 缓存兼容性:克制才是最好的设计

DeepSeek API 支持上下文硬盘缓存:如果两个请求在 prompt 前缀上有重叠(比如多轮对话中使用相同的系统提示和早期聊天记录),重叠部分的 KV 矩阵可以直接从缓存读取,无需重复计算,从而降低延迟和费用。

代理在这一点上的设计原则是最小干预——不注入任何合成的时间戳、线程 ID 或其他元数据到请求内容中。这样 Cursor 在连续对话中发出的请求在 DeepSeek 服务端看起来与直接调用几乎一致,历史前缀重合度越高,KV 缓存命中概率就越高。

核心机制三:流式响应的推理展示

DeepSeek 思考模式下,API 响应的流式 SSE 事件中会交替出现 reasoning_content(推理过程)和 content(最终回答)。但对于 Cursor 终端用户来说,如果推理过程完全不可见,用户体验会大打折扣——你只能干等,不知道模型在「想」什么。

StreamAccumulator 类负责累积接收到的 SSE 事件,并在整个流式传输过程中维护一份完整的推理历史。它追踪每个事件块的增量内容,确保最终缓存到 SQLite 中的推理文本与 API 实际输出的完全一致:

export class StreamAccumulator {
  content = "";
  reasoning = "";
  toolCalls: Map<number, ToolCallAccumulator> = new Map();
  finishReason: string | null = null;
  usage: ChatUsage | null = null;

  addDelta(delta: DeltaChoice): void {
    if (delta.content) this.content += delta.content;
    if (delta.reasoning_content) this.reasoning += delta.reasoning_content;
    // 累积 tool_calls 增量...
  }
}

CursorReasoningDisplayAdapter 更进一步——它把原始 reasoning_content 流实时转换为 Markdown 格式的折叠块:

<details>
<summary>Thinking</summary>

...推理内容...

</details>

在 Cursor 的聊天面板中,这些块会以可折叠区域的形式呈现,用户可以展开查看模型的完整推理过程,也可以折叠以减少干扰。这既保留了思考链的可审计性,又不会让聊天面板被大量中间推理 token 淹没。

核心机制四:ngrok 公网隧道

Cursor 有一项不容忽视的限制:自定义 API 的 Base URL 必须是公网可访问的 HTTPS 地址,不接受 localhost 或局域网 IP。这意味着即便代理在本地 127.0.0.1:9000 正常运行,Cursor 也无法直接连接。

传统的解决办法包括手动申请域名、配置 HTTPS 证书、设置端口转发等,对只想快速使用的开发者来说颇有门槛。deepseek-lane 直接集成了 ngrok SDK——配置好 authtoken 后,启动代理时间会自动创建一条公网 HTTPS 隧道,并在终端打印完整的公开 URL。对于不需要隧道的场景(比如使用 Cloudflare Tunnel 或在内网部署),也可以通过 --no-ngrok 关闭。

其他值得关注的细节

自动恢复机制

如果某个请求的对话历史中有一段推理内容因缓存过期而丢失,代理会在请求中插入一条系统消息,告知模型「较早的推理上下文已不可恢复,后续上下文可能不完整」,让模型能够自行调整。默认的 recover 策略允许在这样的条件下继续对话,而非直接中断。

Cursor 思考块的剥离

有时上游响应中可能包含 Cursor 格式的 <thinking> 标签(这些是 Cursor 自行注入的),代理通过正则表达式 CURSOR_THINKING_RE 在向上游转发请求时将其剥离,避免这些冗余内容干扰 API 处理。

交互式向导

首次运行 dsl start 时,代理会启动一个交互式设置向导,引导用户完成 API 提供商、默认模型、端口、推理强度、ngrok 等基础配置。配置项统一保存在 ~/.deepseek-lane/config.yaml 中,后续启动直接读取。

Quick Start

从零开始的完整配置不超过五分钟:

# 前置条件:Node.js 20+
# 1. 注册 ngrok 并配置 authtoken(免费账户即可)
brew install ngrok
ngrok config add-authtoken <你的-token>

# 2. 全局安装并启动
npm install -g deepseek-lane
dsl start

# 首次运行会进入交互式配置向导,完成后终端会打印:
# ✓ Model: deepseek-v4-pro (thinking, max)
# ▸ Local:  http://127.0.0.1:9000/v1
# ▸ Public: https://your-tunnel.ngrok-free.dev/v1

image

然后在 Cursor 的 Settings → Models → Add Custom Model 中将 Base URL 设为 ngrok 公开地址、API Key 填上你的 opencode 订阅密钥或 DeepSeek API Key,就可以在模型选择器中找到 deepseek-v4-pro / deepseek-v4-flash 并正常使用了。

image

更多配置项(自定义端口、推理强度、是否显示推理过程等)请参见项目的 README中文说明

写在最后

感谢 deepseek-cursor-proxy 提供的灵感。

其实这个小工具非常简单,最早的功能就是解决一个具体的 400 错误。在实现过程中,逐渐延伸出了推理展示、多对话隔离、自动恢复、便携缓存键等一整套围绕 reasoning_content 的基础设施。如果你也在用 Cursor + DeepSeek 思考模式做开发,欢迎在 GitHub Issues 中反馈使用体验或提出功能建议。

Github 仓库地址是 https://github.com/guangzan/deepseek-lane,欢迎使用、star 🌟!