











本地模型是 llama.cpp + models Qwen3.8-27B-UD-Q4_K_M.gguf + mmproj-F16.gguf 方式部署启动的,如何向Cline、Continue中配置
你的 llama.cpp 部署方式,可以通过配置让 Cline 和 Continue 使用本地模型。关键在于 llama.cpp 提供了与 OpenAI 兼容的 API 接口,所以两个插件都可以通过 OpenAI Compatible 方式接入。
在配置插件前,需要先启动 llama-server。一个基础的启动命令如下:
./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080
-m:指定你的模型文件路径。--port 8080:指定服务端口,后续配置需要用到。注意:如果模型支持
--jinja模板,或需要加载mmproj文件(用于多模态),请根据实际情况添加相应参数。
Cline 没有内置的 llama.cpp 选项,需要选择 OpenAI Compatible 来接入。
步骤:
OpenAI Compatible。http://localhost:8080/v1(务必加上 /v1)。not-needed(本地服务不验证)。Qwen3.8-27B-UD-Q4_K_M(或任意能帮助你识别的名称)。保存后即可使用。
Continue 支持两种配置方式,推荐使用更灵活的 YAML 配置文件。
在项目根目录下创建 .continue/models/ 文件夹,并新建一个 llama.yaml 文件。填入以下内容:
name: Local Llama.cpp
version: 1.0.0
schema: v1
models:
- name: Qwen3.8-27B
provider: llama.cpp
model: Qwen3.8-27B-UD-Q4_K_M.gguf
apiBase: http://localhost:8080
roles:
- chat
- edit
- autocomplete # 如果需要代码补全功能
defaultCompletionOptions:
contextLength: 8192
保存后,Continue 会自动识别配置。
Ctrl+,),搜索 continue。Continue: Config 设置,点击 Edit in settings.json。{
"continue.models": [
{
"title": "Qwen3.8-27B (Local)",
"provider": "llama.cpp",
"model": "Qwen3.8-27B-UD-Q4_K_M.gguf",
"apiBase": "http://localhost:8080"
}
]
}
llama.cpp 的工具调用支持可能不完善,复杂任务(如自动创建文件)可能不如云端模型稳定。roles: [autocomplete] 角色,并设置 autocompleteOptions 参数优化体验。contextLength)。apiBase 的端口与 llama-server 启动时指定的 --port 一致。如果遇到连接问题,可以先在浏览器中访问 http://localhost:8080/v1/models,看是否能返回模型列表,以此确认服务是否正常运行。
这份配置存在多处错误,主要是 useLegacyCompletionsEndpoint 字段位置错误,以及部分模型参数定义不规范。我帮你重写了一份修正版:
name: Main Config
version: 1.0.0
schema: v1
models:
# =====================================================
# 主模型:Qwen3.8-27B(聊天+编辑+应用)
# =====================================================
- name: Qwen3.8-27B (Local)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- chat
- edit
- apply
defaultCompletionOptions:
contextLength: 8192 # 27B模型建议先设8192,稳定后可逐步调大
maxTokens: 4096 # 单次最大生成长度
temperature: 0.7
topP: 0.95
useLegacyCompletionsEndpoint: false
# =====================================================
# 长上下文模型(仅聊天,用于文档分析)
# =====================================================
- name: Qwen3.8-27B (Long Context)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- chat
defaultCompletionOptions:
contextLength: 32768 # 长上下文,量力而行
maxTokens: 4096
temperature: 0.5
useLegacyCompletionsEndpoint: false
# =====================================================
# 快速响应模型(轻量编辑任务)
# =====================================================
- name: Qwen3.8-27B (Fast)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- edit
- apply
defaultCompletionOptions:
contextLength: 4096
maxTokens: 2048
temperature: 0.3
useLegacyCompletionsEndpoint: false
| 错误点 | 原因 | 修复方案 |
|---|---|---|
useLegacyCompletionsEndpoint 位置错误 |
该字段属于模型级配置,不能放在 defaultCompletionOptions 内部 |
提升到与 provider、model 同级 |
contextLength: 1047576 过大 |
llama.cpp 本地服务支持不了百万级上下文 | 27B 模型建议先设 8192,根据实际显存/内存情况逐步调大 |
maxTokens: 32768/100000 过大 |
单次生成超长输出容易超时或 OOM | 建议设为 4096 以内 |
capabilities: [image_input] 无效 |
llama.cpp + Qwen3.8 不支持多模态 | 已移除该字段 |
| 模型命名混淆 | 三个模型都叫 OpenAI GPT-4.1 容易混淆 |
改为清晰区分功能的命名 |
Hermes 3 Llama 3.1 405B 无 apiBase |
缺少必要字段,且 405B 本地无法运行 | 已移除该无效配置 |
Autodetect 使用 Ollama |
你并未部署 Ollama,该配置无效 | 已移除 |
useLegacyCompletionsEndpointuseLegacyCompletionsEndpoint: false 表示使用 OpenAI 兼容的 /v1/chat/completions 接口(推荐)。如果设为 true,则会使用旧版的 /v1/completions 接口(仅适用于非对话模型)。
apiBase 地址 http://172.17.10.167:8080/v1 可访问。http://172.17.10.167:8080/v1/models,确认能返回模型列表。contextLength 建议从 8192 开始,如果运行稳定再逐步增加。保存配置后,重启 VSCode 即可生效。
不需要。使用本地模型(如你通过 llama.cpp 部署的模型)时,完全不需要注册或登录 Cline 账号。
Cline 支持两种模式,你可以根据需求选择:
Cline 账号模式(需要注册):通过注册账号使用 Cline 提供的云模型额度,或管理自己的 API 密钥。该模式适合不想自己管理 API 密钥的用户。
自带密钥/本地模型模式(无需注册):即 BYOK(Bring Your Own Key) 模式。使用自己的云端模型 API 密钥,或配置本地模型(如 Ollama/LM Studio)。使用本地模型时,不需要任何 API 密钥,只需确保本地模型服务(如 llama.cpp)正在运行即可。该模式适合注重隐私、希望完全离线使用或避免按量付费的用户。
OpenAI Compatible。not-needed),因为本地服务不验证密钥。llama.cpp 服务的地址,例如 http://172.17.10.167:8080/v1。qwen3.8)。完成以上配置后,Cline 就会直接与你的本地 llama.cpp 服务通信,整个过程完全不需要注册或登录任何账号。
报错问题:
CLINE返回如下信息:
[openai] 400400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it
{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}
(Click "Retry" below)
{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}
Auto-Retry Failed
Auto-retry failed after __3__ attempts. Manual intervention required.
这个错误很明确:你的请求(11745 tokens)超过了模型当前允许的上下文长度(8192 tokens)。
Cline 在发送请求时,会把以下内容全部计入上下文(n_prompt_tokens):
当这些内容加起来超过你设置的 contextLength: 8192 时,就会报错。
在 Cline 的设置中,将 Context Window Size 调大。
点击 Cline 面板右上角的 设置(⚙️)图标。
找到 Context Window Size 选项。
将数值从 8192 修改为 32768 或 65536。
注意:这个值需要与你的
llama-server启动时指定的-c参数匹配。如果你的llama-server启动命令中没有指定-c,默认值可能较小,需要加上-c 32768重启服务。
保存后,点击 "Retry" 重试。
即使你在 Cline 中设置了 32768,如果 llama-server 本身的上下文限制低于这个值,仍然会报错。
-c 或 --ctx-size 参数。llama-server,并加上参数:./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -c 32768
-c 的值 ≥ Cline 中设置的 Context Window Size。如果暂时不想改配置,可以做以下任一操作:
| 配置位置 | 推荐值 | 说明 |
|---|---|---|
| Cline 设置 | Context Window Size: 32768 |
27B 模型支持 32K 上下文较稳妥 |
| llama-server | -c 32768 或 -c 65536 |
必须 ≥ Cline 中的设置值 |
⚠️ 注意:上下文越大,显存/内存占用也越大,推理速度会变慢。如果设置 32768 后出现 OOM(内存不足),请逐步降低到
16384或24576试试。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。