惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG
B
Blog
博客园 - Franky
I
InfoQ
A
About on SuperTechFans
博客园_首页
L
LangChain Blog
量子位
腾讯CDC
Microsoft Security Blog
Microsoft Security Blog
博客园 - 【当耐特】
美团技术团队
V
V2EX
Apple Machine Learning Research
Apple Machine Learning Research
雷峰网
雷峰网
MongoDB | Blog
MongoDB | Blog
Microsoft Azure Blog
Microsoft Azure Blog
月光博客
月光博客
T
The Blog of Author Tim Ferriss
P
Proofpoint News Feed
G
Google Developers Blog
Last Week in AI
Last Week in AI

张洪Heo

OpenClaw 接管你的油猴脚本:让 AI 直接读改网页脚本,不用再复制粘贴 为 iPhone Duo 做设计:苹果官方设计原则全解读 看到了淘宝闪购的AI评论,引发了我的思考 如何在网页插入 livephoto ?实况照片 PVT 在线生成、动态JPG生成工具与嵌入工具 MacBook不进入休眠全新邪修:十几块钱的绿联HDMI欺骗器 OpenClaw 2.0:稳定性提升不少,我还迁移了我的记忆系统 将你的 HeoID 卡片添加到 Apple 钱包 智谱codingplan耐用程度分析:只用 GLM-5.3-Flash 够不够用? 软路由内网穿透访问方案全链路教程:从 ZeroTier 到 Nginx 再到 certd 证书管理 BrowserSkill上手:让AI接入浏览器,还能录制动作教它学习 我与我的 OpenClaw 凉透了焦虑和解了 ntfsmac 上手:不关 SIP 让 Mac 读写 NTFS 和 ext 硬盘 个人小项目vibecoding方案推荐:opencode spark 1.2 和 zcode 分享一下博客的全新聚合搜索 Mole Mac 上手:界面精美,优秀好用的Mac清理工具 Agentation 油猴脚本:让AI指哪改哪,配合 Claude Code 的开发神器 洪绘压图网页版上线,这下可以随时随地在线压缩图片了 分享一下我最近制作的一些AI音乐,以及解决唱歌错字和音质的一些小技巧 洪绘敲木鱼支持“竹知了”模式了,可以自定义音效的电子竹知了App 洪绘烧纸:一个网页在线电子烧纸,电子祭祀工具 WebMCP适配教程:为浏览器AI预备好,让网页向 AI 提供工具,本博客已支持 报错回顾:给OpenClaw添加错误行为记忆机制,让自己写的skill不断成长 腾讯miora上手:设计师又又又失业的一集? Mac 合盖不休眠:用 pmset 彻底禁止系统睡眠 如何用 OpenClaw 配置早报晚报,科技新闻信源、微博热搜获取 给 SearXNG 接入豆包搜索,解决 OpenClaw 信源难题 OpenClaw记忆系统升级:从memory-core到memory-lancedb-pro的迁移与配置 screenpipe:开源本地的 AI 记忆引擎,让电脑更懂你 混元hy3模型上手:腾讯送了云函数个人版6个月,怎么才能用上 给OpenClaw加上rm删除保护:防止AI误删你的整个电脑
给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案
张洪Heo · 2026-08-14 · via 张洪Heo

给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案摘要图

这篇文章介绍了作者使用 deepseek-v4-flash 作为 ZCode 主力模型时遇到的识图困扰:纯文本模型看不了图,截图发过去只剩文件路径。作者通过开源项目 zcode-deepseek-eye 给模型“借了一双眼睛”,挂一个支持视觉的子 Agent 自动读图并回灌文字描述。文章详细讲解了视觉子 Agent 的工作原理、安装步骤(skill 安装、双模型配置、重启验证)和踩坑点,帮助同样用纯文本模型的朋友快速上手。

我平时用 ZCode 配 deepseek-v4-flash 当主力模型。速度快、便宜、写代码够用,唯一的问题是它是个纯文本模型,看不了图。

以前遇到要识图的场景就很尴尬:截图、报错信息、设计稿,发过去模型只会收到一个文件路径,内容完全看不见。要么手动把图里的文字敲进去,要么临时换个支持视觉的模型,看完再换回来,会话上下文还断了,成本也上去了。

后来逛 GitHub 看到 zcode-deepseek-eye,思路正好对胃口:主模型不换,在 ZCode 里挂一个支持视觉的子 Agent 当”眼睛”。主模型遇到图片,自动把图交给眼睛模型看,再把文字描述拿回来继续干活。对使用者来说整个过程是无感的。

安装

首先zcode中配置好支持视觉的模型,我这里配置了opencode go中很便宜的mimo-v2.5

点击新建任务,选择不在项目中工作

新建任务

对他说

请帮我安装这个skill https://github.com/50kg/zcode-deepseek-eye

引导安装

安装好了之后重启zcode,然后新建一个对话窗口说帮我配置视觉助手

配置

告诉他使用支持视觉的模型即可。我这里使用的是opencode go 订阅中同样超低价格的mimo-v2.5

踩坑点

  • 眼睛模型选错了不用重装,重新跑一遍配置换个模型就行
  • 视觉调用走你自己的 API Key,项目本身不存任何密钥
  • 删除视觉助手后,旧会话里可能还带着”图片要交给 vision-helper”的旧规则,必须开全新会话才干净
  • 主模型本身支持视觉的话不会触发子 Agent,不会白花钱

调用过程

结语

这套方案解决了我的老毛病:既留住了 deepseek-v4-flash 的性价比,又能在需要的时候”借眼睛”看图。如果你也用纯文本模型当主力、偶尔需要识图,可以试试。

项目地址:https://github.com/50kg/zcode-deepseek-eye

不得不说zcode好好用。

zcode

头像背景Guli形象

张洪Heo

分享设计与科技生活

本文使用AI辅助创作,采用 CC BY-NC-ND 4.0 协议,转载请注明出处。