惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
GbyAI
GbyAI
M
MIT News - Artificial intelligence
美团技术团队
罗磊的独立博客
雷峰网
雷峰网
量子位
博客园 - 【当耐特】
Last Week in AI
Last Week in AI
D
Docker
小众软件
小众软件
S
SegmentFault 最新的问题
Blog — PlanetScale
Blog — PlanetScale
阮一峰的网络日志
阮一峰的网络日志
宝玉的分享
宝玉的分享
T
Tailwind CSS Blog
WordPress大学
WordPress大学
V
V2EX
博客园_首页
腾讯CDC
The Cloudflare Blog
A
About on SuperTechFans
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
前 Meta/Microsoft/Atlassian 主任工程师的 Agentic 工程工作流
zhb_hoh (郑阳光) · 2026-06-22 · via LINUX DO - 最新话题

用这套工作流 @kunchenguid 每天 ship 40-50 个经测试的生产级 PR,他这么形容它:「你是船长,agent 是你的船员,分四层递进: 造船 → 训练船员 → 与单个船员协作 → 并行指挥多个船员 + 一位大副」。 https://www.youtube.com/watch?v=iQyg-KypKAA

终端中心主义(造船)

坚持全终端工作,核心理由: 手不离键盘 = 维持心流,鼠标切换会强制上下文切换 · 跨设备一致性–同一套工作流可在手机/不同机器上接续

工具栈:WezTerm (跨平台、Lua 配置、热重载) + tmux (会话持久化、多 pane、可远程 attach) + Neovim (键盘优先、相对行号)。

船员的入职培训(Memory + Skills) agent 是新兵,不知道你的偏好。两类机制 ramp up:Memory 和 Skills

  1. Memory · 全局 memory(如 ~/.claude/CLAUDE.md):保持精简(27 行),因为内容会注入每次会话的系统提示词,过长会"静默"消耗 token · 几条有洞察的偏好规则: 1. 不要用 em-dash(-)–AI 默认会用,显得机械 2. 做技术决策时不要高估开发成本–模型用人类数据训练,会高估耗时(预估"天/周",实际几分钟出可玩版本),这种偏差会让模型偏向"便宜但低质量"方案。这条是纠正模型训练偏差 3. bug 修复优先端到端复现,而非依赖单元测试 · 项目级 memory:核心方法不是手写,而是每次纠正 agent 后让它把教训写进去–项目集体学习的沉淀

  2. Skills · 把条件性内容(如仅改代码时才需要的 E2E 说明)从 memory 抽到 skill · skill 启动时只加载简短描述,用到才读全文–避免无谓 token 消耗

  3. 关于 skills 的重要警告 · Karpathy 的 skills 仓库(17.7 万 star)经 program-bench 评测后,使用反而多耗 5% token 且结果更差,且并非 Karpathy 本人所写 · 安全风险:skill 可在机器上执行任意命令,可能泄露 API key 甚至银行凭证 · 结论:流行 ≠ 优质。不要装声称"神奇提升"却无严格评测的 skill

与单个船员协作

  1. 语音输入 · 几乎全用语音替代打字(Stanford 论文:说话比打字快 3 倍) · 工具 OpenSuperWhisper:本地 whisper,免费开源,通过 system prompt 注入自定义词汇表提升专有名词识别

  2. AXI 标准 (Agent ergonomics) 自创的为 agent 优化工具的设计标准: · 实测:同样 GitHub 任务,MCP server 比 CLI 多耗 3 倍 token + 2 倍延迟 · 设计原则之一:token 高效输出格式比 JSON 节省 ~40% token · 启示:给 agent 的工具本身的效率,直接决定 agent 的"油耗"

  3. Lavish (交互式规划工件) 针对"agent 返回一堵文字墙难以评审"的痛点:让 agent 生成 HTML 可视化工件,复用项目设计系统,可针对具体元素批注反馈并在浏览器内回传。

验证:no-mistakes 流水线(质量基石)

反直觉主张:不要逐个 review diff。 · 理由:AI 写代码太快,逐 diff 审查会让人成为瓶颈且无趣 · 类比:像工程总监一样思考–总监不审 PR,而是通过文化和流程把控质量

流水线在隔离 worktree 中执行: · 分析会话还原真实意图 · rebase 到最新 main,提前解决冲突 · 对抗式 review(独立上下文窗口)–多数问题在此被捕获自愈,模糊的升级人类 · E2E 测试并录制证据(截图/视频/日志) · 文档更新 + 链接检查 · 推分支开 PR,持续 babysit 直到合并

PR 呈现:原始意图、变更摘要、测试证据、流水线发现并修复的问题、风险评估。 评审策略:看风险评估决定投入精力。低风险几乎不看 diff(因流水线已覆盖),只对高风险深入。

工作分布洞察:时间花在任务开头(用 Lavish 澄清需求)和结尾(把质量关),中间全交给 AI。中间腾出越多,并行越多。

长时间运行:good-night-have-fun

解决"睡觉 8 小时如何让 agent 持续干活":给目标和停止条件,在循环中迭代。

相比 Claude Code/Codex 的 /go,优势是可精确设置 token 上限 / 迭代上限 / 停止条件–避免睡醒发现周配额耗尽。

并行:treehouse + worktree

git worktree 的痛点:起名、记状态、手动清理 = 认知债。treehouse:运行即落入空闲 worktree,关闭 tab 自动释放,treehouse status 一目了然。

First Mate:大副编排器

并行会话变多后,上下文切换疲惫。

First Mate 是元 agent,替你管理所有船员:你只跟它对话,它自动拆并行子任务、调用 treehouse 建 worktree、跑 no-mistakes、准备 PR。

关键观察:用了 First Mate 后,瓶颈从"agent 执行力"转移到"你想让它做什么"–船长的价值转向战略:理解用户、研究竞争、画好"藏宝图"。

image

mlxx (星之旅人) 2

非常感谢大佬分享,正好需要这个东西来优化一下我的工作流