惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
I
InfoQ
Engineering at Meta
Engineering at Meta
D
DataBreaches.Net
L
LangChain Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Recent Announcements
Recent Announcements
GbyAI
GbyAI
爱范儿
爱范儿
Microsoft Security Blog
Microsoft Security Blog
腾讯CDC
美团技术团队
罗磊的独立博客
Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
雷峰网
雷峰网
M
MIT News - Artificial intelligence
D
Docker
MongoDB | Blog
MongoDB | Blog
F
Fortinet All Blogs
博客园 - 叶小钗

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
做了一个 AI 工作流 SOTA 诊断 skill,希望能直接基于工作空...
gilgameshcc · 2026-05-13 · via V2EX

先说真话——

发这帖主要是想找几个 fellow ,一起追 Claude Code / Cursor / MCP / agent 这一摊东西的当前 SOTA

我自己用 Claude Code 半年,从 hooks / skills / MCP / subagent 一路跟着出新,但每周还是会怀疑两次"我这套 harness 是不是已经落后了"——你们应该也有过这种感觉。

X 和即刻上人人都在晒 setup ,没人讲「你当前 workspace 在哪一档 / 跟 SOTA 差哪几条 / 下一步先装哪个能消化的」。所以我做了一个工具 lorejump.com但更想做的是建一个小群,30 人左右,互相戳一下姿势。


工具长什么样

两种用法:

轻量看一眼:直接在 lorejump.com 首页输入框聊两句,它跑一个自适应问卷( A 问卷 → B 出分 → C 深聊)给你一个 7 维诊断。看完想深扫再装 skill 。

深扫:在你自己 Claude Code 里装 skill + 配 MCP ,/lorejump-optimize 一下,它扫你的 CLAUDE.md / .claude/ 配置 / 仓库结构 / spec 体系,用你自己的 agent 对照 SOTA 知识库打分 —— 输出 7 维分数 + 落后维度 + 1-3 条"当下能消化、可验证"的下一步(不强推完整 harness 模板让你 copy )。

评分逻辑在 agent 侧,知识库在 MCP 侧(只有 2 个 tool:get_sota_pack 拉 SOTA 画像 + submit_report 回执)。你的代码 / prompt 不离开你的机器

7 个维度:D1 Spec 驱动 / D2 上下文管理 / D3 版本控制 / D4 测试质量 / D5 多 Agent 利用 / D6 文档体系 / D7 工作流自动化( D1 + D5 是我赌的"还没被占据的差异化维度",D3/4/6/7 对齐既有 SOTA )。

跑完一次后再跑 /lorejump-harness,server 会带「自上次以来 N 条新实践、K 条与你相关」的 diff 文本——这是我真正想做的事:演变追踪 + 集体经验,不靠"top X%"这种统计学套路。

承诺:skill 跑出来你觉得没对上你的姿势 / 没给到有用的东西 —— 直接来群里 @ 我,我个人帮你看。范围限 AI 工作流( Claude Code / Cursor / Codex / MCP / skill / subagent / hooks ),我都跑过。我也不会的,我帮你在群里找到会的人。


还没想清楚的 3 个问题

  1. SOTA 怎么定义:现在 1 周扫一次 Claude / Anthropic / Cursor / Codex 官方更新 + 部分活跃 dev 实践,server 直读 markdown 而非 BI schema 。但热点变化更快——要不要做"用户自报实践"反向喂?喂了怎么验真?
  2. W0-W4 阶段识别:skill 现在用扫描信号反推用户 workspace 形态( W0 裸项目 → W4 完整 harness 五层齐全),按当前档推下一步。独立开发 / 团队 lead / 内容创作者关心的事不一样——同一档下要不要分流推荐?
  3. 跑完一次之后凭什么再来:我现在只敢做 H1 diff digest (附在 nudge 文本里,不做独立邮件 / streak / wrapped )。但这够不够拉人回来?还是说就该接受"一次性诊断 + 偶尔回看",不强求留存?

这 3 条都想拉群里聊。


群的规则

  • 30 人左右,群里就是我( GIL )—— 我能管多少管多少,挤不下再说,不写 waitlist
  • 我每条 @ 都会接,但不承诺时效(一个人,老实说)
  • repo 现在没公开(一个人搞,文档比代码乱),关键决策我直接群里贴
  • 进来后第一周认真用一次( Web 试 or skill 深扫都行)+ 反馈 3 条具体的,就算共创

怎么进群:楼下回复。我看到就拉群。


不指望刷屏。同样在追 SOTA 的兄弟来一个我珍惜一个,每条回复都会接。