惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
罗磊的独立博客
宝玉的分享
宝玉的分享
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
T
Tailwind CSS Blog
博客园_首页
量子位
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
爱范儿
爱范儿
S
SegmentFault 最新的问题
雷峰网
雷峰网
小众软件
小众软件
博客园 - 聂微东
美团技术团队
Apple Machine Learning Research
Apple Machine Learning Research
WordPress大学
WordPress大学
Jina AI
Jina AI
Hugging Face - Blog
Hugging Face - Blog

博客园 - zhang-yd

今日开源[第57期]beautiful-water源码解读 今日开源[第56期]human-atlas源码解读 今日开源[第55期]model-x-studio源码解读 今日开源[第54期]Spark(@sparkjsdev/spark)源码解读 今日开源[第53期]PlayCanvas Engine(playcanvas/engine)源码解读 今日开源[第52期]SPEEDBALL GI WebGPU Showcase(speedball-gi)源码解读 今日开源[第51期]Pi Agent Harness(pi)源码解读 今日开源[第50期]World Monitor(worldmonitor)游戏项目解读 今日开源[第49期]竹知了(zhuzhiliao)小玩具项目解读 今日开源[第48期]Operation Ironhold 游戏项目解读 今日开源[第46期]AI-Research-SKILLs项目skill解读 今日开源[第45期]nature-research-skills项目skill解读 今日开源[第44期]findskills项目skill解读 今日开源[第43期]last30days-skill 今日开源[第42期]Cangjie Skill 今日开源[第41期]MoneyPrinterTurbo 今日开源[第39期]img2threejs 今日开源[第39期]Kronos 今日开源[第38期]Open Code Review (OCR) 今日开源[第37期]Openship 今日开源[第36期]croc 今日开源[第35期] Code-Review-Graph 今日开源[第34期] 《深入理解 AI Agent:设计原理与工程实践》 今日开源[第33期] Home Assistant Core 今日开源[第32期] Vibe-Trading 今日开源[第31期]RuView 今日开源[第30期]Chrome DevTools MCP 今日开源[第29期]RomM (ROM Manager) 今日开源[第28期]Page Agent 今日开源[第27期]video-use
今日开源[第47期]Academic Research Skills for Claude Code...
zhang-yd · 2026-08-02 · via 博客园 - zhang-yd

Academic Research Skills for Claude Code(ARS)项目解读

仓库:https://github.com/Imbad0202/academic-research-skills
版本:v3.19.0(2026-07-22)|许可证:CC-BY-NC-4.0|语言:Markdown + Python(仓库脚本)
作者 / 维护者:Cheng-I Wu(吳政宜)|DOI:10.5281/zenodo.20696614


目录

  1. 项目名称、作者与作用背景
  2. 安装使用教程与依赖条件
  3. 工作流程与具体执行步骤
  4. 项目文件逐个解读
  5. 优势、不足、创新点与亮点
  6. 附:核心代码节选

1. 项目名称、作者与作用背景

1.1 名称与作者

  • 项目名称Academic Research Skills for Claude Code(简称 ARS)。别名在 README 中表述为 “Academic Research Skills for Claude Code: research → write → review → revise → finalize”。
  • 作者 / 维护者Cheng-I Wu(吳政宜),GitHub 账号 Imbad0202。其个人站点为 Buy Me a Coffee 的 crucify020v
  • 贡献者:除作者外,README 列明多位外部贡献者:
    • aspi6246 — 贡献了 anti-context-rot、认知框架、lean skill size 等设计灵感(源自 Claude-Code-Skills-for-Academics);
    • mchesbro1 / cloudenochcsis — 信息科学(IS)顶刊清单(Basket of 8 → Senior Scholars' Basket of 11);
    • eltociear(日语 README)、xpfo-go(简体中文 README)、devCharlotte(韩语 README)、Yaobin29(rebuttal-audit / three-way-scan 模式)、ktao732084-arch(医学出版披露政策、中文文献解析器、EQUATOR 临床报告指南扩展)等。
  • 版本与规模:v3.19.0,约 643 commits,跨 4 个可触发技能(deep-research / academic-paper / academic-paper-reviewer / academic-pipeline),共 27 个模式39 个智能体100+ 个 CI lint 脚本

1.2 作用

ARS 是一套面向 Claude Code学术研究技能套件(skills),覆盖从“研究”到“发表”的完整学术流水线:

研究(research) → 写作(write) → 完整性核查(integrity) → 评审(review)
→ 修订(revise) → 再评审(re-review) → 再修订(re-revise)
→ 最终完整性核查(final integrity) → 定稿(finalize) → 过程总结(process summary)

它的核心定位是 “AI 是副驾驶,不是飞行员”(AI is your copilot, not the pilot):ARS 不替你写论文,而是处理繁重事务——查文献、格式化引用、核验数据、检查逻辑一致性、做同行评审模拟、生成审稿意见回复。

1.3 背景与设计动机(关键)

ARS 的设计动机直接锚定在 2026 年的三篇公开研究上,而非凭空想象:

锚定研究 核心发现 ARS 的应对
Lu et al. (2026, Nature 651:914-919)The AI Scientist 首个全自动 AI 科研系统通过盲审发表;但 Limitations 列举了实现 bug、幻觉结果、走捷径、把 bug 当洞见、方法伪造、frame-lock、引用幻觉等失败模式 建立 human-in-the-loop 立场;Stage 2.5 / 4.5 完整性门禁运行 7 模式阻塞式检查清单
Zhao et al. (2026, arXiv:2605.07723) 审计 2.5M 论文发现 2025 年有 146,932 条幻觉引用;85.3% 预印本→发表保留 v3.7.1 加信任链 frontmatter;v3.7.3 加三层引用锚点(locator);v3.8 加 opt-in 的 claim-faithfulness 审计门禁
Ren et al. (2026, arXiv:2607.13104)Self-Improvements in Modern Agentic Systems: A Survey 发现式智能体难以独立验证新颖性/正确性/可复现性,可能利用弱代理;明确指出“弱证据下的科学写作会放大错误信息” v3.18 加入 8 个质量机制(风险分层索赔门、跨模型评审等);作为第三个“human-in-the-loop”文献锚

此外还借鉴了 PaperOrchestra (Google, 2026) 的 Semantic Scholar API 验证、防泄漏协议、VLM 图验证、分数轨迹跟踪等。

设计哲学(README 原话):This tool doesn't help you hide the fact that you used AI. It helps you write better. 它明确反对“humanizer”式规避检测,目标是质量而非作弊。


2. 安装使用教程与依赖条件

2.1 依赖的软件 / 硬件条件

条件 说明
Claude Code(CLI / VS Code 扩展 / JetBrains 扩展) 最新版;插件化打包需较新版本(v3.7.0+)
ANTHROPIC_API_KEY 首次运行 claude 时设置或导出;LLM 推理在远端,无需本地 GPU
Pandoc(可选) 用于 DOCX 输出;缺省时 formatter 退化为 Markdown + 转换说明
tectonic + Source Han Serif TC(可选) 用于 APA 7.0 PDF;Markdown 输出无需
Python 3(可选) 核心技能(research/write/review)纯 prompt 驱动,无需 Python;仅 PreToolUse 写范围守卫、revision-patch、投稿包校验、部分 /ars-* 命令需要真实 Python
Git Bash(Windows 可选但推荐) 写范围守卫(hooks/run_guard.sh)是 POSIX shell 脚本,需 Git Bash;无 Git Bash 时该守卫静默失效(不阻塞写作)
跨模型验证(可选) 设置 ARS_CROSS_MODELOPENAI_API_KEYGOOGLE_AI_API_KEY
硬件 普通桌面即可;无 GPU 要求(推理远端);仅 token 成本,全流水线约 $4–6 / 篇 1.5 万字论文

2.2 最小化安装(最快路径)

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

安装后运行 /ars-plan 即可开始;单次测试用 /ars-lit-review "your topic"

2.3 六种安装方式(SETUP.md 详述)

方式 适用场景 要点
Method 0:Claude Code 插件(推荐) CLI / VS Code / JetBrains 用户 上面两条命令;建议开自动更新(约每 1–2 周一版);会话启动时有更新提醒
Method 1:项目技能 / 全局技能 在已有项目中使用 git clone 后把 4 个技能目录 cp -R.claude/skills/(项目级)或 ~/.claude/skills/(全局);并合并 .claude/CLAUDE.md
Method 2:独立仓库 直接在 ARS 仓库内工作 git clone 后于仓库内 claude;也支持 ZIP 下载
Method 3:Claude Cowork(桌面) Claude Desktop 的 agentic workspace 每个技能打成独立 zip 上传到 Settings → Capabilities → Skills;无完整多智能体编排(只有单技能独立运行)
Method 4:claude.ai(web) 仅读取仓库内容 4b(推荐):Project + GitHub 集成,作为可检索知识;4a(不推荐):Custom Skill 上传因 200 字符 description 上限会报错
Method 5:Claude Science 导入(v3.14.0+) Claude Science 平台 Customize → Capabilities → Skills → Import from GitHub,粘贴仓库 URL,点 Import 4 skills;但只转移方法论层,不转移 Claude Code 专属机制(slash 命令、hooks、跨模型脚本、Task 子智能体编排)

⚠️ 关键提醒:不要把整个仓库当成一个嵌套技能文件夹装到 .claude/skills/academic-research-skills/——那会把 4 个 SKILL.md 埋深一层,Claude 无法发现。必须让每个技能目录的 SKILL.md 直接位于发现路径下。

2.4 使用入口(slash 命令 / 自然语言)

16 个 /ars-* slash 命令(commands/ars-*.md)映射 MODE_REGISTRY 的模式,例如:/ars-plan/ars-full/ars-lit-review/ars-reviewer/ars-revision/ars-rebuttal-audit/ars-disclosure/ars-citation-check/ars-3w/ars-abstract/ars-outline/ars-format-convert/ars-mark-read/ars-unmark-read/ars-cache-invalidate/ars-revision-coach。也可直接用自然语言(如“帮我写一篇关于 AI 对高教质量保障影响的论文”),由意图激活路由到对应技能。


3. 工作流程与具体执行步骤

3.1 总览:10 阶段流水线

academic-pipeline 是轻量编排器(orchestrator)——它不做实质性工作,只侦测阶段、推荐模式、派发子技能、管理状态转换。完整 10 阶段如下(Mermaid 图见 §6.1):

阶段 名称 调用的技能 / 智能体 主要交付物
1 RESEARCH deep-research(13 智能体) RQ Brief、Methodology Blueprint、Annotated Bibliography、Synthesis Report
2 WRITE academic-paper(12 智能体) Paper Draft、Outline、Argument Map、Figures、Citation List
2.5 INTEGRITY integrity_verification_agent Material Passport + 完整性报告(7 模式检查)
3 REVIEW academic-paper-reviewer(7 智能体) 5 份评审报告 + 编辑决定 + 修订路线图
4 REVISE academic-paper(revision 模式) 修订稿 + 逐点回复
3' RE-REVIEW academic-paper-reviewer(re-review 模式) 验证评审 + R&R 可追溯矩阵
4' RE-REVISE academic-paper(revision 模式) 最终修订稿(内容冻结)
4.5 FINAL INTEGRITY integrity_verification_agent 最终验证报告(零容忍,必须 100% 通过)
5 FINALIZE academic-paper(format-convert 模式) 出版就绪 MD / DOCX / LaTeX / PDF
6 PROCESS SUMMARY 编排器 论文创作过程记录 MD+PDF + AI 自我反思报告

3.2 检查点(Checkpoint)机制

流水线有两类用户检查点,每个阶段完成都需用户确认才能推进:

  • 决策型检查点(🧑 decision-heavy):用户选择分支或确认重要决定(如 RQ 确认、大纲批准、编辑决定、格式选择、内容冻结)。
  • 完整性门禁(✓ integrity gate):机器先验证,用户再确认报告。Stage 2.5 / 4.5 的完整性门不可跳过、无 --no-block 逃逸

检查点分三种类型:

类型 触发时机 行为
FULL 首个检查点、完整性边界后、Stage 5 完成 全量交付物列表 + 决策仪表盘 + 所有选项
SLIM 连续 2+ 次“continue”且非关键阶段 单行状态 + 显式继续/暂停提示
MANDATORY 完整性失败、评审决定、Stage 5 入口门 不可跳过,需显式用户输入

3.3 一次完整运行的执行步骤(以“从零写论文”为例)

  1. INTake & 侦测pipeline_orchestrator_agent 分析用户输入与已有材料,判定进入阶段(无材料→Stage 1)。
  2. 模式推荐:按用户类型推荐模式(新手→socratic+plan+guided;有经验→full+full+full;赶时间→quick+full+quick)。
  3. Stage 1 RESEARCH(13 智能体):研究问题→方法蓝图→系统文献检索→来源核验→跨源综合→APA 7.0 报告→编辑/伦理审查→魔鬼代言人挑战→(系统综述时)偏倚风险/RoB/meta 分析→文献监测。
  4. Stage 1→2 交接:RQ Brief + Methodology Blueprint + Bibliography + Synthesis 传给写作技能。
  5. Stage 2 WRITE(12 智能体):intake→结构架构→论点构建→草稿→引用合规→双语摘要→同行评审(内部)→格式→苏格拉底导师→可视化→修订教练。大纲批准后开始起草(可选并行:phase 1 后可视化 + 论点构建并行)。
  6. Stage 2.5 INTEGRITY(预评审):运行 7 模式 AI 研究失败模式检查清单(M1 实现 bug、M2 引用幻觉、M3 结果幻觉、M4 走捷径、M5 bug 当洞见、M6 方法伪造、M7 frame-lock)。失败→修复+复验(最多 3 轮)或用户带理由 override(记入 Stage 6 报告)。
  7. Stage 3 REVIEW(7 智能体):Journal-Fit Reviewer + R1 方法 + R2 领域 + R3 跨学科 + Devil's Advocate,+ 编辑合成器(3 步机械协议)。Sprint Contract 两阶段协议:评审员先 paper-blind 提交承诺(Phase 1),再 paper-visible 评分(Phase 2)。决定映射:≥80 Accept / 65–79 Minor / 50–64 Major / <50 Reject。
  8. Stage 4 REVISE:修订教练(最多 8 轮苏格拉底,可说“just fix it”跳过)+ 草稿重写 + 逐点回复;分数轨迹跟踪,退化维度标红。
  9. Stage 3' RE-REVIEW(验证评审):按 #576 三闸门“证据先于说服”契约——Phase 1 标准承诺(修订盲)→ Phase 2A 证据裁决(说服盲)→ Phase 2B 索赔匹配(信公开);强制跑 check_re_review_synthesis.py 后再出决定;产出 R&R 可追溯矩阵(Schema 11)。
  10. Stage 4' RE-REVISE(如需要):内容冻结,最多 1 轮 RE-REVISE。
  11. Stage 4.5 FINAL INTEGRITY(最终):7 模式更深复跑,零容忍,任何模式自 2.5 起 SUSPECTED 且未解决则阻塞。
  12. Stage 5 FINALIZE:选格式(MD→DOCX via Pandoc→LaTeX→PDF via tectonic);披露检查(venue 特定 AI 披露缺失则阻断渲染);v3.8 硬门(formatter_agent REFUSE 规则 6–10)在 ARS_CLAIM_AUDIT=1 时拒绝未解决的 HIGH-WARN 索赔类标注。
  13. Stage 6 PROCESS SUMMARY:生成“论文创作过程记录”+ 6 维协作质量评估(1–100)+ AI 自我反思报告(让步率、谄媚风险、frame-lock 事件等,自带反讽免责声明)。

3.4 完整性门禁(Integrity Gate)的 7 模式检查清单

源自 Lu et al. 2026,作为 Stage 2.5 / 4.5 的强制阻塞检查

M1  implementation bug passing AI self-review   实现 bug 通过 AI 自检
M2  hallucinated citation                         引用幻觉
M3  hallucinated experimental result             实验结果幻觉
M4  shortcut reliance                            走捷径依赖
M5  implementation bug reframed as novel insight  把 bug 重新框定为新洞见
M6  methodology fabrication                       方法伪造
M7  frame-lock at early pipeline stage            流水线早期 frame-lock

任一模式 SUSPECTED,或 M1/3/5/6 为 INSUFFICIENT EVIDENCE,流水线即阻塞,用户必须确认/带理由 override/修订后才能继续。

3.5 可选增强机制(opt-in 环境变量)

变量 作用
ARS_CROSS_MODEL 启用第二模型独立验证(完整性抽样 + 独立魔鬼代言人批判 + 不可逆决策盲交叉验证)
ARS_CLAIM_AUDIT=1 启用 L3 claim-faithfulness 审计门(Stage 4→5 间,默认 OFF)
ARS_PASSPORT_RESET=1 把 FULL 检查点提升为上下文重置边界,支持跨会话 resume
ARS_MODEL_TIERING 模型分层(economy 执行类降一级 / quality-boost 判断类升到前沿)
ARS_SOCRATIC_READING_PROBE=1 苏格拉底阅读检查探针(可选诚实性探针)

4. 项目文件逐个解读

4.1 根目录文件

文件 作用
README.md 主文档(英文);含版本徽章、安装、架构指针、特性清单、使用、设计哲学、贡献者、完整 Changelog
README.zh-CN.md / README.zh-TW.md 简体 / 繁体中文 README(v3.1 起有简中版)
README.ja-JP.md / README.ko-KR.md 日语 / 韩语 README(社区贡献翻译)
CHANGELOG.md 完整版本历史(v2.0 → v3.19.0 逐版说明,每版含 issue/PR 引用)
CITATION.cff 学术引用元数据(Zenodo DOI)
CONTRIBUTING.md 贡献规范:技能结构标准、质量标准、命名约定(kebab-case、第三人称 description、Title-Case 标签)、references 组织、提交流程
QUICKSTART.md 快速上手指南
MODE_REGISTRY.md 27 个模式的唯一真相源(4 技能 × 模式表,含 spectrum/输出/监督级别/触发器)
POSITIONING.md 定位文档:明确 ARS 不做的 5 个自主机制(Rejected mechanisms)
NOTICE.md / SECURITY.md 声明 / 安全政策
THIRD_PARTY.md 第三方平台与集成清单(社区提交,维护者不背书)
LICENSE CC-BY-NC-4.0 许可证
.command-invariants.toml 命令不变量 CI 门禁(把 SessionStart 公告列表钉死到 16 命令库存)
.gitattributes / .gitignore Git 属性(Windows hook 可移植性)/ 忽略规则
.gitleaks.toml 密钥泄漏扫描配置
.claude-plugin/ 插件清单:plugin.json(声明 suite,4 技能自动发现)、marketplace.json(注册插件,供 GitHub-API 导入器读取显式技能路径)
.claude/ CLAUDE.md(路由纪律 Routing Discipline v3.9.2)、CHANGELOG.md
.github/ GitHub Actions 工作流(changelog 覆盖合并、命令不变量、defer-label、eval-harness、freshness-check、harness-retirement、platform-port-reminder、pr-closes-issue、pytest、release-cooldown、repository-hygiene、spec-consistency、tag-version-match、test-count-monotonic)+ copilot 指令 + PR 模板

4.2 四个核心技能目录

每个技能目录统一结构:SKILL.md(路由器 + 协议)+ agents/(子智能体定义)+ references/(按需加载的详细协议)+ templates/(输出模板)+ examples/(示例)。

4.2.1 deep-research/(v2.11.0,data_access_level: raw)

  • SKILL.md:通用深度研究技能;8 模式(full/quick/review/lit-review/three-way-scan/fact-check/socratic/systematic-review);13 智能体:research_question、research_architect、bibliography、source_verification、synthesis、report_compiler、editor_in_chief、devils_advocate、ethics_review、socratic_mentor、risk_of_bias、meta_analysis、monitoring。Socratic 模式用意图检测激活(跨语言),歧义时优先 socratic。
  • agents/:上述 13 个智能体的 .md 定义(含 PATTERN PROTECTION v3.6.7 块)。
  • references/:APA7 风格、论证推理框架、arXiv/OpenAlex/Crossref/Semantic Scholar API 协议、EQUATOR 报告指南、伦理清单、逻辑谬误、方法论模式、系统综述协议、苏格拉底框架、来源质量层级、PRISMA 工具包、中文文献 API 协议等 30+ 文件。
  • templates/:证据评估、文献矩阵、预注册、PRISMA 协议/报告、研究简报模板。
  • examples/:探索性研究、事实核查、交接、思想多样性、政策分析、评审、苏格拉底引导、系统综述等示例。

4.2.2 academic-paper/(v3.2.0,data_access_level: redacted)

  • SKILL.md:12 智能体论文写作流水线;11 模式(full/plan/outline-only/revision/revision-coach/abstract-only/lit-review/format-convert/citation-check/disclosure/rebuttal-audit)。
  • agents/:intake、literature_strategist、structure_architect、argument_builder、draft_writer、citation_compliance、abstract_bilingual、peer_reviewer、formatter、socratic_mentor、visualization、revision_coach(12 个)。
  • references/:摘要写作、学术写作风格、防泄漏协议、APA7 中英文引用指南、引用格式切换、署名/基金声明、披露模式协议、政策锚定披露表(15 个 venue,含 ICMJE/NEJM/Lancet/JAMA/BMJ/PLOS/Frontiers + 两个中文政策目标)、VLM 图验证、写作质量检查、期刊投稿指南、LaTeX 模板参考、失败路径等 30+ 文件。
  • templates/:双语摘要、案例研究、会议论文、署名声明、基金声明、IMRaD、LaTeX 文章 .tex、文献综述、政策简报、修订跟踪、理论论文模板。
  • examples/:中文论文、临床引用核验、临床认知状态、承诺账本、IMRaD-HEI、文献综述、plan 引导写作、修订模式、修订恢复、版本族协调等示例。

4.2.3 academic-paper-reviewer/(v1.10.0,data_access_level: verified_only)

  • SKILL.md:7 智能体多视角同行评审;6 模式(full/re-review/quick/methodology-focus/guided/calibration)。
  • agents/:devils_advocate_reviewer、domain_reviewer、editorial_synthesizer、eic、field_analyst、methodology_reviewer、perspective_reviewer(7 个)。
  • references/:校准模式协议、编辑决定标准、引导模式协议、集成指南、质量量规、re-review 模式协议、评审标准框架、评审质量思考、评审员 sprint 提示源、sprint 合同协议、统计报告标准、按领域顶刊清单等。
  • templates/:编辑决定、同行评审报告、修订回复模板。
  • examples/:HEI 论文评审、跨学科评审、subclaim 分解示例。

4.2.4 academic-pipeline/(v3.19.0,data_access_level: verified_only)

  • SKILL.md:10 阶段编排器(见 §3);5 智能体:pipeline_orchestrator、state_tracker、integrity_verification、collaboration_depth(观察员,仅建议)、claim_ref_alignment_audit(opt-in)。
  • agents/:上述 5 个智能体定义。
  • references/:pipeline 状态机、剽窃检测、模式顾问、索赔验证、索赔审计校准、AI 研究失败模式、团队协议、完整性评审、两阶段评审、外部评审、过程总结、可复现性审计、分数轨迹、文献语料消费者、护照重置边界、强化内容、进度仪表盘、changelog 等。
  • templates/:pipeline 状态模板。
  • examples/:全流水线示例、mid-entry 示例、完整性失败恢复。

4.3 shared/(跨技能共享契约与协议)

路径 作用
handoff_schemas.md 跨技能数据契约:9 个 schema 定义所有阶段交接产物
ground_truth_isolation_pattern.md 真值隔离模式(data_access_level 的数据流结构说明)
benchmark_report.schema.json / benchmark_report_pattern.md 基准报告 schema + 诚实比较模式
artifact_reproducibility_pattern.md 制品可复现锁文件模式(配置文档非回放保证)
cross_model_verification.md 跨模型验证设置与成本指南;含 §"Cross-model handoff envelope"
mode_spectrum.md 模式谱系(fidelity / balanced / originality)
model_tiering.md 模型分层规范(39 智能体 judgment/execution 分类表)
collaboration_depth_rubric.md 协作深度观察员量规(4 维,基于 Wang & Zhang 2026)
compliance_checkpoint_protocol.md / compliance_report.schema.json / prisma_trAIce_protocol.md / raise_framework.md 合规检查点、合规报告 schema、PRISMA-trAIce 协议、RAISE 框架
sprint_contract.schema.json Schema 13 sprint 合同(评审员评分承诺硬门)
style_calibration_protocol.md 风格校准协议(从过往论文学习作者声音)
policy_data/ 披露政策数据
contracts/ 护照/评审合同(passport/literature_corpus_entry、reviewer/full+methodology_focus 等)
agents/ 共享智能体定义
references/ / templates/ 共享参考与模板

4.4 scripts/(Python 引擎,100+ 文件)

核心能力分三类:

A. 引用 / 来源验证客户端(确定性门禁)

  • arxiv_client.py — arXiv ID 解析(无需 API key),0.70 标题交叉核验,429→3s 退避 ×3,网络/5xx→ArxivUnavailable(见 §6.3
  • semantic_scholar_client.py / openalex_client.py / crossref_client.py — 三大学术索引客户端(三角测量 contamination 信号)
  • _text_similarity.py — 三路客户端去重(normalize / similarity / threshold 常量)
  • verification_gate/ + verify_passport.py — 确定性引用存在性验证门(4 索引,SQLite 缓存 90 天 TTL)

B. 跨模型 / 索赔审计

  • cross_model_handoff.py — 规范 [CROSS-MODEL-HANDOFF v1] 信封语法 + 路由(agreement / divergence / unavailable 安全失败,见 §6.4
  • claim_ref_alignment_audit 相关:_claim_audit_constants.pycheck_claim_audit_consistency.pytest_claim_audit_calibration.py(FNR<0.15 + FPR<0.10 黄金集校准)
  • temporal_integrity_audit.py — 5 步时间完整性验证(P1 回顾算术 / P2 年代错乱 / P3 比较器未实现 / P4 因果倒置 / P5 指示词现在时)

C. CI 契约 lint(defrift / 内容锁)

  • 约 90+ 个 check_*.pycheck_data_access_level.py(frontmatter 元数据校验)、check_spec_consistency.pycheck_pipeline_boundary_semantics.py(5 个流水线表面 sha256 内容锁,66 个变异测试)、check_sprint_contract.pycheck_phase_conformance.pycheck_v3_6_7_pattern_protection.py(29 测试变异套件)、check_repro_lock.pycheck_cross_model_handoff_contract.py 等。
  • adapters/folder_scan.py / zotero.py / obsidian.py — Material Passport literature_corpus[] 输入端口的三個参考 Python 适配器。
  • shell 脚本:announce-ars-loaded.sh(SessionStart 公告)、ars_update_check.sh(更新检查)、ars_write_scope_guard.py + hooks/run_guard.sh(PreToolUse 写范围守卫,围栏 23 个单阶段智能体)。

4.5 commands/(16 个 slash 命令)

ars-plan / ars-full / ars-lit-review / ars-reviewer / ars-revision / ars-rebuttal-audit / ars-disclosure / ars-citation-check / ars-3w / ars-abstract / ars-outline / ars-format-convert / ars-revision-coach / ars-mark-read / ars-unmark-read / ars-cache-invalidate。每个命令 frontmatter 钉死模型路由(full / revision-coach 用 opus;其余 8 个用 sonnet;无 haiku)。

4.6 agents/ / audits/ / docs/ / evals/ / examples/

目录 作用
agents/ 3 个插件随附智能体(byte-identical 副本):report_compiler_agentresearch_architect_agentsynthesis_agent(model: inherit)
audits/ 审计报告:研究者盲点审计、外部贡献审计提示、harness 退役记录、RQ 建议豁免锐化/heldout 测量等
docs/ ARCHITECTURE.md(完整流水线视图)、SETUP.mdPERFORMANCE.md(token 预算/全流水线约 $4–6)、ROADMAP-v3.11.mdcross-paper-workflow.mddesign/(30+ 个设计 spec 文档,如 v3.6.2 sprint-contract、v3.7.3 claim-faithfulness、v3.9.4 temporal-verification 等)
evals/ 评估 harness(gold sets、heldout 集、排名提升 CI 门、e4 证据提升等)
examples/showcase/ 真实 10 阶段流水线产物:中英文 APA7 PDF、Stage 2.5/4.5 完整性报告、R1/R2 评审、回复审稿人、发表后审计报告(独立全引用审计发现首轮 3 轮完整性检查漏掉的 21/68 问题)

5. 优势、不足、创新点与亮点

5.1 优势

  1. Human-in-the-loop 而非全自动:明确反对“AI 替你写”,把 AI 的结构性局限(frame-lock、谄媚、意图误判)显性化、可管理化——这是与 The AI Scientist 类全自动系统的根本分野。
  2. 极其严格的完整性门禁:7 模式 AI 研究失败模式检查清单作为强制阻塞门;确定性引用存在性验证(4 索引,arXiv 免 key);L3 三层引用锚点 + claim-faithfulness 审计(opt-in),直接回应 Zhao et al. 的 14.7 万幻觉引用发现。
  3. 深度方法论内建:预注册(preregistration)、负结果、EQUATOR 临床报告指南、PRISMA-trAIce + RAISE 合规、15 个 venue 披露政策(含中文政策目标)、R&R 可追溯矩阵、Material Passport 实验溯源。
  4. 跨模型验证ARS_CROSS_MODEL 用第二模型独立验证完整性抽样与不可逆决策盲交叉验证,分歧升级给用户而非平均。
  5. 协作深度观察员collaboration_depth_agent 仅建议、永不阻塞,按 Wang & Zhang 2026 量规评估人机协作模式。
  6. 工程纪律与 CI 左移:100+ lint 脚本、defrift 锁、sha256 内容锁、命令不变量、发布纪律(release-cooldown、test-count-monotonic),保证 prompt 契约不漂移。
  7. 多语言与真实可运行产物:支持英/繁中/简中/日/韩触发;产出 MD/DOCX/LaTeX/PDF,含双语摘要、VLM 图验证、citation 格式切换(APA/Chicago/MLA/IEEE/Vancouver)。
  8. 有落地证据:examples/showcase 提供真实 10 阶段产物,含发表后独立审计报告。

5.2 不足

  1. 强绑定 Claude Code 生态:多智能体编排依赖 Claude Code 的 Task/subagent 工具与 Material Passport 文件交接;claude.ai web 仅能读取内容,Cowork 无完整流水线,Claude Science 仅转移方法论层。非 Claude Code 用户体验大幅降级。
  2. 非商用许可证(CC-BY-NC 4.0):禁止商业用途,限制机构/企业级部署。
  3. token 成本与交互轮次:全流水线约 $4–6/篇(不含跨模型),且交互轮次上限严格(2 个修订循环、8+5 苏格拉底轮、完整性修复循环)——长文档往返损坏风险被显式警示。
  4. 质量天花板受底层 LLM 约束:ARS 的核查/门禁能降低但无法根除幻觉;v3.7.x 自身也承认“corpus-scale 评估 ARS 本身仍是未来工作”。
  5. 复杂度与维护面巨大:4 技能、39 智能体、27 模式、100+ lint、30+ design spec;Changelog 曾出现多处计数矛盾(如脚本数量、技能版本),需要大量 CI 才能维持一致性。
  6. 部分能力 opt-in 且依赖外部服务:跨模型验证需 OpenAI/Google key;某些核查默认 OFF(如 claim audit);中文文献解析依赖 ISTIC/CNKI 等外部 API。
  7. Windows hook 体验:写范围守卫需 Git Bash,否则静默失效(虽不阻塞,但丢失防护)。

5.3 创新点与亮点

  1. “AI 是副驾驶不是飞行员”的研究哲学:把 human-in-the-loop 作为架构前提而非事后补丁,并引用 Nature / arXiv 实证研究支撑。
  2. 反谄媚机制(Anti-sycophancy)
    • 魔鬼代言人让步阈值协议:DA 必须给每条反驳 1–5 分,仅 ≥4 才让步;禁止连续让步、跟踪让步率、每检查点检测 frame-lock。
    • 苏格拉底导师意图检测层:区分探索型 vs 目标型意图;探索型禁用自动收敛、轮次上限提到 60、禁止“要我总结吗”。
    • 对话健康指示器:每 5 轮静默自评(持续同意/冲突回避/过早收敛),自动注入挑战问题(对用户不可见防作弊)。
  3. 7 模式 AI 研究失败模式检查清单作为强制阻塞门:直接把 Lu et al. 2026 的 Limitations 翻译成可执行门禁,且 Stage 4.5 零容忍。
  4. 确定性引用存在性验证门(#182):每引用对 4 大学术索引交叉核验,arXiv 免 key;SQLite 缓存 90 天;lookup_verified 状态写入统一摘要——伪造 DOI/arXiv 由查找而非依赖评审员发现。
  5. L3 三层引用锚点 + claim-faithfulness 审计(#103):每个 <!--ref:slug--> 携带 <!--anchor:kind:value-->(quote/page/section/paragraph/none);opt-in 审计用 LLM-as-judge 判索赔是否被来源支持,5 个 HIGH-WARN 类经 formatter 硬门拒绝输出。
  6. Material Passport + 实验溯源 intake(#260)experiment_provenance[] 记录学者外部运行的实验;experiment_intake_declaration 失败封闭(fail-closed)——即便无实验也声明 no_experiments_declared,完整性门永不静默绕过。
  7. 规范跨模型交接信封 [CROSS-MODEL-HANDOFF v1]:owner→dispatcher→owner 盲检查点运输路径,用确定性 Python 文法(而非散文)钉死协议;畸形信封/结果安全失败到 unavailable永不伪造判断(见 §6.4)。
  8. Data Access Level 元数据 + 真值隔离模式:每个技能声明 data_access_level(raw/redacted/verified_only),CI lint 校验; reviewer 侧量规可私有,保证评分金标不进入生成智能体上下文。
  9. Sprint Contract 硬门(Schema 13):评审员在读论文前先 paper-blind 提交评分承诺(Phase 1),再 paper-visible 评分(Phase 2);check_phase_conformance.py 校验边界;编辑合成器用机械三步协议。
  10. 模型分层(#517)economy(执行类降一级,地板 Opus)/ quality-boost(判断类升到前沿),相对位置而非硬钉模型 id;未设则与历史行为字节等价。
  11. 海量 CI 契约执行器:defrift 锁、sha256 内容锁(66 变异测试)、命令不变量、发布纪律——把“prompt 即代码”的工程质量推到极致。

6. 附:核心代码节选

6.1 流水线流程图(来自 docs/ARCHITECTURE.md)

flowchart TD Start([User input]) S1[1. RESEARCH<br/>🧑 deep-research] S2[2. WRITE<br/>🧑 academic-paper] G25{{2.5 INTEGRITY<br/>✓ 7-mode checklist}} S3[3. REVIEW<br/>🧑 academic-paper-reviewer] D3{Decision} RC[🧑 3→4 Revision Coaching<br/>max 8 rounds] S4[4. REVISE<br/>🧑 academic-paper] S3p[3'. RE-REVIEW<br/>🧑] D3p{Decision} RS[🧑 3'→4' Residual Coaching<br/>max 5 rounds] S4p[4'. RE-REVISE<br/>🧑 content frozen] G45{{4.5 FINAL INTEGRITY<br/>✓ Mode 2 deep check}} S5[5. FINALIZE<br/>🧑 format selection] S6[6. PROCESS SUMMARY<br/>🧑] End([Done]) Start --> S1 --> S2 --> G25 G25 -- PASS --> S3 G25 -- FAIL, max 3 retries --> S2 S3 --> D3 D3 -- Accept --> G45 D3 -- Minor / Major --> RC --> S4 D3 -- Reject --> End S4 --> S3p --> D3p D3p -- Accept / Minor --> G45 D3p -- Major --> RS --> S4p S4p --> G45 G45 -- PASS --> S5 G45 -- FAIL --> S4p S5 --> S6 --> End

6.2 SKILL.md frontmatter 范例(deep-research)

---
name: deep-research
description: "Universal deep research agent team. 13-agent pipeline for rigorous academic research on any topic. 8 modes: ... Triggers on: research, deep research, ... 研究, 深度研究, ... 심층 연구, ..."
metadata:
  version: "2.11.0"
  last_updated: "2026-07-11"
  status: active
  data_access_level: raw
  task_type: open-ended
  related_skills:
    - academic-paper
    - academic-pipeline
---

6.3 scripts/arxiv_client.py 核心节选

无需 API key 的 arXiv 解析器,体现“确定性引用验证”工程思路:

class ArxivClient:
    def arxiv_id_lookup(self, arxiv_id, expected_title):
        """arXiv ID lookup with mandatory 0.70 title cross-check."""
        entries = self._get({"id_list": arxiv_id})
        if not entries:            # non-existent ID -> empty feed
            return None
        entry = entries[0]
        title = _extract_title(entry)
        if _similarity(title, expected_title) >= _TITLE_SIMILARITY_THRESHOLD:
            return _entry_to_dict(entry)
        return None                # ID_MISMATCH

    def title_search(self, title, year=None):
        """Title search under the #431 exact-title-or-bust gate."""
        if generic_title(title):
            return None
        entries = self._get({"search_query": f'ti:"{title}"', "max_results": "5"})
        # 仅当 0.70 相似度 AND 精确归一化标题匹配才晋升;否则 resolver 降为 unresolvable
        ...

设计要点:429→3s 退避(遵循 arXiv ToU 节奏)、读取/解析失败 → ArxivUnavailable(不把上游故障持久化为假阳性 arxiv_unmatched)、非 Atom 200 体 → 降级而非缓存未命中。

6.4 scripts/cross_model_handoff.py 核心节选

规范跨模型交接信封的“确定性文法 + 安全失败路由”:

OPEN_FENCE = "[CROSS-MODEL-HANDOFF v1]"
CLOSE_FENCE = "[/CROSS-MODEL-HANDOFF]"

# 路由结果(调度器的完整决策空间)
AGREEMENT_FILL = "agreement_fill_no_reinvoke"
DIVERGENCE_REINVOKE = "divergence_reinvoke_owner"
FULL_RETURN_REINVOKE = "full_return_reinvoke_owner"
UNAVAILABLE = "unavailable"

class HandoffError(ValueError):
    """Malformed envelope or result -> [CROSS-MODEL-ERROR] + unavailable,永不伪造判断。"""

def route_result(handoff, transport_ok, raw_result):
    if not transport_ok or raw_result is None or _is_blank(raw_result):
        return Routing(UNAVAILABLE, error="transport_failure")
    if handoff.expected_result == "full_return":
        return Routing(FULL_RETURN_REINVOKE, return_context={...})
    try:
        result = _loads_strict(raw_result)
        _validate_structured_decision(result, handoff.decision_enum or (), who="cross_model_result")
    except (HandoffError, json.JSONDecodeError, RecursionError, ValueError):
        return Routing(UNAVAILABLE, error=f"malformed_result: ...")  # 永不伪造
    if result["decision"] == handoff.owner_decision["decision"]:
        return Routing(AGREEMENT_FILL)        # 一致 -> 机械填充,不重唤 owner
    return Routing(DIVERGENCE_REINVOKE, return_context={...})  # 分歧 -> 重唤原 owner

关键安全设计:未知版本围栏被拒(非静默当普通交付物)、重复 JSON key 拒绝、NaN/Infinity 拒绝、Unicode 格式字符(Cf)折叠检测、payload 内不得含围栏形行——任何畸形都安全失败到 unavailable,调度器永不编造判断。

6.5 MODE_REGISTRY 模式总览(27 模式)

技能 模式数 模式
deep-research 8 full / quick / review / lit-review / three-way-scan / fact-check / socratic / systematic-review
academic-paper 11 full / plan / outline-only / revision / revision-coach / abstract-only / lit-review / format-convert / citation-check / disclosure / rebuttal-audit
academic-paper-reviewer 6 full / re-review / quick / methodology-focus / guided / calibration
academic-pipeline 2 (pipeline 编排) / resume_from_passport=<hash>
合计 27 fidelity 16 (59%) / balanced 7 (26%) / originality 4 (15%)

附:关键数据速查

  • 版本:v3.19.0(2026-07-22)|许可证:CC-BY-NC-4.0|DOI:10.5281/zenodo.20696614
  • 四技能:deep-research(13 agents, 8 modes)/ academic-paper(12 agents, 11 modes)/ academic-paper-reviewer(7 agents, 6 modes)/ academic-pipeline(5 agents, 编排器)
  • 总智能体:39|总模式:27|CI lint 脚本:100+
  • 核心门禁:Stage 2.5 / 4.5 完整性(7 模式检查,不可跳过);Sprint Contract(评审员预承诺);L3 claim audit(opt-in);确定性引用验证(4 索引,arXiv 免 key)
  • 全流水线成本:约 $4–6 / 1.5 万字论文(不含跨模型)
  • 依赖:Claude Code + ANTHROPIC_API_KEY;可选 Pandoc/tectonic/Python 3/Git Bash/OpenAI·Google key