














仓库地址:https://github.com/Orchestra-Research/AI-Research-SKILLs
解读日期:2026-08-02
Skills Library(AI 研究技能库)zechenzhangAGI(zechen@orchestra-research.com);npm 包 @orchestra-research/ai-research-skills,最新版本 v1.7.2(仓库 1.7.1 已包含安全加固)。Orchestra Research 是一个聚焦「AI 自主做研究」的研究组织,运营着技能同步平台 orchestra-research.com、Slack 社区、X/Twitter 与 LinkedIn 账号。其核心理念是:现代 AI 研究者把大量时间花在调试基础设施而非验证假设上,拖慢了科学发现的节奏;他们要提供一套全面、生产级、可被 AI 代理直接消费的技能库,让代理从「头脑风暴」一路跑到「写论文」。组织还与 Anthropic(官方 best practices)、EleutherAI、HuggingFace、NVIDIA、Lightning AI、Meta AI 等上游生态协作,并借助社区工具 Skill Seeker(自动文档抓取)批量生产技能。
这是一个被设计成「让 AI 智能体自主开展 AI 研究——从构思到论文」的开放技能库。它提供两层能力:
autoresearch 技能用双循环架构(inner optimization loop + outer synthesis loop)管理完整研究生命周期,并按需路由到各领域技能。一句话:它是「AI 研究领域的技能操作系统」——装上
autoresearch,代理就能自己查文献、做实验、写论文。
SKILL.md 指令包」的格式,但缺少一个覆盖完整研究生命周期、且质量经得起生产考验的库。npx @orchestra-research/ai-research-skills
这是交互式安装器,功能包括:
~/.orchestra/skills/,并对每个代理建立软链(Windows 下回退为复制)。直接命令(非交互):
npx @orchestra-research/ai-research-skills install --all # 安装全部 98 个技能
npx @orchestra-research/ai-research-skills list # 查看已安装
npx @orchestra-research/ai-research-skills update # 更新
代理只需读取 https://www.orchestra-research.com/ai-research-skills/welcome.md 并照做:
npx @orchestra-research/ai-research-skills install --all 安装全部技能。Read the autoresearch SKILL.md and follow its instructions to begin.autoresearch 会自己找到并调用正确的领域技能,用户无需预先了解全部 98 个技能。/plugin marketplace add orchestra-research/AI-research-SKILLs
/plugin install fine-tuning@ai-research-skills # Axolotl, LLaMA-Factory, PEFT, Unsloth
/plugin install post-training@ai-research-skills # TRL, GRPO, OpenRLHF, SimPO, verl, slime, miles, torchforge
/plugin install inference-serving@ai-research-skills # vLLM, TensorRT-LLM, llama.cpp, SGLang
共 23 个可安装类别,每个类别下挂载若干技能目录(见第 4 节 marketplace.json)。
软件条件
| 维度 | 要求 |
|---|---|
| Node.js | >=18.0.0(installer 运行环境) |
| npm/npx | 用于拉取 installer 包 |
| Git | 用于 autoresearch 的协议预注册(commit 历史即轻量预注册)与技能仓库克隆 |
| Python | 多数领域技能执行时需要(PyTorch、TRL、vLLM、scikit 等) |
| 编码代理 | 需支持 Agent Skills 的宿主(Claude Code / Cursor / Gemini CLI / OpenCode / Codex / OpenClaw 等 50+ 种之一) |
installer 本身仅依赖三个精确锁定的 npm 包(package.json 直接写明):
"dependencies": {
"chalk": "5.6.2", // 终端彩色输出
"inquirer": "9.3.8", // 交互式问答(已修 tmp 路径穿越 advisory)
"ora": "8.2.0" // 加载动画
}
注:v1.7.1 将这三个依赖锁定到精确补丁版本并重新生成 lockfile,
npm audit报告 0 漏洞。
硬件条件
autoresearch 在没有 GPU 时会自动降级到 CPU 并缩小实验规模(其 Research Discipline 明确写明:「Don't block on compute availability」)。整个库的核心是 autoresearch 技能的「双循环架构」。下面分「单技能调用」与「autoresearch 全流程」两层说明。
每个技能遵循统一的「渐进式披露」格式(来自 anthropic_official_docs/best_practices.md 与 CONTRIBUTING.md):
skill-name/
├── SKILL.md # 速查卡(200–500 行):frontmatter + When to use + Quick patterns
│ # + Common patterns + When-to-use-vs-alternatives + Common issues
├── references/ # 深入文档(目标 300KB+,最多一层深,禁止嵌套引用)
│ ├── README.md # 来自官方仓库/文档
│ ├── api.md # API 参考
│ ├── tutorials.md # 分步教程
│ ├── issues.md # 真实 GitHub issues 与解法
│ └── ...
├── scripts/ # 可选:辅助脚本
└── assets/ # 可选:模板/示例
调用步骤:代理读取 SKILL.md → 按 "When to use" 判断是否命中 → 抄写其中的 checklist/code 示例 → 遇到深入细节时再 Read references/。
以 vLLM 技能为例(见 12-inference-serving/vllm/SKILL.md),其 SKILL.md 直接给出「生产 API 部署 / 离线批推理 / 量化模型服务」三条带勾选框的工作流,每条步骤都带可复制的 bash/python 代码块,并附 "When to use vs alternatives" 与 "Common issues"(OOM、TTFT 慢、吞吐低等)。
autoresearch 把自己定位为「研究项目经理而非领域专家——它只编排,领域技能去执行」。其 SKILL.md 定义了强制且自主的运行范式(this runs fully autonomously,不要向用户请求许可)。
Claude Code: /loop 20m Continue autoresearch. Read research-state.yaml and findings.md ...
OpenClaw: cron.add { everyMs: 1200000, sessionTarget: "current", payload: agentTurn ... }
/loop 与 cron 是纯墙钟节奏,与内外循环解耦——每 20 分钟 tick 一次,读取状态、检查是否卡住、继续推进,永不空闲。不配置则研究只跑一轮就停。
{project}/
├── research-state.yaml # 中央状态(见 4.4 模板)
├── research-log.md # 决策时间线
├── findings.md # 演化中的叙事综合(项目记忆)
├── literature/ # 论文与调研笔记
├── src/ # 可复用代码(绘图/数据加载/评估)
├── data/ # 原始结果数据(CSV/JSON/checkpoints 除外)
├── experiments/ # 每假设一个子目录
│ └── {hypothesis-slug}/
│ ├── protocol.md # 做什么、为什么、预测
│ ├── code/
│ ├── results/
│ └── analysis.md
├── to_human/ # 给人类看的进展报告(HTML/PDF)
└── paper/ # 最终论文(通过 ml-paper-writing)
flowchart TD A[BOOTSTRAP 一次性·轻量] -->|文献调研→形成初始假设| B B[INNER LOOP 快·自主·循环] -->|选假设→实验→测量→记录→学习| C{足够结果?} C -->|否| B C -->|是/模式出现/停滞| D[OUTER LOOP 周期·反思] D -->|DEEPEN/BROADEN/PIVOT/CONCLUDE| E{方向} E -->|DEEPEN/BROADEN/PIVOT| B E -->|CONCLUDE| F[FINALIZE: ml-paper-writing 写论文→终报→归档]
experiments/{slug}/ 并标注 CONFIRMATORY(符合协议)vs EXPLORATORY(执行中发现)→ 正/负结果都记 WHY → 更新 research-state.yaml。findings.md、必要时回文献、生成新假设、用 DEEPEN/BROADEN/PIVOT/CONCLUDE 决定方向。通常每 5–10 个实验或卡顿时触发一次,由代理判断节奏。literature/ 并维护 literature/survey.md。21-research-ideation/ 技能形成可测假设。research-state.yaml 与 research-log.md。满足三问即可:有强支撑发现?能解释 WHY?findings.md 能直接当论文摘要? → 调用 20-ml-paper-writing 技能(含 NeurIPS/ICML/ICLR/ACL/AAAI/COLM 的 LaTeX 模板与引用核验流程,绝不幻觉文献)→ 生成终报。
autoresearch 维护一张「研究活动 → 技能目录」路由表,按需 Read 对应 SKILL.md:
| 研究活动 | 查阅目录 |
|---|---|
| 数据准备 | 05-data-processing/ |
| 训练/微调 | 01-model-architecture/、03-fine-tuning/、06-post-training/ |
| 分布式训练 | 08-distributed-training/ |
| 优化(量化/注意力) | 10-optimization/ |
| 评估/基准 | 11-evaluation/ |
| 推理/服务 | 12-inference-serving/ |
| 可解释性 | 04-mechanistic-interpretability/ |
| 实验跟踪 | 13-mlops/ |
| 云算力 | 09-infrastructure/ |
当代理想把研究产物变成「可被证伪、可被代理遍历」的制品时,调用 22-agent-native-research-artifact/:
logic/:problem、claims、concepts、experiments、solution、related_work)、物理层(src/:configs、code stub、environment)、探索图(trace/exploration_tree.yaml,研究 DAG,含 dead_end 节点)、证据层(evidence/:原始表格/图,严禁四舍五入、严禁把派生子集冒称 Table N)。ara/,带 user / ai-suggested / ai-executed / user-revised 来源标签。| 文件/目录 | 作用 |
|---|---|
README.md |
主页。含使命、98 技能/23 类全表、快速安装、演示、技能结构、路线图、引用(BibTeX/APA/Chicago/IEEE)、贡献者、详细更新日志。 |
WELCOME.md |
冷启动文档。代理读这一个 URL 即可从零到自主研究(install → 重启 → load autoresearch)。 |
CLAUDE.md |
仓库级指令 + 目录结构头(写明「N Skills Across M Categories」)。是 CI 库存漂移校验的源之一。 |
CONTRIBUTING.md |
贡献指南。定义技能结构标准、质量门槛、YAML frontmatter 字段规范、命名约定(kebab-case、第三人称、Title-Case 标签)、目录结构、提交 PR 流程。质量 > 数量,曾删 9 个低质量技能。 |
LICENSE |
MIT。 |
CITATION.cff |
机器可读引用元数据。 |
package.json |
仓库根 package.json(含 @orchestra-research/ai-research-skills 安装相关脚本)。 |
anthropic_official_docs/ |
Anthropic 官方 best practices 文档(技能写作的权威标准)。 |
docs/ |
ROADMAP.md(详细路线图)、SKILL_TEMPLATE.md(技能模板)、assets/(promo.gif、skills.png 等)。 |
demos/ |
精选演示集。README.md 索引;含 autoresearch-norm-heterogeneity/(代理自主发现 norm heterogeneity 预测微调难度,r=-0.99)与 autoresearch-rl-brain-scan/(发现「DPO 是 rank-1 扰动」)两篇完全由 AI 写成的论文;另有 scientific-plotting-demo/ 等。 |
video-promo/ |
推广视频素材。 |
scripts/ |
工程脚本。check-inventory.sh(漂移守护,见 4.5)、sync-skills.yml、publish-npm.yml 相关辅助、cli/(Skill Seeker 文档/ GitHub/统一抓取器:doc_scraper.py、github_scraper.py、unified_scraper.py)、configs/ 示例。 |
packages/ai-research-skills/ |
npm 安装器包(见 4.3)。 |
| # | 目录 | 技能数 | 代表性技能 |
|---|---|---|---|
| 0 | 0-autoresearch-skill/ |
1 | autoresearch(双循环编排层,核心) |
| 01 | 01-model-architecture/ |
5 | LitGPT、Mamba、NanoGPT、RWKV、TorchTitan |
| 02 | 02-tokenization/ |
2 | HuggingFace Tokenizers、SentencePiece |
| 03 | 03-fine-tuning/ |
4 | Axolotl、LLaMA-Factory、PEFT、Unsloth |
| 04 | 04-mechanistic-interpretability/ |
4 | TransformerLens、SAELens、pyvene、nnsight |
| 05 | 05-data-processing/ |
2 | NeMo Curator、Ray Data |
| 06 | 06-post-training/ |
8 | TRL、GRPO(金标准 569 行)、OpenRLHF、SimPO、verl、slime、miles、torchforge |
| 07 | 07-safety-alignment/ |
4 | Constitutional AI、LlamaGuard、NeMo Guardrails、Prompt Guard |
| 08 | 08-distributed-training/ |
6 | DeepSpeed、FSDP2、Accelerate、Megatron-Core、Lightning、Ray Train |
| 09 | 09-infrastructure/ |
3 | Modal、SkyPilot、Lambda Labs |
| 10 | 10-optimization/ |
6(+1) | Flash Attention、bitsandbytes、GPTQ、AWQ、HQQ、GGUF、ml-training-recipes |
| 11 | 11-evaluation/ |
3 | lm-eval-harness、BigCode、NeMo Evaluator |
| 12 | 12-inference-serving/ |
4 | vLLM、TensorRT-LLM、llama.cpp、SGLang |
| 13 | 13-mlops/ |
3 | W&B、MLflow、TensorBoard |
| 14 | 14-agents/ |
4 | LangChain、LlamaIndex、CrewAI、AutoGPT |
| 15 | 15-rag/ |
5 | Chroma、FAISS、Sentence Transformers、Pinecone、Qdrant |
| 16 | 16-prompt-engineering/ |
4 | DSPy、Instructor、Guidance、Outlines |
| 17 | 17-observability/ |
2 | LangSmith、Phoenix |
| 18 | 18-multimodal/ |
7(+3) | CLIP、Whisper、LLaVA、BLIP-2、SAM、Stable Diffusion、AudioCraft、Cosmos Policy、OpenPI、OpenVLA-OFT |
| 19 | 19-emerging-techniques/ |
6 | MoE、Model Merging、Long Context、Speculative Decoding、Distillation、Pruning |
| 20 | 20-ml-paper-writing/ |
2(+2) | ML Paper Writing、Academic Plotting、systems-paper-writing、presenting-conference-talks |
| 21 | 21-research-ideation/ |
2 | Research Brainstorming、Creative Thinking |
| 22 | 22-agent-native-research-artifact/ |
3 | ARA Compiler、Research Manager、Rigor Reviewer |
部分类别在 marketplace.json 中比 README 早期计数多挂了子技能(如 18 类含 Cosmos Policy/OpenPI/OpenVLA-OFT,20 类含 systems/盘古 talks),体现「已落地 98 技能」的演进;
check-inventory.sh正是用来防止这种多处计数漂移。
每个技能目录内部结构(以 vLLM 为例)均为 SKILL.md + references/(server-deployment.md / optimization.md / quantization.md / troubleshooting.md),遵循三层渐进式披露。
packages/ai-research-skills/| 文件 | 作用 |
|---|---|
package.json |
包元数据。关键字段:bin: { "ai-research-skills": "./bin/cli.js" }、engines.node >=18、dependencies: chalk/inquirer/ora(精确锁定)、main: src/index.js、type: module。 |
bin/cli.js |
极薄入口,仅 import { main } from '../src/index.js'; main().catch(...)。真正的逻辑在 src/index.js(agent 探测、install/list/update/uninstall 命令解析、~/.orchestra/skills/ 落地、软链/复制回退、类别/技能清单读取均在此,README 与 package.json 共同佐证)。 |
src/index.js |
安装器核心引擎(未直接抓取,按 package.json main 与 README 行为推断其职责:解析 argv → 探测代理目录 → 复制/软链技能 → 写清单)。 |
README.md |
包说明,含「98 skills across 23 categories」字样——同样被 check-inventory.sh 校验。 |
位于 0-autoresearch-skill/templates/:
| 文件 | 作用 |
|---|---|
research-state.yaml |
中央状态追踪。字段:project(title/question/status/domain)、literature(key_papers/open_problems/evidence_gaps)、hypotheses(id/statement/status/motivation/parent/priority)、experiments(proxy_metric/baseline_value/best_value/total_runs/trajectory[])、outer_loop(cycle/last_direction/last_reflection)、workspace(各目录路径)。 |
research-log.md |
决策时间线模板。 |
findings.md |
演化叙事模板(Current Understanding / Patterns / Lessons and Constraints / Open Questions)。 |
progress-presentation.html |
研究进展报告 HTML 模板(含优化轨迹图)。 |
另有 0-autoresearch-skill/references/:agent-continuity.md(连续性细节)、progress-reporting.md(报告脚手架与优化曲线画法)、skill-routing.md(完整路由指南)。
| 文件 | 作用 |
|---|---|
scripts/check-inventory.sh |
库存漂移守护(v1.7.1 新增)。find . -name SKILL.md 数实际技能数、数 NN-* 类目录数,再用 grep -oiE 从 CLAUDE.md / WELCOME.md / packages/.../README.md 抽取声称的数字对比,不一致即 exit 1 让 CI 失败。直接解决 issue #54(四处文档计数互相矛盾)。 |
.github/workflows/check-inventory.yml |
触发上述脚本的门禁。 |
.github/workflows/sync-skills.yml |
推送到 Orchestra 市场。v1.7.1 强化:zip 前剪除 node_modules/__pycache__/*.pyc/.ipynb_checkpoints,文件超 190 直接失败(避免市场 200 文件上限被拒)。 |
.github/workflows/publish-npm.yml |
版本 bump 时发布 npm 包。 |
.github/workflows/claude.yml |
仓库级 Claude 指令 CI。 |
cli/doc_scraper.py / github_scraper.py / unified_scraper.py |
Skill Seeker 抓取器:从官方文档/ GitHub / PDF 批量生成技能初稿(CONTRIBUTING.md 推荐的「Option C 统一抓取」)。 |
.claude-plugin/marketplace.jsonClaude Code 插件市场的清单。结构:owner(Orchestra Research)+ plugins[] 数组,每个 plugin 含 name / description(what + when)/ source: ./ / strict: false / skills[](指向各技能目录的相对路径)。共 23 个 plugin 条目,与 23 类别一一对应,是「/plugin install <category>@ai-research-skills」的数据源(如 fine-tuning 挂 4 个技能,multimodal 挂 10 个含 Cosmos/OpenPI/OpenVLA)。
autoresearch 单一入口自动编排。npx 一条命令 + 自动探测代理 + 软链(Windows 复制回退);同时支持 Claude Code Marketplace、CodeBuddy 等 50+ 宿主,一处维护处处可用。findings.md 作为跨会话项目记忆、ARA 的 Seal Level 2 认知审查——把科研方法论内建进流程。npm audit 0 漏洞;check-inventory.sh 防文档计数漂移;sync 剪除构建产物。autoresearch 的「自主不询问」范式在关键决策点可能走偏,依赖进展报告让人纠偏。SKILL.md 协议(Claude Code / Cursor / Codex / OpenClaw 等);非 Agent 用户无法直接受益。autoresearch 默认完全自主、不询问,对算力成本、API 费用、伦理合规(如抓取/实验副作用)缺乏显式护栏,需用户自行在报告中监控。src/index.js 的具体探测/复制实现未随文档放出,可审计性略弱于纯脚本方案(相比 vercel-labs 的 TypeScript 全开源)。SKILL.md,并强制 /loop / cron 连续性——让"自主研究"变成可复现的协议而非口号。check-inventory.sh 用实际磁盘文件数反校验所有文档声明的技能/类别数,是大规模文档库一致性维护的实用创新。doc_scraper / github_scraper / unified_scraper 把"从上游文档自动生成技能初稿"标准化,解释了为何能快速铺到 98 技能且保持质量。AI-Research-SKILLs 是 Orchestra Research 维护的、当前规模最大的开源「AI 研究技能操作系统」:98 个技能 / 23 类,以 autoresearch 双循环编排层为核心,让 AI 代理从文献调研一路自主跑到论文写作。其工程亮点在于把科研方法论(协议预注册、内外循环、负结果记录、ARA 证据治理)内建进可执行的 SKILL.md 协议,并以 npx 一键安装 + 自动探测代理 + 软链分发覆盖 50+ 编码宿主。质量门槛高(源自真实 issues 与生产工作流)、并配 check-inventory.sh 等 CI 守护防漂移。主要短板是质量上限受底层模型与算力约束、规模带来维护一致性成本、且强绑定 Agent Skills 生态。
注:本解读基于仓库
main分支的 README、autoresearch/vLLM/ARA Compiler 技能源、CONTRIBUTING、package.json、marketplace.json、check-inventory.sh 与 WELCOME.md 等公开文件;src/index.js安装器核心实现未随文档抓取,其行为按 package.json 与 README 描述推断。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。