惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Recent Commits to openclaw:main
Recent Commits to openclaw:main
Simon Willison's Weblog
Simon Willison's Weblog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
S
Schneier on Security
Cyberwarzone
Cyberwarzone
NISL@THU
NISL@THU
The Last Watchdog
The Last Watchdog
Security Archives - TechRepublic
Security Archives - TechRepublic
The Hacker News
The Hacker News
Schneier on Security
Schneier on Security
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Help Net Security
Help Net Security
Scott Helme
Scott Helme
SecWiki News
SecWiki News
Security Latest
Security Latest
T
Threat Research - Cisco Blogs
L
LINUX DO - 最新话题
L
Lohrmann on Cybersecurity
TaoSecurity Blog
TaoSecurity Blog
K
Kaspersky official blog
Attack and Defense Labs
Attack and Defense Labs
P
Privacy & Cybersecurity Law Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
L
LINUX DO - 热门话题
N
News and Events Feed by Topic
Know Your Adversary
Know Your Adversary
Forbes - Security
Forbes - Security
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Google DeepMind News
Google DeepMind News
T
Tor Project blog
P
Palo Alto Networks Blog
Cisco Talos Blog
Cisco Talos Blog
A
Arctic Wolf
O
OpenAI News
T
The Exploit Database - CXSecurity.com
C
CXSECURITY Database RSS Feed - CXSecurity.com
AI
AI
N
News and Events Feed by Topic
博客园 - Franky
T
Threatpost
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Engineering at Meta
Engineering at Meta
S
SegmentFault 最新的问题
C
Cyber Attacks, Cyber Crime and Cyber Security
N
Netflix TechBlog - Medium
V2EX - 技术
V2EX - 技术
B
Blog RSS Feed
Hacker News: Ask HN
Hacker News: Ask HN
D
Docker
博客园 - 三生石上(FineUI控件)

博客园 - 沐子馨

Agent Loop:从对话式 AI 到自主智能体的范式跃迁 解锁图数据建模的奥秘 基于 Neo4j 与 Milvus 的图RAG系统搭建指南 解决复杂推理难题:KG-RAG 在大模型中的应用 RAG 评估常用工具简介 RAG系统效果不好?一文看懂如何进行系统评估 写出让 AI “秒懂”的技能Skill 深入理解 RAG 中的格式化生成与函数调用 解锁 RAG 系统中的高级检索与重排序策略 掌握查询重构与智能路由的艺术 告别黑盒:手把手实现一个可解释、可调试的 Text2SQL 代理系统 告别简单向量搜索:RAG 中的高级查询构建与优化策略 深入理解 RAG 中的混合搜索策略 告别基础检索:掌握 RAG 中的句子窗口与递归路由策略 构建多模态检索系统:Milvus 部署、Schema 设计与混合检索实践 向量数据库原理与实战:从核心机制到 FAISS 应用 多模态向量嵌入:从文本到图像的语义统一与 RAG 应用 构建高效 RAG 的基石:深度解析 Embedding 模型原理与优化 All-in-RAG:解锁大模型“开卷考试”的终极能力 AI Agent 是如何思考的?一文读懂推理与决策引擎 给企业装上“AI 大脑”:AgentSpace 如何从“手动检索”跨越到“智能决策”? Agentic 框架快速概览 AI 智能体交互如何带领它走出对话框,从屏幕像素迈向真实物理世界 高级提示词技巧如何带领大模型走出“一本正经胡说八道”的误区? 当 AI 学会“开疆拓土”:探索与发现模式如何从源头打破静态知识的桎梏,在陌生领域催生新洞见? 拒绝 AI “手忙脚乱”:优先级模式如何为智能体打造毫秒级的“任务调度官”? 构建生产级可信 Agent:评估与监控中的自动化审计与闭环优化机制 当 AI 学会“三思后言”:安全护栏如何从源头掐灭偏见、幻觉与恶意攻击? 拒绝“张口就来”:推理技术如何让 AI 像人类一样拆解复杂难题? 当家方知柴米贵:资源感知优化如何让 AI 智能体告别“算力浪费”? 开启多智能体互联时代:A2A 协议与 AI 协作网络的底层逻辑 为智能体装上“实时百科全书”:RAG 如何打破 AI 的知识边界? 构建负责任的AI:人类监督、干预与反馈闭环机制 当工具失效、网络中断:AI智能体的应急与自修复指南 赋予AI“北极星”:如何让智能体自主设定并追踪目标 打破“M×N”集成魔咒:MCP如何重塑AI应用架构 赋予模型“生命力”:大语言模型如何通过学习实现持续适应 赋予模型“长期记忆”:大语言模型的记忆管理机制 AI的“社会性”:深入理解多智能体协作机制 理解AI智能体的规划机制 理解大模型的工具使用 智能体的元认知:反思模式与自我优化机制 智能体并行化模式:提升复杂工作流性能的关键技术 超越线性执行:使用LLM实现智能体路由模式 解构复杂任务:深入理解提示词链(Prompt Chaining) 别再被 AI 术语唬住了!一文理清你需要了解的所有概念 不止是多写几句:谷歌如何用69页白皮书重塑提示工程 [转]长PDF文档的总结与评估策略 Context 工程:如何把正确的上下文喂给 AI 前端如何写出优秀的 AI Agent Skills mac安装python后command not found: pip keep-alive 原理剖析 如何优雅地在 React 中使用TypeScript,看这一篇就够了! react useContext React Context 详细介绍(状态共享、数据传递) 以用户为中心的性能指标【译】 element下拉框远程搜索debounce防抖控制 vue-router打开新窗口 propmise: allSettled()与all()的区别 使用 new Date() 在chrome、安卓和 IOS 中表现不同
终端革命:AI Agent 正在重新定义命令行
沐子馨 · 2026-05-12 · via 博客园 - 沐子馨

引言

开发者的命令行界面,长期以来都是精确命令式指令的堡垒,如今正经历着深刻的变革。它正在从一个简单的 Shell 演变为由一类新型工具驱动的智能协作工作空间:AI 智能体命令行界面(CLI)。这些智能体不仅仅是执行命令;它们理解自然语言,维护整个代码库的上下文,并能执行复杂的多步骤任务,自动化开发生命周期的重要环节。

本指南深入剖析了这一新兴领域中的四个主要参与者,探索它们的独特优势、理想用例和设计理念,以帮助您确定最适合您工作流的工具。需要注意的是,为特定工具提供的许多示例用例通常也可以由其他智能体完成。这些工具之间的关键区别往往在于它们为给定任务所能达成结果的质量、效率和精细度。后续章节将讨论专门设计用于衡量这些能力的基准测试。

Claude CLI (Claude Code)

Anthropic 的 Claude CLI 被设计为一款高级编码智能体,对项目架构具有深度的全局理解。其核心优势在于它的”智能体”特性,能够为复杂的多步骤任务构建代码库的心智模型。交互过程高度对话化,类似于结对编程会话,它会在执行前阐述其计划。这使其成为从事大型项目的专业开发者的理想选择,这些项目涉及重大重构或实现具有广泛架构影响的功能。

示例用例:

  1. 大规模重构: 您可以指示:”我们当前的用户认证依赖会话 cookie。请重构整个代码库以采用无状态 JWT,更新登录/登出端点、中间件及前端令牌处理逻辑。”Claude 将读取所有相关文件并执行协调一致的更改。
  2. API 集成: 在提供新天气服务的 OpenAPI 规范后,您可以指令:”集成此新天气 API。创建服务模块处理 API 调用,新增组件展示天气信息,并更新主仪表板以包含该组件。”
  3. 文档生成: 指向文档匮乏的复杂模块,您可以要求:”分析 ./src/utils/data_processing.js 文件。为每个函数生成全面的 TSDoc 注释,阐明其用途、参数及返回值。”

Claude CLI 作为专业化的编码助手,内置了核心开发任务工具,包括文件读取、代码结构分析和编辑生成。它与 Git 的深度集成支持直接进行分支和提交管理。该智能体的可扩展性通过多工具控制协议(MCP)实现,允许用户定义和集成自定义工具。这使其能够与私有 API 交互、执行数据库查询及运行项目特定脚本。这种架构将开发者定位为智能体功能范围的决策者,实质上是将 Claude 塑造为由用户定义工具增强的推理引擎。

Gemini CLI

Google 的 Gemini CLI 是一款功能强大的开源 AI 智能体,专为高性能和易用性而设计。它凭借先进的 Gemini 2.5 Pro 模型、超大上下文窗口以及多模态能力(可处理图像和文本)脱颖而出。其开源特性、慷慨的免费额度以及”推理与行动”循环机制,使其成为一款透明、可控且出色的全能型工具,受众广泛——从业余爱好者到企业开发者,尤其适合 Google Cloud 生态系统的用户。

示例用例:

  1. 多模态开发: 您提供设计稿中的 Web 组件截图(gemini describe component.png)并指示:”编写 HTML 和 CSS 代码,构建外观与此完全一致的 React 组件。确保具备响应式设计。”
  2. 云资源管理: 利用其内置 Google Cloud 集成,您可以命令:”查找生产项目中所有运行版本低于 1.28 的 GKE 集群,并生成逐个升级这些集群的 gcloud 命令。”
  3. 企业工具集成(通过 MCP): 开发者为 Gemini 配置名为 get-employee-details 的自定义工具,该工具连接公司内部 HR API。提示词为:”为新员工起草欢迎文档。首先使用 get-employee-details --id=E90210 工具获取其姓名与团队信息,随后用该信息填充 welcome_template.md。”
  4. 大规模重构: 开发者需重构大型 Java 代码库,以新型结构化日志框架替换已弃用的日志库。他们可对 Gemini 使用如下提示:读取 ‘src/main/java’ 目录下所有 *.java 文件。针对每个文件,将 ‘org.apache.log4j’ 导入及其 ‘Logger’ 类实例替换为 ‘org.slf4j.Logger’ 与 ‘LoggerFactory’。重写日志记录器实例化及所有 .info()、.debug() 和 .error() 调用,采用带键值对的新结构化格式。

Gemini CLI 配备了一套内置工具,使其能够与环境交互。这些工具包括用于文件系统操作(如读取和写入)的工具、用于运行命令的 Shell 工具,以及通过网页抓取和搜索访问互联网的工具。为获取更广泛的上下文,它使用专用工具批量读取文件,并利用内存工具保存信息供后续会话使用。这些功能构建在安全基础之上:沙箱机制隔离模型操作以防范风险,而 MCP 服务器充当桥梁,使 Gemini 能够安全连接至本地环境或其他 API。

Aider

Aider 是一款开源 AI 编码助手,通过直接操作文件并将变更提交至 Git,扮演真正的结对程序员角色。其标志性特征是直接性:它应用编辑、运行测试进行验证,并自动提交每个成功的变更。作为与模型无关的工具,它赋予用户对成本和能力的完全控制权。其以 Git 为中心的工作流,使其成为注重效率、控制力以及代码修改全程透明可审计的开发者的理想选择。

示例用例:

  1. 测试驱动开发(TDD): 开发者可指令:”为计算数字阶乘的函数创建失败测试。”Aider 编写测试并确认失败后,后续提示为:”现在编写代码使测试通过。”Aider 实现函数后再次运行测试以验证。
  2. 精准 Bug 修复: 给定 bug 报告,您可以指示 Aider:”billing.py 中的 calculate_total 函数在闰年计算失败。将文件添加上下文,修复此 bug,并依据现有测试套件验证修复。”
  3. 依赖项更新: 您可以指令:”我们项目使用的 ‘requests’ 库版本过时。请检查所有 Python 文件,更新导入语句及任何已弃用的工具调用以兼容最新版本,随后更新 requirements.txt。”

GitHub Copilot CLI

GitHub Copilot CLI 将广受欢迎的 AI 结对编程体验延伸至终端环境,其核心优势在于与 GitHub 生态系统的原生深度集成。它能理解项目在 GitHub 中的上下文。其智能体功能支持分配 GitHub issue、实施修复并提交拉取请求供人工审核。

示例用例:

  1. 自动化 Issue 解决: 管理者将 bug 工单(如”Issue #123:修复分页差一错误”)分配给 Copilot Agent。随后智能体创建新分支、编写代码并提交关联该 issue 的拉取请求,全程无需开发者手动介入。
  2. 仓库感知问答: 团队新成员可询问:”本仓库中数据库连接逻辑定义于何处?需要哪些环境变量?”Copilot CLI 利用其对整个仓库的认知提供包含文件路径的精确答案。
  3. Shell 命令助手: 当面对复杂 shell 命令不确定时,用户可输入:gh? find all files larger than 50MB, compress them, and place them in an archive folder. Copilot 将生成执行该任务所需的确切 shell 命令。

Terminal-Bench:命令行界面中 AI 智能体基准测试框架

Terminal-Bench 是一套创新的评估框架,专用于衡量 AI 智能体在命令行界面中执行复杂任务的熟练程度。鉴于其基于文本的沙箱特性,终端被确认为 AI 智能体的理想环境。初始版本 Terminal-Bench-Core-v0 包含 80 项精心设计的人工任务,涵盖科学工作流与数据分析等领域。为确保公平对比,开发了极简智能体 Terminus 作为各类语言模型的标准化测试平台。该框架具备高度可扩展性,支持通过容器化或直接连接集成多样化智能体。未来规划包括实现大规模并行评估及整合现有基准测试。项目鼓励开源社区贡献任务扩展与框架协同优化。

结论

这些功能强大的 AI 命令行智能体的出现,标志着软件开发范式的根本性转变——将终端转化为动态协作环境。正如我们所见,不存在单一的”最佳”工具;相反,一个生机勃勃的生态系统正在成型,每个智能体都有其独特专长。理想选择完全取决于开发者需求:Claude 擅长复杂架构任务,Gemini 强于多功能多模态问题求解,Aider 专注 Git 中心化直接代码编辑,GitHub Copilot 则无缝融入 GitHub 工作流。随着这些工具的持续演进,熟练运用它们将成为核心技能,从根本上重塑开发者构建、调试与管理软件的方式。

参考文献

  1. Anthropic. Claudehttps://docs.anthropic.com/en/docs/claude-code/cli-reference
  2. Google Gemini Cli https://github.com/google-gemini/gemini-cli
  3. Aider. https://aider.chat/
  4. GitHub Copilot CLI https://docs.github.com/en/copilot/github-copilot-enterprise/copilot-cli
  5. Terminal Bench: https://www.tbench.ai/