惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
D
DataBreaches.Net
F
Fortinet All Blogs
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
Apple Machine Learning Research
Apple Machine Learning Research
H
Help Net Security
M
MIT News - Artificial intelligence
美团技术团队
人人都是产品经理
人人都是产品经理
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
The Cloudflare Blog
有赞技术团队
有赞技术团队
L
LangChain Blog
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 【当耐特】
S
SegmentFault 最新的问题
V
Visual Studio Blog
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
B
Blog
I
InfoQ

Tony Bai

Rust重写运动,到底是真香还是被吹爆? 刚刚,DeepSeek开源Harness:把Agent拆成插件,一切皆可换 Google官方下场安利:AI时代,Go才是“最适合”的编程语言 从 Mozilla 孤儿到独立王国:起底 Rust 基金会如何“养大”一门产业级语言 扎克伯格罕见发万字长文:超级智能不能被少数人垄断,必须属于每一个人 3600人、95%覆盖率、24万次拦截:Cloudflare怎么用AI把“提效不降质”变成现实 1.5万星背后:Google首次揭秘Agent Skills是怎么“造”出来的 Go 核心团队公开新提案流程设计:加权投票、多轨评审,能拯救积压的近千个提案吗? Go 密码学前掌门人亲自提案:crypto/passkey 要把“免密登录”这件事一次性做对 Rust官方发文:AI 可以审代码,但不能写代码 AI智能体的记忆,终于有人认真研究“文件系统”这条路了——新论文给出五个反直觉答案 三年磨一剑!Go 桌面框架 Wails 发布 v3公测版:多窗口、AST 绑定、透明构建系统一次到位 Go 正在背离初心?一条 Reddit 热帖,暴露了 Go 社区最深的分歧:简单,到底能坚持多久? ccsa:给 Claude Code 的 session 起个人类可记的名字,一键 resume 谷歌重磅论文:多智能体不是万能药!260组实验实测出AI 智能体的第一条“缩放定律” YC亲自下场开源内部Harness:QM,一个“多人在线”的公司级Agent操作系统 前谷歌工程师万字拆解:AI替你写代码的时代,你更需要写好一份设计文档 隐退三年后杀回来:HashiCorp创始人官宣二次创业,这次要做「万物的多路复用器」 Thoughtworks最新报告:代码生成不再是瓶颈,“没人能验证”才是! 刚刚,MCP协议迎来“史上最大更新”:State彻底消失,Claude率先适配支持 Go 1.28 大动作:泛型集合终于要进标准库了,Set、树形Map、堆一次性标准化 上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24% AI 写了 75% 的代码,工程师却越来越慌:“黑灯软件工厂”的问题不在 harness,而在模型本身 不用 Python,也能训练大模型:两年之后再看 Go 语言机器学习框架 GoMLX 百万行代码,两周搞定!Anthropic揭秘AI代码迁移六步法:秘诀不是改代码,是改流程 重磅!Tokio官方发布全栈框架Topcoat:不用WASM,AI时代Rust也能“糊”网页了 软件工厂的明与暗:当代码可以自动生产,人类为何必须留下一盏灯? Twitter之父再出手:Block开源Buzz,要让人类和AI Agent「同工同权」 Go 密码学维护者放大招:把 Passkey 存成一行字符串,还顺手为 Go 1.28 写好了 API Loop Engineering才火两个月,硅谷已经卷出“Graph Engineering”了
谷歌 SRE 重磅白皮书:当 AI 自动写出 10 倍代码,谁来阻止系...
bigwhite · 2026-06-15 · via Tony Bai

本文永久链接 – https://tonybai.com/2026/06/15/google-ai-in-sre

大家好,我是Tony Bai。

整个软件工程界正在经历一场由生成式 AI 引发的“效率大爆炸”

随着 GitHub Copilot、Claude Code、Codex 以及OpenClaw、Hermes等各类AI Agent 的普及,企业编写代码、构建功能并将其推向生产环境的速度,正在以 4 倍到 10 倍 的速度疯狂飙升。

然而,在这场高歌猛进的效率狂欢背后,软件工业最脆弱的防线——系统稳定性(SRE, Site Reliability Engineering),正在面临前所未有的毁灭性挑战。

传统由人类主导的 Code Review、基于静态监控指标的告警排查,在“机器以微秒级吞吐代码”的时代,已经彻底沦为杯水车薪。当代码提交量和部署频率暴涨 10 倍,意味着系统故障和未知黑盒技术债的涌入速度也暴涨了 10 倍。

为了应对这场“AI 带来的生产力过载危机”,谷歌 SRE 团队于近日发布了一份极具颠覆性的系统级白皮书:《AI in SRE: How Google is Engineering the Future of Reliable Operations》。

在这份白皮书中,谷歌首次向外界披露了其内部正在运转的、以 Agent 编排与闭环控制(Closed-loop Control)为核心的下一代自愈式运维系统。


图:可由AI改进优化的SRE各个环节

今天,我们就来深度拆解这份代表着全球顶级运维水平的技术白皮书,看看谷歌是如何在 AI 时代,重新定义系统可靠性边界的。

为什么 AI 编码越快,运维死得越早?

谷歌 SRE 团队在白皮书的摘要中开门见山地指出:Site Reliability Engineering 正处于一场范式转移的阵痛中。

传统 SRE 的工作模式(SLO 定义、错误预算、消除琐碎工作)是建立在“人类编写代码的速度有限”这一物理前提下的。当 AI 充当了代码放大器,系统复杂度的膨胀速度已经远远超出了人类的阅读和心智承受极限。

谷歌提出了 AI 在运维系统中的 五个自治级别(SRE AI Autonomy Levels)

在 L0 和 L1 阶段,人类还是绝对的“消防员”。但面对海量的机器代码,人类的响应时延(以分钟或小时计)在微秒级的故障蔓延面前毫无抵抗力。

谷歌认为,未来的 SRE 必须快速向 L3(高度自治)甚至 L4(完全自治)推进——即让 AI 智能体在无需人类确认的情况下,自主检测、诊断并安全地执行线上变更。

但问题是:谁来保证 AI 智能体本身不会“抽风”? 一旦拥有自主执行权的 AI 智能体做出了错误的决策(例如在流量高峰期错误地清空了整个集群的负载),其造成的灾难(Blast Radius)将比人类操作失误大上千倍。

谷歌 SRE 的核武器:三大内部 AI 运维王牌组件

为了将 AI 安全地引入生产环境,谷歌在内部研发并上线了三套极具系统美学的底层 AI 平台。

1. IRM-Analyzer:将人类“救火轨迹”转化为黄金训练数据

AI 智能体要学会如何排障,首先需要向最优秀的人类 SRE 学习。但人类在排障时的行为是极其零散且非结构化的(躺在 Slack 聊天记录里、GVC 语音里、或者手动的命令行里)。

为此,谷歌开发了 IRM-Analyzer(事件分析平台)

IRM-Analyzer 能够自动将零散的 Slack 聊天、日志报错、监控曲线,自动提炼并拼装成结构化、可复现的人类排障轨迹(Human Trajectory)。

IRM-Analyzer 利用大模型,能够将一场长达数小时、涉及数十人的混乱救火过程,自动解析、过滤、去噪并聚合成一条精确的时间线(Timeline),标明:什么时候观察到了 SLA 异常、什么时候执行了 canary 排水(Mitigation)、什么时候验证了服务恢复。

这条高纯度的时间线,成为了训练 AI Operator(智能体运维官)的 “黄金数据(Golden Data)”

2. InvD(Investigation Dashboard):一键生成的排障图谱

在发生线上故障时,人类 SRE 往往需要手忙脚乱地打开几十个 Grafana 仪表盘,手动过滤日志。

谷歌自研的 InvD(自动排障仪表盘,Investigation Dashboards) 彻底终结了这一状态。当收到告警时,InvD 会自动爬取相关的遥测数据,结合历史黄金数据进行推理,自动在网页上渲染出一张“自动故障拓扑图(Automated troubleshooting graph)”(如下图所示)。它能直接指出:这是由于某个新版本的二进制 Rollout 导致的 CPU 节流,并建议立即执行隔离。

数据表明,InvD 的上线,让谷歌受影响服务的平均缓解时间(MTTM)骤降了 44%!

3. Antigravity CLI:用 Go 编写的 AI 运维终端

我们在之前的文章中提到,Go 已经成为了 Google 内部智能体系统的通用语言。在 SRE 领域,这一趋势得到了最直接的印证:谷歌推出了基于 Go 开发的全新核心终端——Antigravity CLI。

通过集成标准的 MCP(Model Context Protocol)协议,Antigravity CLI 让 AI 智能体可以直接通过命令行与谷歌内部庞大的 Borg 系统、日志系统和 Bug 跟踪系统进行交互:

  • 自动创建并分配故障单(Create/Assign Bugs);
  • 一键将事故复盘文档导出至 Google Docs;
  • 执行底层的流量排干与扩容指令。

终极安全防线:决策与执行的“冷热解耦”

在白皮书中,谷歌提出了一个极其震撼且对所有企业都有借鉴意义的安全架构:“不要让做决策的 AI,直接去碰你的服务器。”

谷歌将这一安全哲学称为 The Safety Trifecta(安全三驾马车),并在底层通过 Actus(Actuation Agent,执行控制智能体) 实现了完美的“决策与执行解耦”:

1. 思考脑:AI Operator(决策智能体)

当系统报警时,AI Operator 会介入调查。在它的控制台(CoT, Chain of Thought)上,它会写下它的思考过程(例如:“检测到内存 OOM,怀疑是由于昨天部署的镜像导致的,建议将其副本数扩容 100% 以平摊压力”)。

2. 安全闸口:Actus(执行校验智能体)

AI Operator 拥有极高的智慧,但它在 Google 内部没有一丁点直接操作服务器的物理权限。

它提出的所有变更请求,必须提交给一个由确定性安全规则和零信任机制控制的物理控制平面——Actus

  • 强制 Dry-Run 支持:任何 AI 提出的 API 修改,Actus 会首先将其置于 dry_run=true 状态进行沙箱模拟,观察系统的报错。
  • 智能体断路器(Agentic Circuit Breakers):Actus 拥有最高级别的限流权限。如果发现某个 AI Agent 陷入了无限死循环、或者短时间内发起了超出 quota 的异常变更,断路器会瞬间切断其所有执行权限,并向人类 SRE 抛出报警。
  • 零信任与最少特权:AI 智能体绝对不允许使用其开发者的个人凭证去登录服务器。它们拥有自己高度受控、双重强认证的 Agent Identities,且权限范围窄到极致(比如只允许在特定时间内调配流量,绝对不允许直接 ssh 运行原生 shell 脚本)。

这种将“会犯错的 AI 思考脑(LLM)”与“绝对遵守确定性安全规则的 Actus 控制面”进行冷热解耦的设计,是谷歌敢于将生产系统向 L3/L4 级别自治推进的终极底气。

范式革命:从“救火队员”到“安全架构师”的蜕变

当 AI 编排和 Actus 控制面接管了线上 90% 的基础告警和自动排水后,人类 SRE 应该去干什么?

谷歌给出的答案非常具有前瞻性:人类 SRE 正处于从“操作者(Operator)”向“安全架构师(Architect)”演进的关键节点。

过去,SRE 的价值体现在“手速”和“经验”上——谁能最快登录服务器找到那个坏死的配置,谁就是英雄。

现在,AI 的手速是人类的万倍。人类 SRE 的价值,转而体现在“定义安全边界和Actus策略(Defining Safeguards)”上:

  • 设计高质量的 Evaluation Pipeline:设计更好的回归测试集,确保 AI 智能体在上线前不会退化。
  • 架构高可用的渐进式发布(Progressive Rollouts):针对 AI 10倍速的代码产出,设计更加敏感、能够自适应调整分流比例的“渐进式金丝雀发布”机制。

小结

大模型时代的到来,并没有像悲观主义者预言的那样带来软件工程的崩溃。相反,它正在强行将我们从枯燥、重复、高心智负担的“人肉运维”中解脱出来。

正如谷歌 SRE 团队在白皮书结尾所展现出的深邃洞察:

在机器以微秒级吞吐代码、部署服务的时代,人类工程师的价值,不再于手持水枪冲进火场,而在于设计出一套完美无瑕、能够自动防爆的自愈消防网。系统可靠性的终极边界,依然牢牢掌握在那些对生产环境心存敬畏、能够设计出严密安全闸口的系统架构师手中。

AI 负责疯狂奔跑,而我们,负责用优雅的系统工程,为它画出最安全的跑道。

资料链接:

  • https://sre.google/resources/practices-and-processes/ai-engineering-reliable-operations/
  • https://cloud.google.com/blog/products/devops-sre/how-google-sre-is-using-agentic-ai-to-improve-operations

还在为写 Agent 框架频频死循环、上下文爆炸而束手无策?我的新专栏 从0 开始构建 Agent Harness 将带你:

  • 抛弃臃肿框架,回归“驾驭工程 (Harness Engineering)”的第一性原理
  • 用 Go 语言手写 ReAct 循环、并发拦截与上下文压缩引擎等,复刻极简OpenClaw
  • 构建坚不可摧的 Safety Middleware 与飞书人工审批防线
  • 在底层实现 Token 成本审计、链路追踪与自动化跑分评估
  • 从“调包侠”进化为掌控大模型边界的“AI 操作系统架构师”

扫描下方二维码,开启从 0 开始构建Agent Harness 的实战之旅。


原「Gopher部落」已重装升级为「Go & AI 精进营」知识星球,快来加入星球,开启你的技术跃迁之旅吧!

我们致力于打造一个高品质的 Go 语言深度学习AI 应用探索 平台。在这里,你将获得:

  • 体系化 Go 核心进阶内容: 深入「Go原理课」、「Go进阶课」、「Go避坑课」等独家深度专栏,夯实你的 Go 内功。
  • 前沿 Go+AI 实战赋能: 紧跟时代步伐,学习「Go+AI应用实战」、「Agent开发实战课」、「Agentic软件工程课」、「Claude Code开发工作流实战课」、「OpenClaw实战分享」等,掌握 AI 时代新技能。
  • 星主 Tony Bai 亲自答疑: 遇到难题?星主第一时间为你深度解析,扫清学习障碍。
  • 高活跃 Gopher 交流圈: 与众多优秀 Gopher 分享心得、讨论技术,碰撞思想火花。
  • 独家资源与内容首发: 技术文章、课程更新、精选资源,第一时间触达。

衷心希望「Go & AI 精进营」能成为你学习、进步、交流的港湾。让我们在此相聚,享受技术精进的快乐!欢迎你的加入!

img{512x368}


商务合作方式:撰稿、出书、培训、在线课程、合伙创业、咨询、广告合作。如有需求,请扫描下方公众号二维码,与我私信联系。

© 2026, bigwhite. 版权所有.

Related posts:

  1. 大洗牌!Google 内部确认:Go 正取代 C++,成为 AI Agent 时代的“通用语言”
  2. 从手写代码到日提 30 个 PR:Claude Code 缔造者的 AI 编程启示录
  3. AI 时代如何真正掌握一门新技术?这份非主流学习指南建议永久收藏
  4. 霸榜 GitHub 一周!Google 开源 ADK for Go,彻底终结 AI“炼丹”时代?
  5. 聊聊为什么我要花这么大精力,带大家手写 Agent Harness?