欢迎阅读今天的 Agili 的 Hacker Podcast,我们将探讨 AI 攻克高阶数学带来的科研颠覆、语音模型传输底层的协议痛点,以及揭开闪电起源的物理新发现。
AI 突破多项式级别数学难题
17 分钟的博士级成果
菲尔兹奖得主蒂姆·高尔斯(Tim Gowers)分享了一次使用 ChatGPT 5.5 Pro 的经历。在约一个小时的交互中,该模型产出了一项达到博士水平的数学成果。研究聚焦于组合数学中的和集(Sumset,集合元素相加所得的集合)问题。系统需要在给定集合大小与和集大小的前提下,推导出集合直径(Diameter,集合中最大与最小元素的差值)的上限。
模型在思考 17 分钟后,提出利用西多集合(Sidon set,任意两个元素之和都唯一的集合)的构造方法,将原有的指数级上限优化到了多项式级别。这种思路原创且巧妙,不是对现有知识的简单拼凑,原本可能需要人类研究者耗费数周时间。
科研门槛与培养模式的颠覆
这种能力的跨越正在重塑学术界的规则。过去导师会给新手分配相对温和的问题作为起步,现在 AI 能轻易解决这些问题。高尔斯认为,数学研究的最低门槛已经变成了“证明 AI 证明不了的东西”。
资源鸿沟也在加剧。顶尖 AI 模型的访问权限昂贵且受限。数学曾是少数不需要昂贵设备就能开展的学科,未来的竞争可能演变为各院校 AI 模型能力的角逐。
人类学者的核心资产
社区讨论普遍认为,学习的本质在于思考过程中的摩擦与挣扎。如果博士生依赖 AI 跳过这些过程,将难以建立对问题空间的深层洞察。物理学教授 ziotom78 提到,AI 是排查复杂表达式中低级错误的得力工具,但在处理 3D 克利福德代数(Clifford algebras,一种将几何逻辑代数化的工具)等特定领域时仍会犯概念性错误。扎实的数学功底依然是研究者在与 AI 协作时保持专业判断和纠偏能力的基础。
OpenAI 语音 AI 背后的传输协议困境
为何 WebRTC 并不完美
OpenAI 在构建大规模语音 AI 时选择了 WebRTC(Web Real-Time Communication,网页即时通信)协议。这个最初为视频会议设计的协议优先保证低延迟,会激进地丢弃在网络波动中迟到的数据包。在语音交互场景下,丢包会导致 AI 接收到的指令不完整,进而生成错误的回答。
语音 AI 用户通常愿意多等 200 毫秒换取精准的回复。WebRTC 缺乏客户端缓冲机制,OpenAI 只能在发送端人为加入延迟(Sleep)以保证音频匀速播放。这种做法利用实时协议模拟流媒体传输,牺牲了音频质量并增加了系统复杂性。
扩展性与连接挑战
WebRTC 的连接建立通常需要 8 次网络往返(RTT),并依赖大量端口,容易被企业防火墙拦截。OpenAI 开发了一套自定义负载均衡方案,仅解析 STUN(Session Traversal Utilities for NAT,NAT 会话穿越实用程序)头部来转发数据。这缓解了端口压力,却破坏了协议原生的连接迁移功能。当用户从 Wi-Fi 切换到移动网络时,通话经常出现中断。
下一代传输方案的呼声
工程界呼吁转向更现代的协议。QUIC(一种基于 UDP 的高性能传输协议)仅需 1 次往返即可建连,并使用连接 ID 标识会话,允许用户在切换网络时保持通话连续。基于 QUIC 的 WebTransport 允许开发者自行控制延迟与质量的权衡,决定数据包的等待时间。社区开发者指出,一旦语音对话总延迟超过 500 毫秒,人机交互的自然感就会消失。随着原生语音到语音(S2S)模型的演进,数据以极小时间片持续流动,底层传输协议的升级势在必行。
揭开 Wi-Fi 路由器包装盒上的速度测算迷雾
真实的网速瓶颈
无线网速的瓶颈通常在客户端设备(如手机、笔记本电脑)而非路由器。受限于功耗和体积,多数移动设备仅支持 2×2 MIMO(Multiple Input Multiple Output,利用多根天线同时收发数据的技术)。路由器包装上的高数值(如 AX11000)是所有频段理论速度的总和。一台 2×2 MIMO 的手机根本无法跑满高端路由器的全部天线容量。
衡量性能的核心指标是物理层速率(PHY Speed,设备间建立连接的原始位速率)。由于协议开销和半双工(half-duplex,同一时刻只能发送或接收)特性,实际吞吐量通常只有物理层速率的 70%。
共享信道与信号衰减
Wi-Fi 是一种共享介质。Hacker News 用户 niobe 指出,即使 Wi-Fi 7 引入了改善多用户并发的 OFDMA(Orthogonal Frequency Division Multiple Access,正交频分多址)技术,信道竞争依然存在。当邻居使用相同信道时,设备必须共享该频率的传输时间。
Wi-Fi 7 引入的 4096-QAM(正交幅度调制,提高单位时间数据传输量的编码技术)对信号质量要求极高,通常只有在靠近路由器且无遮挡时才能生效。室内墙壁和地板的阻挡会导致网速迅速下滑。
改善家庭网络的实用建议
要提升远距离房间的网速,增加由有线网络连接的接入点(Access Point)效果最好。用户 blindriver 提醒,接入点并非越多越好,设备有时会死锁在远处信号较弱的旧接入点上,出现“粘性”问题。
选购路由器时,支持 4×4 MIMO、DFS(Dynamic Frequency Selection,动态频率选择)频道和 160 MHz 频宽的设备性价比更均衡。即使客户端只有两根天线,路由器也能通过波束成形(Beamforming,将信号功率集中导向特定设备)提升连接稳定性。
AI 时代重读《人月神话》
历久弥新的布鲁克斯法则
Fred Brooks 在 1975 年出版的《人月神话》(The Mythical Man-Month)依然在指导今天的软件工程。书中的布鲁克斯法则指出,向进度落后的软件项目增加人手,会使进度更加落后。人员增加会导致沟通路径呈指数级增长,瓦解协作效率。
Brooks 强调概念完整性(Conceptual Integrity)。一个为了保持思路一致而省略部分功能的系统,优于拼凑了许多独立好主意但缺乏协调的系统。
AI 是新的银弹吗?
Brooks 曾预言没有任何技术能让开发效率在十年内提升十倍。现在,开发者利用 Claude 等 AI 工具正在挑战这一论断。有工程师在社区分享,过去需要五人耗时一年的复杂系统集成,现在单人借助 AI 不到一年就能完成。AI 充当了 Brooks 构想中“外科手术团队”的辅助角色,大幅降低了沟通成本。
产出激增背后的认知债务
代码产出不等于交付成果。AI 能够快速处理偶然复杂度(Accidental Complexity,由实现方式引入的困难),但在面对本质复杂度(Essential Complexity,问题固有的难度)时,人类对核心逻辑的审视依然不可或缺。大量由 AI 生成的代码如果缺乏深刻理解,会积攒高昂的认知债务。组织流程中安全审计、发布决策等环节的处理能力,往往无法消化激增的代码量,成为新的交付瓶颈。
React2Shell:潜藏在服务端组件底层的安全漏洞
Flight 协议的安全盲区
安全研究员 Lachlan Davidson 发现了一个名为 React2Shell 的远程代码执行(RCE)漏洞,Meta 随后紧急修复。漏洞源于 Next.js 框架底层的 Flight 协议。该协议允许开发者在客户端和服务器间传递复杂的 JavaScript 对象,如日期或循环引用,突破了传统 JSON 格式的限制。
Flight 在处理对象引用时存在疏漏,它允许引用对象的原型属性。攻击者可以构造恶意消息,调用服务器端对象的继承属性并绑定在可控对象上,这就撕开了安全防线。
攻击链条的构建
漏洞的触发利用了 JavaScript 处理异步操作的机制。React 在解码 Flight 响应时使用了 await 关键字,这会自动调用目标对象上的 .then 方法。Davidson 向服务器发送伪造的“可等待对象”,触发服务器自动执行指定的函数。
通过提取 React 专用的 Chunk 对象原型方法,攻击者成功伪造了 React 的内部状态,并利用处理上传文件(blob)的代码逻辑执行了系统命令。由于 Flight 协议缺乏公开文档,其复杂的内部逻辑长期处于安全审计的盲区。
复杂架构带来的隐患争议
这一漏洞在社区引发了对 React 架构方向的讨论。React 试图模糊客户端与服务端的界限,引入服务端组件(RSC)。批评者指出,这种设计带来了具有“泄露抽象”特征的补丁代码,极易产生安全隐患。支持者则认为,这有效应对了 Web 开发中固有的数据加载复杂度。开发者在不熟悉底层渲染模型的情况下使用复杂框架,容易在无意中留下安全后门。
智能体时代的交互界面:从 Markdown 走向 HTML
纯文本的局限与 HTML 的崛起
Markdown 曾是人类与智能体交流的默认格式,但在处理复杂任务时,纯文本的局限开始显现。Anthropic 团队成员观察到,长篇 Markdown 文件的阅读体验欠佳。HTML(超文本标记语言)展现出了更高的信息密度,它能够直接集成表格、矢量图形、代码片段甚至交互式组件。
现在的智能体可以生成带有滑块和拖拽看板的“一次性编辑器”。用户通过调整 UI 界面完成参数配置后,再将数据导回对话中,改变了原有的交互流程。
效率与灵活性的取舍
生成 HTML 会消耗更多的大语言模型 Token(文本处理的最小单位),速度比生成 Markdown 慢 2 到 4 倍。社区用户指出,HTML 降低了人类手动修改文档的便利性,在版本控制工具中的代码对比也更加混乱。
部分开发者建议使用 MDX(支持嵌入组件的 Markdown 扩展)作为折中方案,或者在需要自动化分析时使用 JSON 格式。
增强用户的参与感
尽管存在性能取舍,HTML 让静态的输出变成了灵活的工作台。这种转变让用户能更直观地审视和干预智能体处理复杂逻辑的过程,在自动化工作流中保留了人类的控制感。
大语言模型在形式化验证中的“教材式”偏差
语法完美与逻辑脱节
Specula 团队测试了让 Claude 编写 Etcd 的 TLA+(一种用于并发系统的形式化规格说明语言)模型,发现模型只是在复述 Raft 论文的附录内容,没有体现真实的代码逻辑。
团队开发了自动化评测框架 SysMoBench 测试了 11 个系统。多数大语言模型在语法阶段表现完美,但在涉及一致性和系统不变性(invariant,系统需始终满足的安全属性)测试中,平均得分仅在 40% 左右。
两种典型的建模错误
这种“教材式建模”通常存在两种缺陷。第一种是陷入不可能的系统状态。例如在 ZooKeeper 选举逻辑中,真实代码会用新选票覆盖旧选票,而模型生成的代码将选票不断累加,导致状态推演失真。第二种是过度合并操作。模型将跨越多步的代码操作合并为一个原子动作,抹除了系统必然经历的中间状态。
框架引入了转换验证(Transition Validation),通过逐个检查系统真实运行轨迹切片,发现即使是 Claude 3.5 Sonnet,在面对复杂分布式系统时的一致性得分也极低。
寻找更可靠的验证路径
社区观点认为,事后让模型编写规格说明存在固有缺陷。像 Verus 这样将代码实现与验证直接耦合的工具能有效避免分歧。Specula 团队正在开发的专用建模智能体,通过自主阅读代码仓库来驱动工作流,表现优于基础模型。减少状态抽象过程中的信息损失仍是当前的攻坚方向。
用发光藻类制造无需电力的生物光源
酸碱度控制的光开关
科罗拉多大学博尔德分校的研究人员利用化学溶液,成功控制了发光藻类的生物发光(Bioluminescence)过程。这种名为 Pyrocystis lunula 的藻类平时只在受到扰动时产生毫秒级的闪烁。
研究发现,在 pH 值为 4 的酸性溶液中,这种藻类能持续发出明亮集中的光长达 25 分钟。研究团队将它们嵌入水凝胶(Hydrogel)中,通过 3D 打印制成各类形状。这些结构中的藻类能存活数周,且在四周后依然保持 75% 的亮度。
环保概念与物理现实
活体发光材料作为光合作用生物,能吸收二氧化碳,为照明技术提供了新思路。社区讨论指出,虽然这被称为“无需电力”的照明,但生物体内部运作依赖 ATP(三磷酸腺苷,细胞内能量分子)等化学能,荧光素的氧化过程也会释放少量二氧化碳。
特殊场景下的应用潜力
在效率上,生物发光难以直接挑战现代高能效的 LED 灯。但这种技术在特定场景具有独特价值,例如作为水质监测指示剂,或者为深海机器人提供无电池照明。藻类对温度高度敏感且需要定期光照维持生存,解决环境控制难题是其迈向实用化的关键。
高能物理视角下的闪电起源之谜
理论与观测的矛盾
地球上每时刻都有两千多场雷暴,但物理学家仍未弄清闪电开启的确切机制。长期以来,科学界认为闪电是云层电荷累积击穿空气的结果。但气象观测显示,雷雨云中的电场强度通常只有击穿空气所需理论值的十分之一。
逃逸电子与宇宙射线
物理学家 Joseph Dwyer 提出了逃逸电子雪崩(Runaway relativistic avalanches)理论。在电场中,接近光速移动的电子像子弹穿过雪花一样击穿原子,释放更多电子并产生伽马射线与正电子。这种反馈循环在毫秒内增强电场,诱发闪电。
洛斯阿拉莫斯国家实验室的研究则指向了外部诱因。来自深空的宇宙射线(超新星爆炸的碎片)撞击大气层产生的高能粒子流,可能像“引信”一样,在电场强度不足时强行电离空气路径,触发闪电。
捕捉云层中的微弱闪烁
NASA 的 ALOFT 任务驾驶高空飞行器穿越强风暴核心,证实了雷雨云内部即使没有可见闪电,也在持续发出微弱的伽马射线闪烁。雷暴云层本质上是一个活跃的粒子加速器。
闪电研究仍有许多未解之谜,包括向上喷发的蓝色喷流(Blue jets)和罕见的球状闪电。随着观测精度的提升,基础物理现象背后的高能机制正在逐步显现。
瑞士互联网档案库成立:构建分布式的数字记忆
延续千年的存证责任
瑞士互联网档案库(Internet Archive Switzerland,简称 IAS)近日在圣加仑成立。这是一家独立的非营利机构,与美国、加拿大等地的档案馆共享愿景,致力于构建具有韧性的全球数字图书馆。圣加仑拥有修道院档案馆等千年存证传统,IAS 选址于此具有象征意义。
数字信息的寿命正在受到文件格式更迭、存储介质损坏和付费墙的威胁。为应对这些挑战,IAS 启动了两个重点项目:与圣加仑大学合作建立生成式人工智能档案,为后代保存当下的 AI 模型;以及与联合国教科文组织合作的“濒危档案”计划,抢救受冲突和封锁威胁的数字资产。
分布式架构的韧性
在不同国家设立独立法律实体的做法,被视为应对政治压力和资金风险的策略。虽然各地机构拥有独立的董事会,但核心成员与技术架构保持紧密协作。这种分布式的网络避免了单一节点受损导致全球服务瘫痪,为保护人类集体记忆提供了坚实的基础设施。
播客全文
女:Hello 大家好,欢迎收听 Hacker Podcast,我是莓莓。
男:大家好,我是阿哲。
女:做产品经理这几年,我经常遇到一个头疼的情况。项目进度一旦落后,老板的第一反应就是“加人”。我最近看到 Martin Fowler 重新讨论了《人月神话》(The Mythical Man-Month)这本书,里面那个著名的布鲁克斯法则说得太准了,向进度落后的软件项目增加人手,只会让它更加落后。
男:这本书是 1975 年出版的。当时作者 Fred Brooks 总结的是 1960 年代开发 IBM 系统的经验。他提到人员增加会导致沟通路径呈指数级增加。如果协作机制没有设计好,整个团队的效率会瞬间瓦解。他当时提倡一种外科手术团队模式,也就是一个主程序员带几个专业的辅助人员。
女:过去很难实现这种模式,因为找齐专业辅助人员成本很高。现在情况变了。有个开发者分享了他用 Claude 辅助编程的经历。以前需要五个工程师花一年时间才能完成的复杂系统插件集成,他一个人不到一年就做完了。他一个人就像是一个外科手术团队,AI 包揽了那些繁琐的辅助工作。
男:这种效率提升确实打破了 Brooks 以前关于软件开发效率的预测。AI 解决了很多偶然复杂度(Accidental Complexity,由实现方式引入的困难)。不过,10 倍的代码产出并不等于 10 倍的交付速度。
女:对,产出和成果是两回事。半夜三点醒来,想到 AI 智能体还在不知疲倦地生成成百上千行代码,其实挺让人不安的。代码变得廉价后,人类去理解、调试这些代码的心理负担反而变重了。如果大型组织的发布审核流程跟不上,这些代码也只会堆积在代码库里。
男:我们在日常开发中已经能感受到这种变化。Anthropic 团队的 Thariq 发现,当智能体处理复杂任务时,传统的纯文本格式就不够用了。超过一百行的 Markdown 文件读起来非常吃力。他们开始让智能体生成 HTML(超文本标记语言)格式的文档。
女:这就把静态文档变成了动态工具。智能体可以直接给你一个带滑块的控制面板,或者一个可以拖拽的任务看板。你调整好参数,再把数据导回给它。这让普通用户在面对 AI 复杂的内部逻辑时,有了一个直观的抓手。
男:从开发角度看,这种做法有得有失。社区里有开发者提出,生成 HTML 消耗的 Token(大型语言模型处理文本的最小单位)更多,速度比生成 Markdown 慢 2 到 4 倍。如果是在版本控制系统里做代码差异比对,HTML 文件看起来会非常混乱。很多做自动化处理的工程师还是更倾向于使用 JSON(一种轻量级数据交换格式)。
女:而且过度依赖复杂的底层框架和协议,很容易留下安全隐患。最近安全研究员 Lachlan Davidson 报告了 Meta 的一个严重漏洞,就是一个典型的例子。
男:这个编号为 CVE-2025-55182 的漏洞出在 Next.js 框架底层的 Flight 协议上。这个协议是用来支持 React 服务端组件(RSC,React Server Components)的,它允许在客户端和服务器之间传递日期或者循环引用这类复杂对象。为了实现这种灵活性,Flight 协议用特殊的语法标识数据类型。
女:听起来这个协议为了方便开发者,把手伸得很长。
男:确实如此。Davidson 发现 Flight 在处理对象引用时有个安全缺口。它允许引用服务器端对象的继承属性。攻击的突破口在于 JavaScript 处理异步操作的方式。React 在解码 Flight 响应时使用了 await 关键字。当它遇到带有 .then 方法的对象时,运行环境会自动调用这个方法。
女:这就像是给系统递了一个伪装好的包裹。系统按照常规流程去拆解它,结果自动触发了包裹里的机关。
男:完全准确。Davidson 和另一位研究员 Sylvie Mayer 发现,他们可以提取 React 内部处理数据流的 Chunk 对象原型上的方法。通过利用 React 处理上传文件时的代码逻辑,他们构造出了能够执行任意系统命令的攻击载荷。Meta 安全团队反应很快,17 小时内就确认并修复了这个漏洞。
女:这件事在社区里引起了很大的讨论。Next.js 的创始人 Guillermo Rauch 自己也说这是安全检查的疏漏。React 这几年越来越想模糊客户端和服务端的界限,这种架构引入了大量复杂的补丁代码。有开发者提醒,如果不去搞懂框架底层的渲染逻辑,很容易像这样无意间打开一扇后门。
男:说到复杂的底层协议,OpenAI 在做大规模语音 AI 时遇到的问题也很有代表性。他们选择了 WebRTC(网页即时通信)协议,这在工程界引起了不小的争议。
女:WebRTC 我知道,以前做视频会议产品时经常接触。它最大的特点就是快,为了保证低延迟,如果网络稍微抖动一下,它会直接丢掉迟到的音频包。
男:这对视频会议没问题,人耳对稍微卡顿一下的容忍度很高。但对语音 AI 来说,丢掉一个音频包,AI 接收到的指令就不完整,给出的回答就会出错。
女:用户体验的逻辑在这里变了。如果我在和 AI 聊天,我宁愿多等 200 毫秒让它把我的话听全,也不想它因为丢包给我一个莫名其妙的回答。人机交互的那种流畅感一旦超过 500 毫秒的延迟,魔法感就消失了。
男:为了解决这个问题,OpenAI 不得不在发送端给每个音频包人为加入延迟,去保证匀速播放。这等于是用一个实时的协议去模拟流媒体传输,把原本简单的事情搞复杂了。而且 WebRTC 建立连接很繁琐,通常需要 8 次网络往返,还得占用大量端口,经常被企业防火墙拦截。
女:他们为什么不用更现代的方案?
男:目前行业方向都在朝着原生的语音到语音模型演进,数据切得非常碎。社区里普遍认为基于 UDP 的 QUIC 协议是更好的选择。它只需要 1 次往返就能建立连接。而且它用连接 ID 标识会话,就算你从 Wi-Fi 切换到手机网络,通话也不会断。OpenAI 现在面临前所未有的规模压力,只能先用成熟的协议,自己做了一套叫 Relay 的负载均衡方案来硬扛。
女:说到 Wi-Fi 切换,我最近刚好在折腾家里的网络。我买了一个包装上印着 AX11000 这种夸张数值的高端路由器,结果隔一堵墙在卧室用手机上网,还是会卡。
男:这是一个常见的认知误区。无线网速的瓶颈往往不在路由器,而在你的手机或者笔记本。大多数移动设备因为功耗限制,只支持 2x2 MIMO(多输入多输出,指利用多根天线同时发送和接收数据的技术)。不管路由器的天线再多、标称速度再快,你的单台手机根本吃不满它的容量。包装上的那个高数值,是 2.4 GHz、5 GHz 和 6 GHz 所有频段理论速度加起来的总和。
女:所以这个数值其实有很强的误导性。
男:对。衡量 Wi-Fi 性能要看物理层速率(PHY Speed,指设备间建立连接的原始位速率)。实际的应用层吞吐量只有这个速率的 70% 左右。更关键的是,Wi-Fi 是一种半双工(half-duplex,指同一频率在同一时刻只能发送或接收)的技术。
女:社区里的 niobe 说得好,Wi-Fi 本质上是一种共享介质。如果你的邻居和你用同一个信道,你们其实是在按时间切分共享这个频率。
男:虽然现在的 Wi-Fi 7 引入了能同时处理多个设备的传输技术,但物理规律是打破不了的。信号在室内遇到墙壁和地板,衰减得非常快。要改善远距离的网速,增加接有线网的接入点比用无线 Mesh 效果好得多。
女:不过有网友提醒,接入点也不是越多越好。手机有时候很笨,即使你走到新的路由器旁边,它还是死死连着远处信号很弱的那个,这就是所谓的设备粘性问题。
男:选购的时候可以关注支持 DFS(动态频率选择,允许 Wi-Fi 使用雷达占用频段的技术)频道的路由器。即使手机天线少,路由器多出来的天线也能通过波束成形(Beamforming,将信号功率集中导向特定设备的技术)提升连接的稳定性。
女:现在的技术演进速度太快了。网络协议在迭代,AI 的能力也在突飞猛进。菲尔兹奖得主 Tim Gowers 最近分享了一件事,他在没有给出实质性提示的情况下,让 ChatGPT 5.5 Pro 在一个小时内搞定了一项达到博士水平的数学研究。
男:这涉及组合数学里的和集(Sumset,指集合中元素相加所得结果的集合)问题。简单来说,就是看集合大小和它的和集大小之间,对集合的跨度有多大影响。MIT 的学生之前证明了它们之间是指数级关系。AI 想了 17 分钟,用了一种叫西多集合(Sidon set,指任意两个元素之和都唯一的集合)的构造方法,把这个上限优化到了多项式级别。
女:那个验证论文的学生确认,AI 的思路是原创的,不是在网上随便拼接的现成知识。物理学教授 ziotom78 也提到他用这种模型排查复数公式里的低级错误。不过在处理 3D 克利福德代数(Clifford algebras,一种将几何逻辑代数化的工具)这种极其特定的领域时,AI 还是会犯概念上的错。它现在就像一个高效但需要导师盯着的学生。
男:这种跨越确实让人兴奋,但也带来了新的问题。研究员 Olof Sisask 提到,数学以前是门不需要昂贵设备的学科。现在顶尖 AI 模型的访问权限很贵也受限制。普通院校和富裕机构之间的资源鸿沟正在拉大。
女:而且博士生的培养方式也要变了。以前导师会给点温和的小问题让新人练手。现在 AI 把这些小问题全包了。进入数学研究的门槛,变成了去证明那些 AI 证明不了的东西。如果在核心思路上人都插不上手,那人类学者的价值体现在哪呢?
男:Gowers 认为,学习过程中的挣扎是有价值的。如果直接跳过这些摩擦,人就建立不起对问题的深层洞察。他预测到了 2029 年,数学研究者不再是去追求证明某个具体定理的声望,而是通过解决难题来锻炼逻辑能力,这样才能具备审查和纠正 AI 错误的专业判断力。
女:要审查 AI 的错误确实需要极高的专业素养,尤其是在面对复杂的系统工程时。Specula 团队最近做了一个很有意思的实验,他们让大语言模型去写 Etcd 版本的 Raft 分布式协议规格说明。
男:用的语言叫 TLA+(一种用于并发和分布式系统的形式化规格说明语言)。表面上看,Claude 生成的代码通过了语法检查,也能在检查器里跑通。但研究人员仔细一看,发现它根本没有体现 Etcd 真实的运行逻辑,只是在复述 Raft 原始论文里的附录内容。
女:这就有点像学生考试遇到不会的题,就把课本上的原话默写上去。
男:为了查清这个问题,团队开发了 SysMoBench 评测框架。测试结果很有意思,多数模型语法得分很高,但在系统真实行为的一致性和不变性(invariant,即系统需始终满足的安全或存活性属性)测试中,平均只有 40 分左右。
女:它具体是怎么出错的呢?
男:有两种典型模式。第一种是陷入了真实系统永远不会到达的状态。比如在 ZooKeeper 的选举代码里,真实情况是用新选票覆盖旧选票。但 AI 却把选票全存进集合里不断累加。这种写法在教科书里很常见,但不符合实际情况。第二种是它把代码里好几个步骤合并成了一个不可分割的动作,直接把系统运行中必然会出现的中间状态给抹除掉了。
女:这很要命。如果连中间状态都覆盖不到,这种验证就成了表面文章。
男:所以 SysMoBench 引入了转换验证方法,把系统执行轨迹切分成前置状态、动作和后置状态的小窗口,逐个去检查。结果发现,即便换成 Claude 3.5 Sonnet 这种强力模型,在面对复杂的真实系统时,得分依然很低。这说明事后让 AI 去写规格说明很容易脱节,可能需要在写代码的同时就绑定形式化验证。
女:AI 确实还没有全知全能。说到这种让人着迷但又充满未知的现象,我想起物理学界一直在研究的一个问题。地球上随时都有超过两千场雷暴在发生,但闪电究竟是怎么产生的,到现在还没完全搞清楚。
男:本杰明·富兰克林两百多年前证明了闪电是电火花。科学界一直以为,那是云层的电荷积攒到了击穿空气的临界值。但观测数据显示,击穿空气每米需要 300 万伏特的电场,而气象气球在雷雨云里测到的电场强度连十分之一都不到。
女:也就是说,雷暴云是在电量远不够的情况下,强行劈出了闪电。
男:这就引入了天体物理学的视角。物理学家 Joseph Dwyer 提出了逃逸电子雪崩理论。在电场里,有些电子移动速度接近光速,它们撞击空气分子释放出更多电子,还会产生伽马射线(Gamma rays,能量最高的光射线)和正电子(Positron,电子的反物质对应物)。正电子被电场推回去,又触发新的雪崩。这个循环在几毫秒内把电场强度瞬间拉高,闪电就出来了。
女:NASA 后来派飞行器直接飞越强风暴的核心,证实了雷雨云内部真的像一个粒子加速器,就算没有闪电劈下来,里面也在不断发出微弱的伽马射线闪烁。
男:还有另一种解释。洛斯阿拉莫斯国家实验室的科学家发现,某些闪电的启动方向和云层电场方向对不上。他推测是来自深空的宇宙射线,也就是超新星爆炸的碎片,撞击大气层产生的粒子流成了引信,强行点燃了空气路径。
女:这个画面太震撼了。地球上的每一次打雷,都可能是一颗遥远恒星死亡的回响。尽管闪电的能量惊人,但真要收集起来其实并不多,折算下来也就相当于几十加仑的汽油。相比之下,科罗拉多大学博尔德分校的一项新研究,提供了一种更可控的光源。他们用化学溶液激活了藻类的生物发光(Bioluminescence,生物体通过化学反应产生光的现象)。
男:这种叫 Pyrocystis lunula 的藻类平时只在受到扰动时闪一下。研究人员把它们放进 pH 值为 4 的酸性溶液里,酸度跟番茄汁差不多,它们就能持续发出明亮的蓝光长达 25 分钟。如果换成碱性环境,光就会变散变暗。
女:他们还用 3D 打印技术把这些活体藻类封存在水凝胶里做成各种形状。就算放了四周,只要回到酸性环境,还能保持 75% 的亮度。这不仅不需要插电,还能顺带吸收二氧化碳。
男:从原理上看,这确实不依赖外接电源,但藻类维持生命发光还是得靠它们体内的化学能,而且发光反应氧化荧光素时依然会释放极少量的二氧化碳。现在的 LED 灯能效已经非常高了,这种生物发光在亮度上还比不了。
女:它肯定不是用来照亮客厅的。但想想看,如果把它放在深海探测器上,或者做成水质监测器,水里一有特定毒素它就亮起来预警,这些特定场景的潜力很大。
男:目前最大的技术阻碍是环境控制。藻类对温度很敏感,而且不能一直在暗处生存,没法直接替换现有的电力照明系统。
女:我们今天聊了 AI 编程、网络协议、复杂的数学定理,还有自然界的发光现象。产生这么多有价值的信息,怎么保存它们也是个大问题。最近,瑞士互联网档案库在圣加仑正式成立了。
男:这是一家独立的非营利基金会。他们和大家熟悉的美国互联网档案库愿景一致。现在的数字信息其实非常脆弱。数字文件的格式会过时,存储介质会损坏,有时候还会遭遇刻意删除或者被锁在付费墙后面。
女:圣加仑这个地方很有底蕴,那里有超过千年历史的修道院档案馆。把新的数字档案库存放在那里,有一种历史传承的感觉。他们现在重点做两个项目,一个是把现在的生成式 AI 模型存档留给后人,另一个是跟联合国教科文组织合作,抢救那些面临灾害或者冲突威胁的数字内容。
男:在不同的国家设立这种独立的法律实体,也是一种防范风险的策略。分布式的架构可以让档案库在面对资金或者地缘压力时更具韧性,不至于因为一个节点出问题就导致全球的服务瘫痪。
女:这是一种必须要做好的基础设施建设。我们的记忆和知识,总得有个安稳的存放处。好了,今天的话题就聊到这里,感谢大家的收听。大家在各种泛用型播客客户端都能搜索订阅我们的节目,我们下期再见。
男:下期见。
参考链接
- A recent experience with ChatGPT 5.5 Pro
- OpenAI’s WebRTC problem
- Wi is Fi: Understanding Wi-Fi 4/5/6/6E/7/8 (802.11 n/AC/ax/be/bn)
- Mythical Man Month
- The React2Shell Story
- Using Claude Code: The unreasonable effectiveness of HTML
- Can LLMs model real-world systems in TLA+?
- Light without electricity? Glowing algae could make it possible
- What causes lightning? The answer keeps getting more interesting
- Internet Archive Switzerland

























