
























Agili 的 Hacker Podcast 今日速览:今天的目光集中在技术与人的关系上——Google 收紧 Android 控制权引发信任反抗,人们怀念“老土”论坛的归属感,而开源硬件和 AI 编码模型则在理想与现实的夹缝中寻找出路。
Android Developer Verification(ADV)作为系统服务随 Play Protect 推送,拥有 root 权限,无法禁用或移除。它的目标单一:阻止用户安装未经 Google 批准的开发者软件。F-Droid 开源应用商店将 ADV 比喻为“病毒”,因为它强制所有开发者向 Google 注册、付费、提交身份信息,并同意一份不定义“恶意软件”的条款,这意味着 Google 可以单方面封杀广告拦截等工具。
反对声浪包括 EFF(电子前哨基金会)、FSF(自由软件基金会)、ACLU(美国公民自由联盟)等超过 70 个组织,数十万人签名请愿。Google 自家的 Gemini 聊天机器人被问及该计划时也承认,除了 Google 本身,技术社区几乎找不到热心支持者。首批受影响的是巴西、印尼、新加坡和泰国,全球推送预计在 2027 年之后。
评论中有人列举了 SailfishOS、Ubuntu Touch、PostmarketOS 等基于 Linux 的移动操作系统。GrapheneOS 官方账号指出,这些系统在隐私和安全性上远不如 AOSP(Android 开源项目)或 iOS,缺少应用沙箱、现代漏洞防护和硬件级加密,且无法运行银行和政府强制使用的应用。GrapheneOS 自身通过沙盒化的 Google Play 兼容层提供 Play 服务,并与摩托罗拉 Mobility 合作,为想摆脱 Google 控制但仍需运行关键应用的用户提供了一条路径。用户面临的核心矛盾是:既不愿被锁定在封闭生态中,也找不到功能完整、安全可靠的替代系统。
1994 年,CERN 的 Ari Luotonen 用几天时间写出了最早的 Web 论坛软件。同年,Usenet 用户 Eric Hunting 已准确预测了论坛的特性:富媒体、非匿名、帖子作为可维护的“公告牌”。随后出现了 WebCrossing、WWWBoard、UBB、vBulletin 和 phpBB 等平台。BBCode——用方括号替代 HTML 尖括号的格式化语言——由 UBB 在 1998 年首创,影响了后来的 Markdown 乃至游戏引擎 Godot。
Tedium 编辑 Ernie Smith 怀念一个频繁宕机但社区氛围极好的新闻设计师论坛。他认为现代社交网络提供的是空洞的规模化互动,而论坛的粗糙感反而催生了真正的归属感。社区评论补充,论坛帖子可以十几年后被搜索引擎找到,而 Reddit 讨论的热度通常只有一天。论坛的头像、签名和昵称让用户形成长期关系,Reddit 的匿名大规模讨论则让用户更像随机 ID。有评论建议,如果能将树状回复和按时间排序结合起来,或许能两全其美——vBulletin 的某些版本就支持这种混合视图。
德国、荷兰的爱好者社区、DIY 汽车论坛、俄罗斯的 phpBB 论坛仍然活跃。它们的现实困境是维护成本(安全补丁、反垃圾)和英国《在线安全法》的潜在法律风险,但对小规模论坛来说这种风险极低。Discord 是实时聊天而非论坛:信息如流水般难以回溯,论坛的线程结构才适合长期积累的深度知识。
Maker's Pet 启动了 Oomwoo 项目,使用 2D LiDAR 进行建图,通过 ROS 2 和 Nav2 实现自主导航,原生集成 Home Assistant 智能家居平台,日常清洁不需要云服务。项目处于 v0 原型阶段:3D 打印底盘、Gazebo 仿真、手动 SLAM(同步定位与建图),主控方案在 Raspberry Pi 5 和 ESP32 之间待定。
多数评论认为,与其花 200 美元以上从零组装,不如花 70—80 英镑买一个带 LiDAR 的成品吸尘器,再用 Valetudo 刷固件实现本地控制——便宜得多,同样能达到目的。作者承认使用了 Claude AI 辅助生成文档,但有批评认为仓库目前只有 AI 写的 markdown 文件,没有可运行的代码。支持者则认为开源硬件和可定制性本身有价值。
有人建议用 ESP32 替代树莓派降低成本,或增加 PCA9698 GPIO 扩展芯片实现模块化 IO。作者对防缠绕刷、自定义清扫模式等提议一一回应,但项目概念对不满现有云吸尘器用户的吸引力,尚未转化为实际构建的动力。
Kimi K2.7 Code 作为可选模型上线 GitHub Copilot,这是该工具首次纳入非封闭模型。模型托管在 Azure 上,适用于 Copilot Pro、Pro+ 和 Max 计划,逐步覆盖 VS Code、JetBrains、Xcode 等 IDE。Business 和 Enterprise 版需管理员手动启用。
上个月 Copilot 转为按 token 计费后,大量用户抱怨原本每月 10 美元够用的额度几天就被烧光。社区情绪明显倾向于本地推理或多平台切换。一位用户直言:“我已经对云端 AI 产品完全失去兴趣”,并搭建了本地 Qwen3.6 推理设备,“不会在脚下变化”。用旧款 GTX 1060 能跑 11 tokens/s 的量化模型,或 Mac Mini 配 32G 内存运行 Qwen3.6-35B,被认为是务实选择。
有用户反馈 Kimi“会绕圈子,Claude 一次搞定的事它要重复好几次”。另一些人认为这可能源于量化或使用框架的问题。积极观点集中在成本上:价格与 GPT-5.4 mini 接近但输出 token 更便宜,且能看到完整推理链。对企业的价值在于可以用更低成本运行模型,数据托管在 Azure 上不发给原始开发者。一条高赞建议是:“不需要最新最大的模型——80% 的效率提升用免费本地模型就够了,不会被突然涨价割掉。”
Senior SWE-Bench 的指令中位数长度只有主流 SWE-Bench Pro 的 31%,但任务平均涉及 11 个文件,覆盖多服务、多栈场景。任务分为功能类(从真实 PR 提取,要求代理自行推断实现方案)和 Bug/性能类(需从用户报告出发,启动服务、调试运行时问题)。评分引入“品味评分”,由验证代理结合正确性测试和代码膨胀率、代码库惯例符合度等质量指标综合判定。当前最强模型 Claude Opus 4.8 的“品味解决率”仅 24%。
评论质疑用 LLM(大语言模型)评判“品味”不可靠,且“品味”缺乏客观标准。也有人支持,认为品味对应代码的可维护性和长期可靠性。另有人指出,高级工程师的关键能力是主动获取上下文(与客户交流、查看指标),而非仅填充不明确的指令,这个维度未被基准测试覆盖。一位用户观察到 Claude 在“模糊指令”场景下表现更好,而 GPT 在严格遵循指令时更可靠。
CursorBench 3.1 测试了 36 个模型/配置组合。Fable 5 Max 得分 72.9%,每个任务 18.02 美元。Cursor 自家的 Composer 2.5 得分 63.2%,成本仅 0.55 美元,超过了 Opus 4.8 Max(63.8%,7.59 美元)和 GPT-5.5 Extra High(64.3%,4.37 美元)。
有评论指出,在第三方基准 DeepSWE 上,GPT-5.5 得分 64、Opus 4.8 Max 得分 56,而 Composer 2.5 仅 16 分——差距悬殊,怀疑 Cursor 的基准存在过拟合。Cursor 员工 leerob 回应称,Composer 2.5 在 DeepSWE 长周期任务上确实不足,但在 Terminal-Bench 和 SWE-bench Multilingual 上表现很好。
一部分人将 Composer 2.5 作为日常主力:“对于小任务又快又便宜”。有人描述工作流:用 Composer 2.5 做简单编码,用 Opus 做计划和审查。反对者认为 Composer 2.5 在非标准 web 开发领域会保留“大而危险的漏洞”。一位用户总结:“唯一能信任的基准就是你自己的实际工作负载。”
零知识证明(ZKP)让用户可以向网站证明自己年满 18 岁,而不必透露出生日期或姓名。Google 开源的库名为 longfellow-zk,意在履行此前对欧盟 eIDAS 法规的承诺。实际实现依赖底层协议设计:政府作为签发者将数字身份与用户设备绑定,用户在本地完成证明运算,签发者不知道用户何时何地使用了该证明,请求方也只能得到“已满 18 岁”的结果。
反对者指出,如果证明可以无限复制,年满 18 岁的人能将证明分享给所有人——设备绑定和一次性令牌可解决,但会增加成本。另有担忧指向元数据:如果政府要求服务商和证书颁发机构保留日志,两者合并数据仍能复原用户身份轨迹。还有用户认为,推动年龄验证的立法初衷可能并非保护隐私,而是强化对网络内容的控制。技术本身只是拼图的一部分,真正决定隐私水平的是法律框架和各方的共谋动机。
这项由 UBC 主导的研究确认 mRNA 疫苗在预防 COVID-19 重症、住院和死亡方面表现突出。mRNA 不改变人体 DNA,仅提供临时指令训练免疫系统后被快速清除。研究强调该技术正向流感、RSV、个体化癌症疫苗等领域扩展。
关于“血栓”的报道主要与腺病毒载体疫苗相关,与 mRNA 技术无关。疫苗设计时并未承诺完全阻止感染,而是减轻症状并降低传播风险。研究指出制造规模的突破是关键:从周末设计出的序列到数十亿剂的生产,供应链一旦建成就可用于未来上百种应用。流感疫苗的制造周期从六个月的鸡蛋培养被压缩为更灵活的方案。
数学家 David Bessis 指出,数学界长期维持的“定理经济”只认可证明的定理,概念构建被视为次要。在人类数学家身上,定理证明和概念创新几乎总是共生,但 AI 让这种共生破裂。Geoff Hinton 将数学比作“一个有规则的封闭系统”,这让 Bessis 深感不安:如果实验室相信这个比喻,“解决数学”就成了可量化的目标,投资逻辑变得简单直接。
由 Martin Hairer 等 11 位数学家发起的“First Proof”项目发布了 10 个研究级问题。AI 实验室虽解决了 6—8 个,但解决方案充满垃圾输出,连 OpenAI 都分不清哪些答案是正确的。即使 Lean 形式化验证能保证正确性,这些证明也缺乏可理解性——Math Inc 用 AI 自动形式化 Viazovska 的球体堆积证明生成了 20 万行代码,但社区拒绝合并,因为没有暴露可复用的接口。
Bessis 呼吁数学界紧急进行“品牌召回”:数学不是证明机,而是认知基础设施。他提出“悬垂”概念——数学文献中存在大量未被关联的潜在价值,AI 基于超强记忆和模式匹配可能系统性收割这些成果。他的预测:纯数学和应用数学将更清晰分离,会出现利用 AI 快速探索新大陆的“直觉最大化者”,而数学本身会像健身一样——过程本身有价值,尽管机器已更强壮。有评论直接指出,数学界过去过分抬高“形式证明”而贬低解释性工作,现在 AI 正在用他们自己的规则打败他们。
科学家解剖被车撞死的袋熊后发现,它们的肠道中有两块弹性不同的区域:较硬的部分像橡胶带一样收缩更快,较软的部分则缓慢挤压出棱角。研究用 2D 数学模型模拟发现,肠道随着营养和水分的吸收反复收缩,最终把粪便塑造成边角分明的立方体。袋熊每天排出约 100 颗这样的粪便。
研究作者 David Hu 推测,袋熊会爬上有岩石和木头的高处标记领地,扁平的粪便不容易从高处滚落。有读者补充,瑞士旱獭也会把半消化稀便拉到高处的岩石上标记领地,只是旱獭拉的是稀便,袋熊拉出了坚固的立方体。野生袋熊的粪便比圈养的更接近立方体,形状越方正,袋熊就越健康。这项研究的价值可能在于帮助工程人员设计更好的材料塑形方法,并帮助科学家在圈养条件下更准确地评估袋熊的健康状况。
女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。
男:大家好,我是阿迪。
女:今天咱们聊的东西跨度有点大。从一个让很多安卓用户紧张的消息开始吧。最近 Google 在推一个叫 ADV 的东西,好多独立开发者和媒体都在反对,甚至有人说这是“病毒”,阿迪,这到底怎么回事?
男:ADV,Android Developer Verification,简单说就是个系统级的检查机制。它跟 Play Protect 一起推送,有 root 权限,你没法禁用,没法删除。它只干一件事——检查你要装的应用是不是经过 Google 批准的开发者签名的。如果不是,就拦下来。
女:这听起来像你家小区门口新装的闸机。以前访客登记一下就能进,现在必须提前在物业那儿录过人脸,物业说能进才能进。
男:对,而且物业的定义权很大。Google 要求所有开发者注册、付费、提交身份证件,还要同意一个根本没定义什么叫“恶意软件”的条款。也就是说,Google 可以单方面决定什么算恶意。比如一个去广告的工具,理论上可以被它判定为恶意直接封杀。
女:那这听起来就是一个借着安全名义收紧控制的事情。F-Droid 这种第三方应用商店怎么办?
男:F-Droid 就是最直接受影响的一方。它上面很多应用根本不会去 Google 那儿注册签名。ADV 全球铺开之后,这些应用在普通安卓手机上就装不了了。Google 说这是打击恶意软件,但超过 70 个组织——包括 EFF、自由软件基金会、ACLU——联名发了公开信反对。我在社区里看到有人跑去问 Google 自己的 Gemini 聊天机器人,说这个计划受欢迎吗,Gemini 的回答是:除了 Google 本身,在技术社区几乎找不到热烈支持。
女:那 Google 现在的推进节奏是什么?
男:已经开始了,第一批是巴西、印尼、新加坡、泰国,全球推送预计 2027 年之后。社区里在新加坡的用户说,他们很多生活服务完全绑死在特定安卓或者 iOS 应用上,银行、政府、甚至健身房入场都得用手机应用,根本没有替代选项。
女:这让我想起以前聊过的开放和封闭之争。如果有人不想被锁在 Google 的生态里,现在还有什么选择?
男:有一些基于 Linux 的移动系统,比如 SailfishOS、Ubuntu Touch、PureOS。但问题在于安全性和兼容性。GrapheneOS 的开发者在社区里说得很直白——这些替代系统在应用沙箱、硬件加密、漏洞防护上远不如 AOSP 或者 iOS,而且银行类、政府类应用基本跑不了。他们自己的方案是不依赖 Google 认证,通过一个沙盒化的 Google Play 兼容层来跑 Play 服务,同时跟摩托罗拉合作,在特定设备上提供官方支持。但前提是你得买那几款特定的手机。
女:所以现实就是:想自由,就得牺牲安全和便利;想要安全和便利,就得接受控制。好像两边都卡住了。
男:这正是目前的核心困境。用户既不愿意被锁在封闭生态里,又找不到功能完整、安全可靠的替代系统。随着 ADV 全球推进,这个矛盾只会更尖锐。
女:说到这种被平台“抛弃”的感觉,你知道吗,最近我看到一篇文章,讨论一个挺怀旧的话题——传统论坛为什么消失了。就是那种用 PHP 写的、动不动就 503 错误的论坛,你还记得吗?
男:何止记得,我大学时候泡过好几个。Visual Editors 那种新闻设计师论坛,用 UBB 或者 phpBB 搭的,页面简陋得不行,但氛围特别好。这篇文章是 Tedium 的编辑 Ernie Smith 写的,他怀念的就是那种“勉强能用”的粗糙感。
女:他用的词叫“闪亮物体综合征”,我们总是不断迁移到新平台,即使旧平台其实还能用。很多人怀念的是论坛那种“持久性”——一个帖子十年后还能被搜索引擎找到,而在 Reddit 上,一个讨论的热度通常只有一天。
男:树状回复结构是个双刃剑。Reddit 和 HN 这种嵌套回复确实更容易追踪有趣的子线程,传统论坛的平铺时间线你得翻好多页才能找到有用的东西。但树状结构的问题也很大——早期回复通过点赞霸占顶部,后来者的好内容基本被埋。而且点赞机制太容易被操控了,容易形成回音室。
女:我更喜欢论坛的一个点是身份连续性。你能记住别人的头像、签名、昵称,长期下来像一群老朋友在聊天。Reddit 上大家更像随机 ID,我经常分不清谁是谁。
男:而且论坛的“最后一次回复排序”让一个话题可以持续好几周,不像 Reddit 帖子几小时后就被算法冲走。Discord 常被说是论坛的现代替代,但本质完全不同——那是实时聊天,信息像水一样流过去,根本没法沉淀成可搜索的深度知识。
女:现在还有多少论坛活着?
男:其实不少。德国的爱好者社区、荷兰的 DIY 汽车论坛、俄罗斯的 phpBB 论坛——有人用 AI 翻译去参与讨论。但运维成本是现实问题,安全补丁、反垃圾,还有英国《在线安全法》带来的法律风险。不过有评论说,对于一个很小的论坛,法律风险其实极低,不用太焦虑。
女:论坛那种“自掏腰包、亲自维护”的感觉,反而筛选出了真正在乎社区的人。可能我们需要的不一定是能触达所有人的平台,而是一个能慢慢对话的角落,哪怕它看起来旧旧的。
男:说到自掏腰包亲自折腾,咱们今天有个特别贴合这个话题的项目——有人想从零造一个开源的机器人吸尘器。
女:等一下,吸尘器?自己造?
男:对,叫 Oomwoo。激光雷达建图,ROS 2 自主导航,原生集成 Home Assistant,所有硬件固件软件全开源,日常清洁不需要云。概念很吸引人,但社区反应挺分裂。
女:我第一反应是,买一个不就完了?
男:多数人也是这么想的。评论里最集中的意见就是:花两百多美元买零件再加一个树莓派,从头组装,还不如花七八十英镑买个带激光雷达的成品,然后刷 Valetudo——一个开源固件——把云功能干掉。同样实现本地控制,便宜得多。
女:那作者为什么要坚持从零造?
男:他说目标是用两百美元的零件堆出一个对标五六百美元中端机的产品。但评论指出,单买轮子、传感器这些东西比拆旧机器贵多了。另外有一批人更狠,说项目本质是“AI 生成的 slop”——仓库里暂时只有 LLM 写的 markdown 文件和合成图片,没有可运行的代码。作者也承认用了 Claude,但说这是为了提高效率。
女:我觉得这个概念本身挺有意思的。自己能修、能改、能加奇怪的功能——比如纯扫地不吸尘——这放在现有产品上根本不行。
男:支持者也这么说。开源硬件和可定制性本身就有价值,哪怕起步靠 AI,社区补上了就不是问题。技术上有人建议用 ESP32 替代树莓派降低成本,作者回应说在考虑。目前项目还很早期,v0 原型只是 3D 打印底盘加仿真,但它折射出很多人对云吸尘器的不满——你花了几百块买的设备,厂商随时可以改功能或者停服。
女:从吸尘器到代码工具,这种“不想被平台控制”的情绪好像贯穿了今天的话题。刚好,接下来这个新闻很适合接着聊——一个中国的开放权重模型 Kimi,现在已经上线 GitHub Copilot 了。
男:对,Kimi K2.7 Code,在 Copilot 里可以作为可选模型切换。这是 Copilot 第一次纳入非封闭模型,托管在微软 Azure 上,按 token 计费。
女:听起来是个大新闻?但看社区反应好像不太买账。
男:因为时机太差了。上个月 Copilot 刚转成按 token 计费,好多用户炸了——以前十美元一个月的额度,现在几天就烧光。有人用了几次 Claude Opus 的 prompt 就花完了整个月预算。好多人因此跑去了 Claude Code 或者干脆自己搭本地推理环境。
女:本地推理?用自己电脑跑?
男:现在挺流行的。有个用户说得挺实在:“我对云端 AI 产品完全失去兴趣了。价格涨、功能缩、东西随时消失,太累了。”他自己搭了一套 Qwen3.6 的本地推理,虽然说性能可能不如云端,但“不会在脚下变化”。还有人拿 GTX 1060 都能跑到 11 tokens 每秒,或者用 Mac Mini 32G 以上内存跑量化版。
女:那这些本地模型真的够用吗?
男:够用 80% 的日常任务。有用户说得很直白:“你不需要最新最大的模型才能当个严肃的开发者。80% 的效率提升用免费本地模型就解决了,不会被突然涨价割掉。”
女:那 Kimi 本身表现怎么样?
男:评价分化。有人说它“会绕圈子,Claude 一次搞定的事它要重复好几次”。也有人认为可能是量化或者 harness 的问题,强调同样的 Kimi 在 OpenCode 里很高效。积极的声音集中在成本——它价格跟 GPT-5.4 mini 接近,但输出 token 更便宜,而且能看到完整推理链。对企业来说,数据托管在 Azure 上、不发回原始开发者,满足了合规需求。
女:但我看社区整体情绪还是偏向本地推理或者多平台切换。一条高赞评论说:不要以为你需要的永远是前沿模型,能用本地模型解决 80% 的问题就用本地的,工具不会被夺走,钱包也不会被掏空。
男:这句话基本上可以刻在 2025 年每个开发者的桌子上了。
女:那说到模型能力,最近关于 AI 能不能替代高级工程师的讨论也很多。有个新的基准测试叫 Senior SWE-Bench,阿迪你给我解释一下它跟以前有什么不同?
男:以前的基准,比如 SWE-Bench Pro,给的指令太细了,接近代码规格书了。真正高级工程师面对的是什么?“给这个阅读应用加上 Google Books 作为备选元数据源”——就这一句话。Senior SWE-Bench 的指令长度只有原来基准的三成,但一个任务平均涉及十一个文件,跨多个服务和栈,要几百步才能完成。
女:这就像跟人说“把厨房重新设计一下,好用一点”,而不是告诉他“把微波炉往左挪三十厘米”。
男:对。而且评分也不只看测试通没通过,它还引进了一个“品味评分”——用一个验证代理综合判断代码膨胀、风格、是否贴合代码库惯例这些。最让人感触的数字是,现在最强的模型 Claude Opus 4.8,品味解决率也只有 24%。
女:也就是说最牛的 AI 在高级任务上还有七成五以上的失败率。
男:对。社区关于“品味评分”的争论很有意思。有人说用另一个 LLM 来评判品味本身不可靠——写代码的模型自己都不知道什么叫好品味,凭什么评判的模型就知道?而且“品味”缺乏客观标准,容易变个人偏好。支持的人则说,品味对应的其实是可维护性、可组合性和长期可靠性。
女:我倾向于觉得这个词选得不太好。说代码有没有“品味”,听着像在讨论红酒。叫“长期可维护性评分”可能更准确,但大家还是能用直觉理解它想衡量什么。
男:还有一个盲区是,高级工程师的核心能力不只是填充模糊指令,而是主动获取上下文——跟客户聊、看指标、做调研。这些基准测试完全覆盖不到这一层。
女:评估 AI 编码能力好像真的很难。不同的基准测出来的结果天差地别。
男:今天刚好有这个案例——Cursor 也发布了自己的基准 CursorBench 3.1。在他们的表里,自家模型 Composer 2.5 得分 63.2%,成本才 0.55 美元一个任务。作为对比,Opus 4.8 Max 得分 63.8%,成本 7.59 美元;GPT-5.5 Extra High 64.3%,成本 4.37 美元。
女:这性价比无敌了。但我猜社区肯定有话说。
男:直接被质疑过拟合。有人翻出第三方基准 DeepSWE,上面 GPT-5.5 得分 64、Opus 4.8 max 得分 56,而 Composer 2.5 只有 16 分。差距大到不太正常。有人直接说:“你家的基准显示你的模型几乎跟顶级模型一样好,但价格只有几分之一——这也太巧了。”
女:他们自己的员工回应了吧?
男:Cursor 的员工 leerob 出来解释了,说 Composer 2.5 在 Terminal-Bench 和 SWE-bench Multilingual 上表现很好,但在 DeepSWE 这种长周期任务上确实不行,正在改进。而且考虑到价格点,还是挺有竞争力的。
女:实际用起来怎么样?
男:两极化。有人认为它是日常主力——处理小任务又快又便宜,需要规划和代码审查的时候才切到 Opus。有人掐过,Composer 2.5 在类似任务上只花 Opus 十分之一的时间,代码质量大概差 10% 到 20%。反对声音也很尖锐:在非标准开发领域,比如物理引擎或者优化问题,它会“保留大而危险的漏洞,除非你像保姆一样盯着”。
女:听起来有点像我们开发团队内部对快慢模型的讨论——一个快手但不太稳,一个稳重但慢得让人想刷手机。
男:对,有人说 Opus 会主动停下来确认不确定的地方,但代价是简单请求有时候思考超过三十秒。所以你真正需要的是判断什么任务给什么模型。一位用户总结得好:“唯一能信任的基准就是你自己的实际工作负载。”
女:好,咱们从代码世界出来聊聊隐私。Google 最近开源了一个零知识证明的库,说是用来做年龄验证——证明你满了十八岁,但不透露你的出生日期。听起来像魔法。
男:零知识证明就是干这个的。密码学里已经研究了很多年,但门槛一直很高。Google 这次是把实现代码开源了,让更多开发者能直接拿来用。场景是这样:政府给你签发一个数字身份,绑定在你的手机硬件安全模块上。你访问一个需要年龄验证的网站时,不需要上传身份证,只需要在本地跑一段证明运算,然后把结果传过去。对方收到的就是一个“此人已满十八岁”的是非判断,不知道你是谁、几岁、在哪。
女:那签发者——比如政府——会知道我什么时候在什么网站用了这个证明吗?
男:从技术上不会。零知识证明本身保证了签发者不知道你在何时何地用了它。但社区讨论里很多人提了一个关键点:如果法律要求服务商和证书颁发机构同时保留日志,两边数据一合并,轨迹还是能被还原出来。
女:也就是说技术本身是干净的,但元数据仍然危险。
男:对。还有一个问题是复制——如果一个十八岁的人把自己的证明无限分享给别人怎么办?这可以通过设备绑定和一次性令牌解决,但会增加成本。社区反应两极分化也挺严重的。支持的人说,这比现在所有年龄验证方案都好——现状是让你上传身份证照片给平台或者第三方,数据可能被用来做广告。反对的人说,推动年龄验证的立法初衷可能根本不是保护隐私,而是加强网络内容控制。
女:而且就算 Google 这次开源跟技术派的“最小化披露”想法一致,立法者完全可以要求服务商额外收集元数据。承诺是一回事,强制力是另一回事。
男:这也是很多人对零知识证明保持谨慎的原因。技术只是拼图的一块,真正决定隐私水平的是法律框架、运行方式、还有各方有没有动机去挖掘元数据。不过这次开源的好处也很实在——门槛降低了,更多研究人员和开发者能去试、去改、去审计。在欧盟 eIDAS 2026 年实施之前,这些讨论会很关键。
女:说到科学证据和公共信任的博弈,今天还有一篇发在《柳叶刀》上的研究,全面回顾了 mRNA 疫苗的安全性和有效性。阿迪你给大家简单说说。
男:这项研究覆盖了从设计、制造到真实世界监测的全链条。结论很清楚:mRNA 疫苗在预防重症、住院和死亡上表现突出,严重副作用如年轻男性中罕见的心肌炎,远少于疫苗带来的保护收益。mRNA 不改变人类 DNA,它就是在细胞里临时放一段指令训练免疫系统,然后很快被分解掉。
女:研究里也说了这个技术正在往其他领域扩展对吧?
男:对,流感、RSV 疫苗,个体化癌症疫苗都在用同一套平台。研究者说了一句话让我印象很深:“我们看到了同一个平台被应用到癌症治疗上。理解这些疫苗为什么安全,有助于增强对下一代药物的信心。”
女:关于副作用,我注意到有讨论提到血栓的问题。
男:那个主要是腺病毒载体疫苗的罕见副作用,比如阿斯利康那种。弗林德斯大学的研究解释了为什么会发生,跟 mRNA 没关系。社区里好多人在纠正这个混淆。
女:那疫苗能不能阻止传播?好像早期试验报告里只看了症状。
男:没错,早期试验主要跟踪有症状的感染。但后来的真实世界数据已经充分证明了保护效果。疫苗设计时本来就没承诺“完全阻止感染”,而是减轻症状、降低整体传播风险。
女:我比较感慨的是评论区有种无奈情绪,有人说“无法用理性说服非理性立场”。但研究者们坚持用透明沟通来回应,说人们有权问清楚身体里放进了什么。
男:研究还提到全球疫苗获取不均衡,需要在中低收入国家加大制造能力投资。过去五年这项技术是在紧急状态下快速部署的,现在有系统回顾,对公众和医生来说都是更扎实的参考。
女:好,接下来这个话题有点特别。最近有位数学家 David Bessis 写了篇文章,说的不是 AI 能解什么题,而是数学界正在经历一场身份危机。
男:他的核心论点是:数学家最有价值的贡献往往不是写下来的定理,而是让定理变得清晰的那些概念框架。他自己举了个例子——他最好的定理从来没正式发表过,因为真正难的环节是下定义。他那两个定义后来融入了七百页的教材。而他发表的高光论文,他自己说是“社会寄生虫”,真正的大功臣是那个创造了新语言的自己。
女:为什么这个过去没人当回事的问题,现在突然变得尖锐了?
男:因为 AI。数学界多年来有一套隐性的荣誉规则——只有证明的定理才算数,概念构建被当成次要活。但传统上在人类数学家身上,定理证明和概念创新几乎是共生的。AI 打破了这个共生关系。它现在能解大量题目,但生成的证明哪怕不出错,也缺乏“可理解性”,没法让人提炼出核心想法、融入已有体系。
女:Bessis 用了一个概念叫“悬垂”,你能不能解释一下?
男:悬垂的意思是说,数学文献里存在大量没有被关联的潜在价值——一个概念在领域 A 里躺了二十年,其实可以直接解决领域 B 的某个难题。人类数学家一辈子只读不到 0.1% 的文献,AI 是整碗汤都能喝下去,理论上能系统收割这些成果。
女:那为什么 AI 还没有大杀四方?
男:Bessis 的答案很有意思:AI 解题已经超人类了,但概念构建和理解远不如人类。数学真正的产品是“清晰和理解”,不是定理本身。他引用了 Bill Thurston 的话:数学的衡量标准是我们有没有让人更清晰、更有效地思考。
女:AI 实验室如果只把数学当成一种有规则的游戏来跑分,那确实会误判。
男:对。Geoff Hinton 最近把数学比作围棋和国际象棋——“封闭系统,有规则”——这把 Bessis 吓到了。他觉得如果顶尖 AI 实验室真信这个比喻,那他们就会像打败人类棋手那样把“解决数学”当成可量化的目标。目前 First Proof 这个基准测试确实有顶级模型解决了六到八题,但数学家 Daniel Litt 指出,解法里充满了垃圾输出,连 OpenAI 自己都分不清哪个答案是对的,只能让学术界免费帮忙审稿。
女:这听起来像是 AI 能考高分,但没法跟人解释它是怎么想的。
男:而且有更糟的副作用:年轻数学家被 AI 实验室挖走,学术岗位被掏空;学生用 AI 完成作业但考试表现极差。Bessis 的预测是,纯数学和应用数学会分离得更清晰,会出现一批“直觉最大化者”——利用 AI 快速探索新大陆的新一代数学家。最终数学不会消失,但会像健身——你仍然可以去健身房,因为过程本身有价值,尽管工业机器人比你强壮得多。
女:最后这个话题,我想让它来帮我们收尾。单纯因为太神奇了——阿迪,袋熊拉的是什么形状的粪便?
男:立方体。每天大概一百颗,六面体。
女:这东西是有生以来第一次听说。怎么形成的?
男:科学家解剖过被车撞死的袋熊,发现肠道末端 17% 的区间里,有两块弹性不同的组织。硬的部分收缩快,像橡胶带;软的部分慢慢挤压出棱角。不是肛门捏出来的形状,是在肠道里就被“切割”成型的。
女:那进化上有什么好处?
男:袋熊喜欢爬上高处——岩石或者木头——来标记领地。圆形粪便会滚下去,立方体的不容易滚。研究还发现,野生袋熊的粪便比圈养的更方正,形状越方,袋熊越健康。
女:这个研究发在《软物质》杂志上,标题是“袋熊是怎么拉出立方体的”,本身就挺有幽默感。评论区好像有很多奇怪的冷知识。
男:有人提到瑞士旱獭也干类似的事——它们吃紫杉果实,把消化一半的稀便拉到高处岩石上标记领地。紫杉种子剧毒,旱獭好像知道自己不能嚼碎。还有人说袋熊能跑四十公里每小时,但可能是几十年前公制英制搞混了的传说。总之这篇研究的价值可能不在于什么工业突破,而是帮工程师设计更好的材料塑形方法,以及帮动物园评估袋熊健不健康。
女:从 Google 收紧控制、论坛消亡、DIY 吸尘器、AI 模型性价比大战、零知识证明的隐私困境、数学界的自我反思,到袋熊拉立方体粪便,今天我们来来回回聊了很多。好像在每一个话题底下,都有一条暗线——我们想要控制自己的生活,不管是数据、代码工具、还是社区归属。
男:而技术总是在“给”和“拿”之间来回晃。有些我们得接受,有些还在争。
女:好,那今天的节目就到这里。感谢收听 Agili 的 Hacker Podcast。如果你喜欢我们的节目,可以在泛用型播客客户端搜索我们并订阅,下期见。
男:下期见。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。