



















欢迎收听 Agili 的 Hacker Podcast。今天我们聊聊几件交叉在一起的事:AI 写代码移植游戏、会议室里的二氧化碳如何悄悄毁掉决策、AMD 推理性价比的新数据、一个 6B 参数的证明模型、YouTube 的 AI 漏洞、20 万美元的书籍悬赏、以及 GPT‑5.5 推理 token 突然扎堆的奇怪现象。
开发者利用 EA 的 GPL v3 源代码和社区项目 GeneralsX(已完成 macOS、Linux 基础移植),使用 Claude Code 的 Fable 模型,将《命令与征服:将军:绝命时刻》带到了 Apple Silicon Mac、iPhone 和 iPad。工作集中在 iOS/iPadOS 适配、DXVK 的交叉编译、触控 RTS 交互和应用生命周期处理。整个过程是人描述现象、做决策,AI 负责写 C++ 并调试。
iOS 只读代码签名包要求重新路由所有配置和存档路径。渲染管线是 DirectX 8 → DXVK(D3D8 转 Vulkan)→ MoltenVK(Vulkan 转 Metal),而 DXVK 此前从未在 iPhoneOS 上编译过。iOS 切换应用时会收回 Metal 绘图表面,渲染循环必须学会等待。触控方面需要区分点击、拖拽、长按和双指操作,还要避免取消触摸产生幽灵点击。开发者记录了黑色小地图、EVA 语音随机静音等 bug 的根因分析,并整理出通用移植模式文档。
评论里有人把它和 Bun 的 Rust 移植比较——那个项目在没有充分解释和测试的情况下推进到了生产环境,而这个低风险娱乐项目很适合 AI 辅助。也有人指出,绝大多数工作由 GeneralsX 完成,眼前仓库只负责 iOS 适配和引擎修复,但从桌面到触控的交互重设计及 iOS 生命周期处理并不像看上去那么轻量。AI 生成的复合名词(“tap‑select”“drag‑box”“pinch zoom”)也引起了一些阅读不适。
作者带着便携式二氧化碳监测仪实测,关门开着几个人时读数能到 2,143 ppm。劳伦斯伯克利国家实验室的研究显示,1,000 ppm 时六项决策指标全部比 600 ppm 显著下滑;到 2,500 ppm 时九项里七项大降,部分被划入“功能失常”。哈佛的另一项研究也发现,随二氧化碳升高,战略、规划等能力下降得最厉害。
一个关着门的会议室在第一小时内就能达到 1,000 ppm。全天规划会、架构评审等正好把浓度推到损害决策质量的区间。你只会觉得累了、迷糊了,然后归咎于会议太长或昨晚没睡好,几乎没人怀疑空气。
远程办公时,小书房关着门坐一天同样让二氧化碳攀升、带来午后迷糊。作者曾把监测仪带进办公楼,发现会议室浓度依然偏高,人越多越糟。一个监测仪的价格比一小时工时便宜,开窗免费。你已经监控了构建流水线和缺陷率,房间里的空气是那个还没度量的输入。
社区里有人用监测仪坐飞机,起飞前空调乏力时常超过 2,500 ppm;还有人在车内录到 3,100 ppm,与长期开内循环有关。关于在手机或手表里集成二氧化碳传感器,反对者担心手腕离呼吸太近导致误报,但支持者认为你呼吸的就是面前那团空气,观察相对变化仍能提供有用结论。
有人质疑潜艇和国际空间站长期维持 5,000 ppm 也没出现明显认知损伤,而声称 1,000 ppm 就有大影响的研究没有独立重复。更合理的解释是二氧化碳作为一个代理指标,与人体排出的挥发性有机化合物浓度相关,后者才是真正让人疲劳的原因,通风同时降低了这两者。无论机制如何,打开窗户或升级通风系统的成本远低于可能挽回的决策损失。
Wafer 在 AMD MI355X 上部署了 GLM‑5.2,通过 MXFP4 量化和优化推理框架,实现了单流 213 tok/s,以及在 20k 输入、60% 缓存命中率下 2626 tok/s/node 的聚合吞吐。这个速度达到 B200 的 80%,但价格便宜了约 2 倍,MI355X 对比 B300 每 GPU 便宜 2.75 倍。推理框架用的是 sglang,团队修复了推测解码的 bug 并手动调优了 MoE kernel。
“lossless”的口号与提供的基准数据不太吻合。GPQA‑Diamond 从 FP8 的 0.9217 降到 MXFP4 的 0.9026,GSM8K 从 0.965 降到 0.955,约有 1‑2% 的准确度下降。评论指出 FP4 在理论上就不可能是完全无损的,尤其当模型存在较大 outlier 时。很多提供商用 FP4 换速度,但输出质量已经下降。
MI355X 单 GPU 功耗 1400W,比 B200 的 1200W 高约 16%。数据中心更关心总电力供应瓶颈而非电费本身——一台 DGX 约 14kW,电费在硬件成本面前不是主要因素,供电容量才是。推理优化不再需要写自定义 kernel,框架层面就能解决,这对买不到 Nvidia 的厂商或许是个选择,但实际部署仍面临软件支持和工程调试时间长的挑战。此外,Wafer 之前推出的“Wafer Pass”付费计划几周内就取消退款,也让部分用户对其持续性存疑。
Mistral 发布了 Leanstral 1.5,免费 Apache‑2.0 许可,总参数量 119B 但仅有 6B 活跃参数,专攻 Lean 4 形式验证。它在 miniF2F 基准测试的验证集和测试集均达到 100%,PutnamBench 解决 587/672 题,FATE‑H 和 FATE‑X 分别达到 87% 和 34% 的新 SOTA。训练包括 mid‑training、监督微调和基于 CISPO 的强化学习,其中一项代码代理环境允许模型像开发者一样编辑文件、运行命令、与 Lean 语言服务器交互,完成数百万 token 的推理任务,例如 AVL 树时间复杂度证明消耗了 2.7M token 和 22 次压缩。
团队搭建了自动化流水线:Aeneas 将 Rust 代码翻译为 Lean,模型推断意图并生成正确性属性。在 57 个开源仓库中,流水线标出 47 个违反属性,其中 11 个指向真实 bug,5 个此前未报告。例如 datrs/varinteger 的 zigzag 解码 sign 函数在输入 Std.U64.MAX 时 (value + 1) 溢出,导致 debug 崩溃、release 静默损坏。
每个问题约 4 美元,远低于 Seed‑Prover 的 300 美元以上。批评者指出对比对象是半年前的模型,但也有人强调,能把一个 6B 活跃参数的模型推到这种程度才是核心。社区里有人分享体验,发现 LLM 对 Lean 4 的生成质量很好,不仅能做证明,还能当通用编程语言用,性能不输 C++ 和 Rust。Mistral 用这种方式在大模型竞赛中走出一条专精路径,也为欧洲保留了形式验证的技术积累。
安全研究人员发现 YouTube Studio 的 AI 助手 Ask Studio 存在 prompt injection 漏洞。攻击者在评论区留下看似正常的评论,随后悄悄编辑成指令。创作者打开 YouTube Studio 点击建议的 AI 提示时,Ask Studio 会读取所有评论,把被篡改的那条当作自身输出执行,比如在回复开头插入假的“YouTube 官方通知”。创作者看不到编辑后的评论,只会看到 AI 给出的“官方消息”,毫无戒心。
进一步利用中,研究人员让 AI 构造链接,把私人视频标题嵌入 URL 参数。只要创作者点击链接,攻击者就能通过请求获取私密视频标题,暴露未公开内容。
漏洞报告被 Google 驳回,理由是“需要社交工程”。研究人员辩称,创作者从未看到攻击者的奇怪评论,他们信任的是 YouTube 自己的 AI 工具。一位前 Google 员工在 Hacker News 上解释了内部激励机制:负责工程师已完成项目并将成果归入绩效材料,修复这个漏洞不会对晋升或年终考核带来好处,反而耗费本可用于加分项目的时间,因此工程师更倾向掩盖过去。这种激励在 Google 内部普遍,导致很多安全问题被忽视。
评论区一位火车工程师对比自己行业的做法:若因绩效考量隐瞒安全隐患,工程执照会被吊销并被逐出行业。医疗软件领域也一样,忽视安全可能坐牢。但面向消费者的大型平台缺乏类似问责制。Ask Studio 的漏洞本质上是 AI 工具处理用户生成内容时没有区分数据来源和系统指令,让评论内容能像系统指令一样影响模型输出。
Anna's Archive 为获取 Google Books 或类似大规模图书扫描全集,将悬赏从 1 万美元逐步提至 20 万美元。目标是一种可规模化下载完整扫描件的方法。如果有人在 Google 内部且有访问权限,组织方坦承 20 万美元对个人意义不大,但若能带出数据,将被视为传奇档案管理员。悬赏同样适用于 AI 公司收集的大型集合,尤其含大量稀有书籍的版本。
社区参与者提供了一些线索,包括一个 4TB 的泄露数据链接,但完整集合远大于此。有分析指出 Google Books 整个存档(含受版权保护内容)约 7PB,公共领域及授权内容约 300TB,提取 OCR 文字可大幅缩小存储。Anna's Archive 回应,如果只提供 OCR 文本可支付一半悬赏,交付方式为 SFTP。
讨论围绕版权、知识获取权和盗版伦理展开。一位突尼斯用户说,当地英语书籍选择极少,跨境购买受限于货币不可兑换和每年约 300 美元的在线消费上限,没有 Anna's Archive 和 Z‑Library 就看不到影响他人生的书。支持知识自由者认为版权被过度延长以保护出版商和极少数畅销作者遗产。反对者指出写好书比写软件更难,盗版直接毁掉作者收入。有人提出若购买不等于拥有,盗版也不等于偷窃。AI 公司大规模抓取受版权保护数据训练模型也被拿来对比。图书馆每年花约 20 亿美元买书,说明即使免费借阅也能支撑作者;通用基本收入被多次提及作为替代方案。整个悬赏和讨论的核心矛盾围绕知识广泛访问的理想与创作者谋生的现实。
一位企业版 Claude Code 用户发现,代理在分析 CSV 文件时突然询问 Minecraft 神殿的砖块事宜。他确认自己已认证到企业 ZDR 工作区,搜索本地会话记录只在 Pygments 路径下找到 minecraft.py,没有“temple”或“bricks”对话内容。同样现象在移动端同一企业账户也出现,均发生在 Sonnet 5 五分钟后首次响应(缓存缺失)时,因此他怀疑是服务器端泄漏。
多位评论者指出幻觉成立的可能性:模型可能将工具调用结果中的 minecraft.py 与用户上下文关联并生成 Minecraft 相关输出。另一些人提出 HTTP 请求走私等 API 网关风险,有经验者分享过因错误处理 HTTP 100 状态码导致响应互换的经历。KV 缓存跨租户共享本有性能动机,但缓存键计算或缓冲区重用 bug 可能导致数据串动。
Claude Code 团队成员 Thariq 回应:“我们有信心这是一个幻觉,但会认真对待,团队正在调查。”之后用户上传了移动端截图,模型开始生成墙面尺寸和抽象版画推荐,完全不相关,并显示“Detecting injection attempt, proceeding…”的思考过程,表明它接收到了外来文本。用户已通过企业联系人内部升级。
作者指出学习新东西刚开始并不会让你感觉良好,第一次练习做完你可能想躺一会儿。你在练习结束时表现很可能比开始时更差,因为大脑和肌肉在疲劳。睡眠才是进步发生的时候,练习是在为大脑收集数据。很快你会爬过“痛苦峰”,进入可实际应用的中级高原。多数人会在初期因气馁而放弃,很可惜,因为第二天再回来就会发现事情明显变容易了。
社区里不少人指出,问题不是没有时间,而是没有连续不被打扰的精力。一位评论者说,当大脑被工作后台计算占满时,人本能抗拒新知,此时更适合整合已有知识,比如写作。作者回应能量问题既消耗也回报,像健身,但持久比时长更重要。对于被孩子频繁打断的碎片化时间,更容易中断和恢复的爱好如写作或编程更有优势。
一个实用的准则是:如果没有产出错误,你就还没有真正练习。订阅教程、翻看 Reddit 都只是准备阶段。一旦动手做项目,立刻会发现那些“我以为我懂”的地方只是纸上谈兵。还有人分享学习画画的历程——每周几小时加入酒吧画画团体,2‑3 年后才经常让自己惊艳,5 年能接单。学习中情感上的完美主义容易把自愿变成义务,应对方法是保持“我做得烂但就是要做”的心态。另有人引用 T.H. White:“悲伤时最好的事情就是学点东西。这是唯一永远不会辜负你的事。”
uptime 来自 /proc/uptime,第二列在多核系统上可能大于第一列。load average 的三个数字是系统启动以来所有负载的指数衰减移动平均,并不严格只包含最后时段。进程状态栏里 R 表示运行或等待运行,S 表示可中断睡眠(例如 sleep),D 表示不可中断睡眠(通常等 I/O,NFS 卡住时无法 kill -9),Z 表示僵尸进程。进程树视图(F5)可显示父子关系。
VIRT 包含所有虚拟映射,对诊断无帮助;RES 是驻留内存但含共享部分,fork 后因写时复制会被重复计数;更准确的指标 PSS 需 root 权限。Windows 任务管理器默认显示私有工作集,相当于仅含不共享的物理内存。nice 值‑20 到 19 是用户空间优先级,内核 PRI 为 0‑139,关系是 PR = 20 + NI。
btop 界面现代,支持 GPU、网络和功耗显示,但在窄终端上缩放不佳,串口连接时全屏刷新,且不支持 musl libc。htop 自带 strace 和文件列表等功能,btop 还不具备。日常最常用的两条操作:按 > 或 M 按内存排序,按 P 按 CPU 排序。必要时禁用用户线程可减少杂乱。
开发者分析 39 万条响应后,发现 reasoning_output_tokens 高度集中在 516、1034 和 1552 这几个固定值。GPT‑5.5 占据全部响应的 19.3%,却占据 82% 的 516 token 事件。在 516 及以上 token 响应中,GPT‑5.5 有 44% 精确命中 516,其他模型仅 1.3%。5 月份精确命中占比升至 53.3%,同期平均推理 token 从 268.1 降至 106.9。
多位用户用固定谜题测试,10 次中有 4 次卡在 516 并给出错误答案,而当模型用 6000‑8000 推理 token 时则能正确。一位开发者发现移除 Codex 系统提示中的“## Intermediary updates”指令后恢复正常,认为模型可能混淆了中间更新与最终答案。516 的结构被猜测为 512 字节缓冲区加 4 字节头部,1034 和 1552 则像是每次递增 518 token 的固定步长,暗示存在批处理优化或推理预算截断。
对 GPT‑5.5 近期表现失望的用户开始转向 5.4、本地方案或 Claude。有开发者开源了检测脚本,可直接扫描本地日志统计精确命中 516 的次数,并制作了钩子工具在会话中检测截断并警告。不少人不满于订阅制产品云端优化牺牲质量、缺乏透明度,本地模型则至少能提供确定性。
女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。
男:大家好,我是阿迪。
女:今天想从一篇让我挺有共鸣的文章聊起,标题特别直白——“你可以学习新东西”。作者说,像素画、盲打、3D 建模,不管什么,只要你每天花一点时间,技能真的不会消失。阿迪,你最近有在学什么完全陌生的东西吗?
男:说出来你可能觉得好笑,我在重新学怎么用 htop。用了这么多年,其实好多栏目根本没认真看过,最近才弄明白那些缩写和数字背后是什么。
女:htop 就是那个终端里花花绿绿的进程管理器对吧?我每次打开都觉得信息量太大,像飞机驾驶舱。
男:没错。其实它左上角的 load average 三个数字,来自 /proc/loadavg,分别是 1、5、15 分钟的负载平均值,但它是系统启动以来所有负载的指数衰减移动平均,不是严格意义上的“最近时段”。Linus 在内核源码注释里写过一句话,说“这是个傻数,但人们认为它很重要”。
女:那大家还在信它,不是有点像看道琼斯指数炒股?
男:对,粗看趋势可以,细究就不太靠得住。还有进程状态栏里那些字母,S 是可中断睡眠,D 是不可中断睡眠——通常卡在 I/O 上,比如 NFS 挂载卡死的时候 kill -9 都杀不掉。Z 是僵尸进程,短暂出现没事,长时间挂着就是程序没回收子进程。
女:僵尸进程,名字起得太形象了。我还注意到有社区朋友说 btop 比 htop 好看,还能看 GPU 功耗。
男:btop 界面确实现代,但有人在 FreeBSD 上遇到 32 位整数计算 64 位大小溢出,而且在串口连接下每秒全屏刷新,根本没法看。也有些小技巧,比如在 htop 里按 M 按内存排序,按 P 按 CPU 排序,打开树视图可以看清进程父子关系。
女:你刚才说重新学 htop,这个过程本身就跟文章里写的“痛苦峰”很像吧?
男:对,文章说得很直白——从零开始做一件事,练习的时候不会感觉良好,结束时的表现可能比刚开始还差,那是大脑和肌肉疲劳了。很多人这时候就放弃,但只要第二天再回来,事情会明显变容易。有读者分享过一个判断方法:如果你没有产出错误,那可能还没真正开始练习。
女:我特别喜欢评论里有人说的,“我做得烂,但老子就是要做”。成年人很容易把看教程、研究最佳方法当成学习本身,但真正的学习是从犯错开始的。
男:还有能量问题。评论里很多人指出,“没时间”其实是能量不够、心理空间被占满。手机这时候像安慰剂,社交上稍微一尴尬就拿起来刷。文章作者自己承认,拔掉插头之后时间真的会多出来,关键是识别那个想抓起手机的触发点。
女:说到能量和环境,我觉得可以接下一个话题——会议室里的二氧化碳。
男:这个我也读了,作者随身带便携式二氧化碳监测仪,发现关着门几个人坐着开会,读数能从室外 400 ppm 飙到两千多 ppm。劳伦斯伯克利国家实验室的研究表明,在 1000 ppm 时,六项决策能力指标都有显著下降;到 2500 ppm,九项里七项大幅下滑,有些被划进“功能失常”范畴。而 1000 ppm 在关门一小时内就能达到。
女:我们产品评审会每次都关着门,一开就是两小时。有时候到后来我整个人发懵,还以为是内容太无聊,现在看来很可能是空气问题。
男:不只会议室。远程办公在小书房里关一天,午后迷糊也跟二氧化碳攀升有关。有人实测发现,飞机起飞前空调不给力时读数经常超过 2500 ppm,起飞和着陆最严重。还有人在优步里测到过 3100 ppm——司机等于带着可测量的认知损伤在开车。
女:那个“内循环按钮”是元凶?
男:对,车里开内循环,20 到 30 分钟内二氧化碳升到 1500 到 4000 ppm。有评论甚至开玩笑说这会不会是路怒的潜在因素之一。
女:那解决方法简单到让人心疼——开窗就行。作者的原话我特别喜欢:你先怪人的解释都值得怀疑。一个二氧化碳监测仪的价格比你一小时时间还便宜。
男:社区里还争论要不要在手机手表里集成传感器。反对者说手腕离呼吸太近,局部数值跟环境阈值不能直接套用,容易误报。支持者觉得你呼吸的就是面前的空气,这才是真正该测的,而且看相对变化——比如会议开始时 800 ppm,一小时后 2500 ppm——照样能得出有用结论。
女:这让我想到另一个跟设备有关的话题,而且也和“智能体做决策”沾边。你最近有没有看到,有人用 AI 帮忙把一个老游戏移植到了 iPhone 上?
男:你说的是《命令与征服:将军》的绝命时刻?基于社区项目 GeneralsX 做好的 Mac 和 Linux 移植,开发者又用 Claude Code 加上去 iOS 和 iPadOS 的支持。关键是渲染管线,原版是 DirectX 8,要转成 DXVK 变成 Vulkan,再通过 MoltenVK 转成 Metal,而 DXVK 之前从没在 iPhoneOS 上编译过。
女:听起来像一个翻译套一个翻译。触控交互其实挺棘手的,RTS 本来全是鼠标操作。
男:他们要区分点击、拖拽、长按和双指操作,还得确保取消触摸不会产生幽灵点击。还有代码签名的问题,iOS 是只读的沙盒,所有配置和存档路径都得重新路由。整个过程是人描述现象和决策,AI 写 C++ 和调试。评论里有人说这是 AI 辅助移植的好用例,因为低风险、可以快速迭代,但也有人指出文档里 AI 生成的复合名词太多,读起来有点难受。
女:说到 AI 生成内容的意外,我这两天刚好看到一个更离奇的——GPT-5.5 的推理 Token 会卡在一个神秘数字上。
男:对,有开发者分析了 39 万条 Codex 响应记录,发现 reasoning_output_tokens 高度集中在 516、1034 和 1552 这几个整数。GPT-5.5 在所有响应里占比不到两成,却占了 82% 的 516 Token 事件。在 516 及以上的响应中,GPT-5.5 有 44% 精确落在 516,其他模型这个比例只有 1.3%。
女:516 本身有什么特殊含义吗?
男:有人猜测是 512 字节缓冲区加 4 字节头部,1034 是 516 加 518,1552 又是再加 518——像是每次增加固定倍数的结构。社区里有人用固定谜题测试,发现卡在 516 Token 时会给出错误答案,而模型正常用 6000 到 8000 个推理 Token 时就能答对。这说明一部分复杂问题可能在思考完成前就被强制截断了。
女:那原因呢,有人找到线索吗?
男:一条线索是指向 Codex 系统提示里的“Intermediary updates”指令。有人移除这条提示后,所有测试运行都恢复正常。猜测是模型混淆了“中间更新”和“最终答案”的界限,早早收工。这件事让很多人不满,觉得订阅制产品在服务器端做优化时牺牲了用户端的质量,透明度也远远不够。
女:同一家公司的不同产品线,最近也有一桩怪事。我用 Claude Enterprise 的朋友跟我讲,有个用户在处理 CSV 文件,智能体突然问他要不要给 Minecraft 修庙用的砖块。
男:这个用户查了本地会话记录,只找到一个叫 minecraft.py 的路径名,是语法高亮器的词法分析文件,没有任何关于“temple”或“bricks”的内容。而且在同一个 Enterprise 账号的 Claude Mobile 上也重现了,都是在响应缓存过期后的第一条回复里出现,所以用户怀疑是服务端泄露。
女:Claude 团队的成员后来回复说,“我们有信心这是幻觉,但团队在认真调查”。用户后来上传了截图,模型输出里甚至出现了“检测到注入尝试,继续……”这样的思考过程,这就很难只用幻觉来解释了。
男:Hacker News 上有人提到,API 网关的 HTTP 反序列化或请求走私可能导致不同请求的响应串台。还有 LLM 服务商的人分享,自己遇到过两次中间件把响应换掉的案例,一次追踪到 HTTP 100 状态码处理的一个 off-by-one 错误。KV 缓存在租户间共享时,缓存键计算或缓冲区重用出 bug,也可能让数据在不同会话间串流。
女:这让我想起一个已经被证实的注入问题,就是 YouTube Studio 的 AI 助手。攻击者在评论区写下正常评论,然后悄悄编辑成指令。创作者点开 Studio 的建议提示时,AI 会读取那条被篡改的评论,并把它当成自己的输出——比如开头放一条假的“YouTube 官方通知”。
男:研究人员还把私人视频的标题嵌入 AI 构造的链接里,创作者一点击,攻击者就能拿到那些未公开视频的标题。他把漏洞报给 Google,被以“需要社交工程”为由驳回。一位前 Google 员工在讨论里解释,负责该功能的工程师已经把这个项目放进自己的绩效材料里了,修复漏洞对晋升和年终考核没有好处,反而会消耗时间。所以工程师更倾向于把它掩盖过去。
女:评论里有个火车工程师说,如果他出于绩效考虑隐瞒安全隐患,他的工程执照会被吊销,还要被逐出行业。他觉得这就是程序员不被看作“真正工程师”的原因之一。
男:医疗软件那边也类似,忽视安全问题会坐牢,所以他们会严肃对待。但对消费者平台,没有这种问责制,问题往往就被埋下去了。这给所有把用户内容喂给 AI 的产品敲了警钟——如果没有严格区分数据来源和系统指令,AI 就会变成读取用户数据的攻击通道。
女:不过 AI 也不全是这样的坏消息。Mistral 最近放出 Leanstral 1.5,一个只有 6B 活跃参数的模型,专门做形式化验证,在 miniF2F 基准上拿到了 100%。
男:他们用了三阶段训练:mid-training、监督微调和基于强化学习的 CISPO。模型能在代码代理环境里像开发者一样编辑文件、运行 bash、与 Lean 语言服务器交互,完成长达几百万 Token 的推理任务。比如证明 AVL 树的时间复杂度,就花了 270 万 Token 和 22 次压缩。
女:他们还有一个自动化流水线,把 Rust 代码翻译成 Lean,然后用模型推断用户意图生成正确性属性。在 57 个开源仓库里标记了 47 个违反属性的情况,其中 11 个指向真实 bug,5 个是之前没人报过的。其中一个是在 zigzag 解码的 sign 函数里,输入最大值时 value 加 1 溢出,导致 debug 模式崩溃、release 模式静默损坏。
男:社区有 OpenAI 员工说,用 GPT-5.5 简单提示一下也能找到这个边界值溢出,这种问题 fuzzing 本来就会覆盖。但 Leanstral 每个问题的成本大概 4 美元,远低于之前 Seed-Prover 的 300 美元以上,这点很有意思。而且模型权重 Apache-2.0 开源,任何人都能用。
女:一个 6B 活跃参数的小模型能做到这样,说明在垂直领域的方向上,小而专可能比大而全更有性价比。这跟接下来要聊的硬件话题有点像:AMD 最近有人把 GLM-5.2 模型部署在 MI355X 上,用量化到 4 位浮点的方式,实现了单流 213 tok/s 的速度,价格比 B200 便宜很多。
男:对,他们宣称这个 MXFP4 量化是“无损”的,但社区对比了基准测试结果,GPQA-Diamond 从 FP8 的 0.9217 降到了 0.9026,GSM8K 从 0.965 降到 0.955,有 1% 到 2% 的准确度下降。FP4 量化在理论上就不可能完全无损,尤其是模型存在较大 outlier 的时候。很多商用 FP4 速度提升的背后,模型输出质量其实已经下降了。
女:功耗方面呢?MI355X 单卡 1400W,B200 是 1200W,高出 16%。但文章说数据中心更关心的是总电力供应瓶颈,而不是电费本身。
男:有评论算过一笔账,一台 B200 系统比如 DGX 大概 14kW,在德国运行 8 年电费约 10 万欧元,而硬件成本 50 万美元,所以电费不是主要矛盾,供电容量才是。AMD 的 CUDA 护城河确实在被逐步侵蚀,推理优化不再需要自己写 kernel,框架层面就能解决。但对买不到 Nvidia 的厂商,实际部署时软件支持和调试时间仍然是挑战。
女:这些模型和硬件最终面向的很多任务,其实跟我们获取知识的方式有关。这让我想到 Anna's Archive 最近把悬赏提高到了 20 万美元,想获得 Google Books 或其他类似大规模图书扫描的完整数据。
男:Google Books 里大量书只通过搜索片段暴露,悬赏的目标就是找到一种可规模化下载完整扫描的方法。有人指出整个存档大约 7PB,公共领域和已授权内容约 300TB,如果只提供 OCR 文本,他们愿意付一半。交付方式直接是 SFTP。
女:讨论里有一个来自突尼斯的用户让我印象很深。他说当地英语书籍选择极其有限,跨境购买受货币管制,年度在线消费上限大概 300 美元。没有 Anna's Archive 和 Z-Library,他根本读不到那些影响他人生的书。
男:这牵出了版权和知识获取的老矛盾。立场对立得很鲜明:有人说写一本好书比写软件难,盗版直接毁掉作者收入,而 Hacker News 对违反开源许可就义愤填膺,对图书盗版却很宽容。也有人认为,如果购买不等于拥有——电子书只是许可,那么盗版也不等于偷窃。AI 公司大规模抓取受版权保护的数据训练模型,也被拿来对比,既然大企业能这么做,普通人出于个人使用的行为就有更强的道德理由。
女:中间地带也有人提了实际方案,比如图书馆每年花大概 20 亿美元买书,说明免费借阅也能支撑作者。还有人多次提到通用基本收入,让创作者不再完全依赖版权收入。
男:这个悬赏本身和讨论的矛盾,其实都指向同一个问题:知识应该被广泛访问,同时创作者需要由此谋生。Anna's Archive 用真金白银在加速数字档案化,而社区用自己的亲身困境为这件事注入了复杂的意义。
女:我们从个人学习聊到系统工具,又看了 AI 的各种奇怪行为、安全漏洞、在形式验证和游戏移植里的正面案例,再被带到会议室空气和知识平权的话题里。最后我想把这期的结尾落在开头那篇文章的评论区里,有人引用了 T.H. White 的一句话——“悲伤时最好的事情就是学点东西。这是唯一永远不会辜负你的事。”不管你对 AI 持什么态度,打开窗户透透气也好,翻开一本买不到的书也好,或者就是在 htop 里按一下 F5 看进程树也好,学一点东西,脑子确实会往外看,而不是被焦虑吞掉。
男:对了,提醒一下大家,这期提到的二氧化碳监测仪,有人推荐 SwitchBot Meter Pro CO2,大概 50 欧元左右,或者自己用传感器加 ESP32 搭建。宜家的那个 ALPSTUGA 便宜但偏差常常到 300 ppm,只能看个趋势。
女:好,那我们今天就聊到这里。感谢大家收听 Agili 的 Hacker Podcast,如果你喜欢我们的节目,记得用泛用型播客客户端订阅,这样可以第一时间收到更新。
男:我们下期再见。
女:拜拜。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。