惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
Security Latest
Security Latest
Martin Fowler
Martin Fowler
酷 壳 – CoolShell
酷 壳 – CoolShell
Engineering at Meta
Engineering at Meta
The Register - Security
The Register - Security
H
Hackread – Cybersecurity News, Data Breaches, AI and More
罗磊的独立博客
MyScale Blog
MyScale Blog
Microsoft Azure Blog
Microsoft Azure Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
WordPress大学
WordPress大学
M
MIT News - Artificial intelligence
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
F
Fortinet All Blogs
博客园 - 叶小钗
H
Help Net Security
大猫的无限游戏
大猫的无限游戏
U
Unit 42
G
Google Developers Blog
V
Visual Studio Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
PCI Perspectives
PCI Perspectives
The Last Watchdog
The Last Watchdog
有赞技术团队
有赞技术团队
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
N
News and Events Feed by Topic
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Application and Cybersecurity Blog
Application and Cybersecurity Blog
雷峰网
雷峰网
SecWiki News
SecWiki News
Google Online Security Blog
Google Online Security Blog
S
Security @ Cisco Blogs
N
News | PayPal Newsroom
The Hacker News
The Hacker News
月光博客
月光博客
T
Threatpost
B
Blog
P
Proofpoint News Feed
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Simon Willison's Weblog
Simon Willison's Weblog
P
Palo Alto Networks Blog
L
LangChain Blog
Scott Helme
Scott Helme
Last Week in AI
Last Week in AI
C
Check Point Blog
P
Privacy International News Feed

Agili 的 Hacker Podcast

Agili 的 Hacker Podcast 2026-07-24 Agili 的 Hacker Podcast 2026-07-23 Agili 的 Hacker Podcast 2026-07-22 Agili 的 Hacker Podcast 2026-07-21 Agili 的 Hacker Podcast 2026-07-20 Agili 的 Hacker Podcast 2026-07-19 Agili 的 Hacker Podcast 2026-07-18 Agili 的 Hacker Podcast 2026-07-17 Agili 的 Hacker Podcast 2026-07-16 Agili 的 Hacker Podcast 2026-07-15 Agili 的 Hacker Podcast 2026-07-14 Agili 的 Hacker Podcast 2026-07-13 Agili 的 Hacker Podcast 2026-07-12 Agili 的 Hacker Podcast 2026-07-11 Agili 的 Hacker Podcast 2026-07-10 Agili 的 Hacker Podcast 2026-07-09 Agili 的 Hacker Podcast 2026-07-08 Agili 的 Hacker Podcast 2026-07-07 Agili 的 Hacker Podcast 2026-07-04 Agili 的 Hacker Podcast 2026-07-06 Agili 的 Hacker Podcast 2026-07-05 Agili 的 Hacker Podcast 2026-07-03 Agili 的 Hacker Podcast 2026-07-02 Agili 的 Hacker Podcast 2026-07-01 Agili 的 Hacker Podcast 2026-06-30 Agili 的 Hacker Podcast 2026-06-29 Agili 的 Hacker Podcast 2026-06-28 Agili 的 Hacker Podcast 2026-06-27 Agili 的 Hacker Podcast 2026-06-26 Agili 的 Hacker Podcast 2026-06-25 Agili 的 Hacker Podcast 2026-06-24 Agili 的 Hacker Podcast 2026-06-23 Agili 的 Hacker Podcast 2026-06-21 Agili 的 Hacker Podcast 2026-06-20 Agili 的 Hacker Podcast 2026-06-19 Agili 的 Hacker Podcast 2026-06-18 Agili 的 Hacker Podcast 2026-06-17 Agili 的 Hacker Podcast 2026-06-16 Agili 的 Hacker Podcast 2026-06-15 Agili 的 Hacker Podcast 2026-06-14 Agili 的 Hacker Podcast 2026-06-13 Agili 的 Hacker Podcast 2026-06-12 Agili 的 Hacker Podcast 2026-06-11 Agili 的 Hacker Podcast 2026-06-10 Agili 的 Hacker Podcast 2026-06-09 Agili 的 Hacker Podcast 2026-06-08 Agili 的 Hacker Podcast 2026-06-07 Agili 的 Hacker Podcast 2026-06-06 Agili 的 Hacker Podcast 2026-06-05 Agili 的 Hacker Podcast 2026-06-04 Agili 的 Hacker Podcast 2026-06-03 Agili 的 Hacker Podcast 2026-06-02 Agili 的 Hacker Podcast 2026-06-01 Agili 的 Hacker Podcast 2026-05-31 Agili 的 Hacker Podcast 2026-05-30 Agili 的 Hacker Podcast 2026-05-29 Agili 的 Hacker Podcast 2026-05-28 Agili 的 Hacker Podcast 2026-05-27 Agili 的 Hacker Podcast 2026-05-26 Agili 的 Hacker Podcast 2026-05-25 Agili 的 Hacker Podcast 2026-05-24 Agili 的 Hacker Podcast 2026-05-23 Agili 的 Hacker Podcast 2026-05-22 Agili 的 Hacker Podcast 2026-05-21 Agili 的 Hacker Podcast 2026-05-20 Agili 的 Hacker Podcast 2026-05-19 Agili 的 Hacker Podcast 2026-05-18 Agili 的 Hacker Podcast 2026-05-17 Agili 的 Hacker Podcast 2026-05-16 Agili 的 Hacker Podcast 2026-05-15 Agili 的 Hacker Podcast 2026-05-14 Agili 的 Hacker Podcast 2026-05-13 Agili 的 Hacker Podcast 2026-05-12 Agili 的 Hacker Podcast 2026-05-11 Agili 的 Hacker Podcast 2026-05-10 Agili 的 Hacker Podcast 2026-05-09 Agili 的 Hacker Podcast 2026-05-08 Agili 的 Hacker Podcast 2026-05-07 Agili 的 Hacker Podcast 2026-05-06 Agili 的 Hacker Podcast 2026-05-05 Agili 的 Hacker Podcast 2026-05-04 Agili 的 Hacker Podcast 2026-05-03 Agili 的 Hacker Podcast 2026-05-02 Agili 的 Hacker Podcast 2026-05-01 Agili 的 Hacker Podcast 2026-04-30 Agili 的 Hacker Podcast 2026-04-29 Agili 的 Hacker Podcast 2026-04-28 Agili 的 Hacker Podcast 2026-04-27 Agili 的 Hacker Podcast 2026-04-26 Agili 的 Hacker Podcast 2026-04-25 Agili 的 Hacker Podcast 2026-04-24 Agili 的 Hacker Podcast 2026-04-23 Agili 的 Hacker Podcast 2026-04-22
Agili 的 Hacker Podcast 2026-06-22
Agili 的 Hack · 2026-06-23 · via Agili 的 Hacker Podcast

今天的 Hacker News 上,有人回头审视职业生涯,发现它可能是一桩金融欺诈的附属品;也有新的桌面打包工具、开源模型、Minecraft 大版本更新、AI 多智能体系统发布,以及几个离谱的 bug 分析。

我的上一份工作,是不是只因为欺诈才存在?

一个工程师的十年回望

软件工程师 David Newgas 曾在一家叫 GenieDB 的英国初创公司工作。公司后来被美国风险投资基金 Frost VP 收购,他作为唯一转到美国的团队成员,在硅谷过了几年典型的创业生活。但公司始终没有超过 3 个客户,最终被开源方案淘汰。

十年后,他听说基金老板 Stuart Frost 被 SEC(美国证券交易委员会)起诉欺诈。诉状里有一句话击中了他:“当 Frost 需要更多现金维持奢侈生活时,他创建新的投资组合公司,投更多基金资本进去,然后收取更多孵化费。”David 开始怀疑,自己那份带他来美国、改变一生的岗位,是否只是欺诈链条上的一环。

结构性的浪费

Hacker News 的讨论把这个故事推向了更广的层面。有人指出,一些孵化器和政府资助项目资金最终流向了 IBM 这样的大公司,因为“可信伙伴”把钱截留了;真正有能力的团队反而拿不到资助。

另一种更隐蔽的浪费来自企业内部:一家英国大银行裁员之后,被裁的人通过外包公司以更高价格回到同一个团队做同样的事。预算科目不同——“裁员”减了人头,“外包”走另一个预算池——账面上好看了,成本反而更高。这种现象在澳大利亚银行、荷兰政府、美国海军和情报机构都有记录。David 的结语保留了一种清醒:你的工作可能比你以为的更小,但你不完全是欺诈的工具。只是一种暗流,恰好改变了你的河床。

Deno Desktop 发布:把 JS/TS 项目打包成桌面应用

直接打包,自动检测框架

Deno 2.9 推出了 Deno Desktop,可以把一个 Deno 项目——从单个 TypeScript 文件到 Next.js 应用——打包成自包含的桌面二进制。默认使用系统自带的 WebView 渲染,二进制很小;也可以选择捆绑 CEF(Chromium Embedded Framework),体积更大但渲染行为跨平台一致。

它能自动检测框架:指向 Next.js、Astro、Fresh、SvelteKit 等项目,会自动运行生产服务器或带热重载的开发服务器,代码无需修改。后端和 UI 通过进程内通道通信,没有跨进程 IPC 的序列化开销。

与 Tauri 的取舍

Tauri 的二进制可以小到 5 MB,但 Linux 上的 WebKitGTK 比主流引擎慢且内存占用更大,macOS 上老系统的 WebView 可能停在十年前。Deno Desktop 默认约 40 MB,捆绑 CEF 约 150 MB。有评论认为,CEF 选项让它在可靠性上超过 Tauri,后者也在努力加入 CEF 支持。

用 iCloud 随手拍意外做成“立体抖动照片”

从相机胶卷里挖出意外

所谓 wigglegram,是用多个角度拍摄的相似帧循环播放成 GIF,产生立体深度效果。作者是个拍照不删的人,想到自己那些从稍不同角度连拍的相似照片可能适合做这个。他写了一个脚本,用感知哈希(TinEye 用的那种反向图片搜索技术)在自己的 iCloud 图库里找出相似的照片序列,设了个阈值(汉明距离 10),一下吐出了几百张 wigglegram。

因为是真正的“意外”,很多照片更像小电影片段,而不是严格的立体图。动物、设计作品、雕塑效果最好。评论区有人建议用帧插值和锯齿循环(1-2-3-4-3-2)来平滑效果。iPhone 的 Live Photos 也能做类似的事情。

GLM 5.2 对比 Opus:一次游戏制作的气氛测试

用单次提示构建 3D 游戏

Z.ai 发布的 GLM 5.2 是 MIT 协议的开源模型,文本-only。作者让两个模型在 raw WebGL 下构建一个 3D 平台游戏。Opus 花了 33 分钟、约 22 美元,做出来的游戏角色有纹理、尖刺能杀人、有胜利条件。GLM 5.2 花了 1 小时 10 分钟、5.39 美元,但角色面朝后、纹理缺失、尖刺无效。

关键差距是 Opus 能看图——它生成画面后自己检查,修正了调试信息残留;GLM 5.2 只能读像素颜色值,根本看不出问题。但 GLM 5.2 的成本只有 Opus 的五分之一,很多评论认为对大量任务已经“足够好”,且开源模型没有供应商锁定的顾虑。

切换到开放模型,代价真有那么大吗?

从闭源到开放的权衡

作者一直把开放 LLM 当业余爱好,直到 Anthropic 开始要求身份验证,他才认真考虑切换。开放模型在排行榜上落后闭源模型几个月,生产力和隐私保护需要自己处理——要么通过不透明的第三方 API,要么自建服务。

评论区里的欧洲用户推荐了 eurouter.ai 这类路由服务,可以指定数据只留在欧盟境内、不收集、零保留。虽然背后实际提供 GPU 的可能还是美国公司,但至少法律层面有保障。有人认为 Anthropic 的“不协助政府违宪”声明只保护美国人,非美国人不在保护范围内;其新模型即便选择零数据保留,也会保留提示词和输出 30 天做安全审查。开放模型的价值正是这种灵活性——你可以自托管,也可以选信任的提供商。

OpenAI Codex 的日志 bug:21 天写了 37 TB

写入放大 1 万倍

Codex 的 SQLite 反馈日志在 21 天内写入 37 TB,年化约 640 TB。一块 1 TB 的消费级 SSD 通常只有 600 TBW 的写入寿命。问题出在全局日志级别设成了 TRACE,记录了所有底层 WebSocket 负载、遥测事件,而这些内容对调试几乎没有价值。

数据库保留约 50 万行,但 AUTOINCREMENT 计数器超过了 55 亿——历史写入是保留的 1 万倍以上。15 秒采样显示插入 3.6 万行后立即被修剪,形成持续的写入放大。两个补丁已合并,将默认过滤级别提到 INFO+,可减少约 85% 的写入。

社区反应激烈。有用户在 macOS 上只是打开 Codex 窗口等模型响应,GPU 就占满 100%,风扇狂转;另一个用户称它吃掉 70 GB 内存。有人把 Codex 和 Claude Code 一起称为“slopware”,指出这些公司自己的软件开发质量与它们宣传的“AI 革命”存在尖锐对比。

Minecraft Java 版 26.2:首个内置 Vulkan 渲染的正式版本

Vulkan 渲染与硫磺洞穴

这个代号“Chaos Cubed”的版本首次内置了 Vulkan 1.2 渲染后端,目前标记为实验性。GPU 不支持时自动回退 OpenGL。新生物群系“硫磺洞穴”有硫磺泉,上方放水会喷出水柱;新生物“硫磺立方怪”能吃掉方块并变成不同原型——吃 TNT 变炸弹,吃木材变弹球,吃冰面会滑行。

社区对 Vulkan 反应积极:OpenGL 已无法良好映射现代硬件,Vulkan 是之前预告的光照改进的前置条件。Java 版需要跨平台,所以选择 Vulkan 而非 Direct3D。但同时也有社区对近期聊天举报系统被滥用的讨论,部分玩家建议安装阻断举报数据的 Mod。

用 6 亿参数的本地模型做问题分类

从 10% 到 92%

作者 Torgeir Helgevold 为家庭问答机器人微调了一个 Qwen 3:0.6B,用来把问题归到预定义类别以缩小检索范围。基准测试准确率只有 10%,模型喜欢用太宽泛的标签,还会自己发明新类别。

第一轮微调用 Unsloth 加 QLoRA,850 条数据,准确率提到 79%,但仍会输出类别片段(如 “ac” 代替 “hvac”)。第二轮做了一个简单改动:把类别名换成两个大写字母的无语义代码,迫使模型输出固定格式。准确率跳到 92%。评论区不少声音建议直接用 Scikit Learn 的 SGDClassifier 加 2-grams,训练不到一分钟,模型小于 1 MB。

内存安全的内联汇编

Fil-C 的做法

GCC 和 clang 的内联汇编被认为不安全——约束写错会生成错误代码。Fil-C(一个内存安全的 C 变体)实现了静态验证:只允许没有内存访问、没有控制流、副作用完全被约束覆盖的指令。不安全的汇编不报编译错误,而是在运行时触发 panic——因为很多内联汇编在死代码中,不应阻塞移植。

作者用 AI 代理(先 Kimi K2.7-code,后 GLM 5.2)自动化了 x86_64 指令的白名单构建,每天检查两次,最终覆盖了数百条安全指令。评论对 AI 辅助这种复杂编译器工作的效果表示兴趣。

Sakana 发布 Fugu:协调多模型的多智能体系统

让模型自己学会分工

Sakana 的 Fugu 通过进化和强化学习训练一个轻量协调器,动态分配一组前沿模型(GPT 5.5、Opus 4.8、Gemini 3.1 Pro 等)的角色。分两档:Fugu 平衡性能和延迟,Fugu Ultra 追求最高质量。基准测试在编码、推理、科学等任务上达到或接近公开可用的最强模型。

早期用户反馈分化明显。有人说代码审查找出 20 多个问题,远超其他工具;也有人指出 $20/月的订阅配额只够用几小时/周,$200/月的高级版也不宽裕,推理速度慢,代码实现错误率还不低。有评论把它比作 OpenRouter 的 Fusion,但 Fugu 的协调器更动态,会生成多步工作计划而非简单合并结果。Sakana 与日本防卫省的合作也让部分用户顾虑。

播客全文

女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。

男:大家好,我是阿迪。

女:今天咱们要聊的东西有点多,从一个英国工程师的亲身经历,一路聊到多智能体系统。中间会穿插立体闪烁图、新的桌面开发工具、AI 模型掰手腕、日志里偷偷写掉几十 TB 数据的应用,还有 Minecraft 新版本和极小模型微调。阿迪,要不先从那个看完让人心里一沉的故事开始?

男:好。故事的主角叫 David Newgas。他早年在英国一家叫 GenieDB 的创业公司做软件工程师,后来公司被一个美国风投 Frost VP 收购,老板叫 Stuart Frost。整个团队里只有他一个人转到美国,在硅谷过上了那种典型创业生活——快速开发、玩桌上足球,还主动拒绝了赚快钱的机会,一心想靠技术实现一次漂亮的被收购。但公司客户始终没超过三个,最后被大公司和开源方案淘汰了。

女:听起来是常见的创业成败故事,结果呢?

男:十年后,David 从老同事那里听说 Frost 被 SEC(美国证券交易委员会)起诉欺诈。他翻诉状时看到一段话,大意是:当 Frost 需要更多现金维持奢侈生活时,他就创立新的投资组合公司,投更多基金资本进去,然后收取更多“孵化费”。David 当时就愣住了——他那份带他来美国、改变人生的岗位,会不会只是欺诈流程里的一环?

女:这个念头太折磨人了。我要是他,可能会忍不住追查到底。

男:他确实深挖了仲裁和 SEC 案卷。指控本身倒不复杂:Frost VP 以孵化器形式运营,向旗下公司收取过高费用。内部一封邮件里,孵化器负责人直接写:“我们现在需要两家新公司来覆盖成本(加上 Genie 六月份退出)。”David 觉得这句话再明白不过了——GenieDB 就是用来从投资人那里抽钱的工具。前 CEO 后来也作证说,自己当时就一再抱怨收费太离谱。

女:所以他的工作可能只是一个局里的装饰品。

男:他自己也有这个感觉,形容自己像只蚂蚁——职业生涯、家庭、美国公民身份全被那场欺诈改变了,但他的故事甚至算不上案卷里一条脚注。不过他最后还是承认,GenieDB 在 Frost 介入之前确实有一个核心技术概念,后来被更严肃的团队证明是有价值的,他和同事们当时也是真心在构建产品。他选择接受一个事实:生活本来就充满偶然和混乱,欺诈只是其中一股暗流。

女:这种“工具化”其实在行业里并不少见。有朋友在银行见过类似的事:外包公司把被裁掉的员工以更高价格送回同一个团队做同一份工作,管理层裁了人、账面好看了,但技术成本反而更贵。

男:对,这就是很多评论提到的“旋转门”。不同类别的支出走不同的预算线,比如“裁员”能减少人数,“外包”从另一个预算池走,即使更贵,也没人在意。有些公司甚至人为制定半年 10% 的淘汰目标,资深员工不断流失,新人刚上手就被换掉,CEO 还以为这是通往“顶级人才”的路径。有人的总结很到位:系统性的激励扭曲让浪费和欺诈变得像空气一样自然,David 的故事只是其中一个微小的切面。

女:这么说来,我们的工作可能比我们以为的要小,但也并不是纯粹的假象。这点还挺值得揣摩的。

男:没错。David 自己留下的那句话说得好:你的工作也许没那么重要,但你并不是完全活在别人的欺诈里。每个人都被偶然性推着走,他只是刚好在回头看时,看见了一股黑色的暗流。

女:从这种沉重感里出来,再聊点轻松好玩的技术创造。阿迪,你知道什么是 wigglegram 吗?

男:就是那种把几张角度略有不同的照片循环成 GIF,产生立体旋转效果的图,像在左右晃头看东西。作者是个特别纠结的摄影爱好者,喜欢一个场景就连拍很多张,而且从来不清理相册。后来他突然意识到,这些连拍可以直接转成 wigglegram。

女:等等,手动挑图不会累死吗?

男:所以他用脚本搞定了。他用感知哈希——就是 TinEye 反向图片搜索用的那种技术——去计算 iCloud 图库里照片之间的相似度,用汉明距离把相近的连拍组挑出来,阈值定在 10 左右。结果一下子爆出几百张动图。

女:这些“偶然立体图”跟专门拍的效果有什么不一样?

男:专门拍的比如用四镜头胶片机 Nishika N8000 那种,四张照片在同一瞬间捕捉,水平位移固定,立体感干净利落。他这些连拍时间差大,主体经常在动,看起来更像一个短短的小电影。有人评论说像“脱节的动画”,还有人提到可能会引发晕动症。但动物和雕塑的连拍效果很好,因为本来动作就不可预测,那种“动感”反而增加了趣味。一些有弱视或者习惯靠运动视差感受深度的人,反而更能看出 3D 感。

女:iPhone 的实况照片其实也能借来做这个,朋友之前给我看过,就是没那么精细。

男:对,实况照片本身就夹带一小段视频,搭配帧插值和正反播放可以让动感更平滑。还有人提到任天堂 3DS 的两颗后置摄像头也能用网页工具生成类似的立体图。作者把那个感知哈希脚本放在 GitHub 上,mac 下能直接读取 iCloud 图片,任意文件夹也行。这种自己挖出小惊喜的感觉,比直接用工具生成要有趣得多。

女:确实。说到小工具,我最近留意到 Deno 出了个桌面开发方案,好像能让 TypeScript 项目直接打包成桌面应用,体积也不大。

男:Deno Desktop,在 Deno 2.9 里推出的。它把你的项目代码、Deno 运行时和一个 Web 渲染引擎打包成一个自包含的二进制。默认后端用操作系统自带的 WebView,所以二进制很小,Mac 上大概 40 MB。如果你需要跨平台一致的渲染,可以选捆绑 Chromium Embedded Framework(简称 CEF),那体积会涨到 150 MB 左右,但能绕开系统 WebView 的那些坑。

女:系统 WebView 有什么坑?

男:很多。比如 Tauri 在 Linux 上用 WebKitGTK,比主流引擎慢很多,内存占用也更高。Mac 上,WebView 只能随整个操作系统更新,很多人的引擎可能还停留在十年前。捆绑 CEF 可以避免这些,但每个应用都带一份自己的 CEF 会让系统变得臃肿,所以 Deno Desktop 把共享运行时列入路线图了。

女:对前端开发者友好吗?

男:很友好。你指向一个 Next.js、Astro、Remix 这类项目,它会自动识别框架,运行生产服务器或带热重载的开发服务器,不用改代码。后端和 UI 之间的通信走进程内通道,不经过跨进程的序列化,速度上比较有优势。交叉编译也方便,一台机器能打出 macOS、Windows、Linux 三个平台的二进制。内置基于 bsdiff 的自动更新,启动失败会自动回滚。

女:编译时候的权限呢?Deno 那套权限控制挺严格的。

男:权限是在编译时写入二进制的,运行时用户不能动态允许或拒绝,这是个妥协。有人建议,如果用户信不过,可以用自己信任的 Deno 安装去运行未编译的脚本,但那样就失去独立应用的形式了。另外,有开发者提醒说,第三方认证最好回退到用户默认浏览器,因为 CEF 里的登录页曾被 Google 阻断过。

女:现在做桌面应用,除了 Deno、Tauri、Electron,感觉选项终于多起来了。不过好像哪种方案都得在体积、可靠性和开发体验之间做取舍。

男:是的。Deno Desktop 提供了 CEF 选项,让它在可靠性上比现在还依赖老旧 WebView 的 Tauri 更踏实一些。虽然入门门槛适合习惯 JavaScript/TypeScript 生态的人,但一离开这个生态,后端语言就没别的选择了。Tauri 后端可以用 Rust 等其他语言,二进制能压到 5 MB 以下,这个体积优势还是很大。两个工具长期看会互相推动改进。

女:咱们刚聊了开发者怎么造工具,那 AI 模型自己动手写游戏呢?最近有人拿 GLM-5.2 和 Claude Opus 4.8 做了一次“气氛测试”,让它们用原生 WebGL 写 3D 平台游戏,不给任何引擎,还挺有意思。

男:对,作者在两台机器上给同样的提示,然后对比结果。Opus 用了 33 分钟,花了大约 22 美元,做出的游戏角色有纹理,尖刺能杀人,碰到旗帜还有胜利条件。GLM-5.2 用了 1 小时 10 分钟,费用只有 5.39 美元,但角色面朝后,纹理缺失,尖刺无效,也没有胜利条件。

女:这个差距不只是模型聪明程度的区别吧。

男:关键差异在于 Opus 是多模态的,它能看自己生成的截图,发现残存的调试信息,然后修正。GLM-5.2 是纯文本的,只能靠读像素颜色值来验证,很多视觉上的问题根本发现不了。GLM-5.2 是 Z.ai 发布的新开源模型,MIT 协议,权重直接能下载。在推理基准上和顶级闭源模型差距不大,编码与代理任务上稍微落后,但输出 token 成本不到 Opus 的五分之一。

女:社区对这种单次提示测试怎么看?总有人说从零搭一个东西不能代表真实项目。

男:说法两极。有人觉得单次测试能暴露模型的内在判断力,而且很多实际工作本来就是靠长程代理完成的,并非一定要在已有代码库里改。也有人指出,对于大多数工程师,真正浪费时间的是让模型在现有项目中遵循模式和约束,这个场景下差距依旧明显。不过整体倾向是,开闭源差距在缩小,GLM-5.2 达到 Opus 九成性能却只花五分之一的钱,对成本敏感且以文本逻辑为主的任务,已经“足够好”了。

女:所以用户可以不再被一家供应商锁死,留一个开源模型作备份的确是种优势。

男:说到锁定,有人正是因为受够了供应商的各种要求,才决定全面切换到开放模型。有一篇写于 2026 年 6 月的文章里,作者说一直把开放模型当爱好,直到 Anthropic 要求身份验证,他才严肃考虑切换。

女:身份验证真的是一个很大的推力。我认识的几个产品经理就因为数据隐私的麻烦,开始找替代方案。

男:他的观点是,虽然排行榜上 Claude 和 GPT 这类闭源模型依然占顶,但开放模型通常只落后几个月,不像 2008 年 Linux 对 Windows 那种天壤之别。他预计生产力会有短期下降,但不至于像当年从 Matlab 切到 GNU Octave 那样中断职业生涯。评论区里不少人给出具体出路,说有欧洲的路由服务,比如 eurouter.ai,可以设置数据留在欧盟、零保留、不收集,配上 DeepSeek 之类的模型。

女:但是这种路由服务背后的 GPU 很可能还是美国公司吧?

男:没错,底层硬件多半还是那几家。好处是在法律层面能多一层保障。还有用户点了 Anthropic 的“红线”说辞——他们声称不会帮助美国违反宪法,但条文只保护“美国人”。也有人提到,Anthropic 新发布的“Mythos”级模型,即便选零数据保留,也会留提示词和输出 30 天用于安全审查,AWS Bedrock 等平台也一样生效,这让很多人更加不信任。

女:但这些替代服务好像挺贵的。

男:确实不便宜,有评论说价格虚高。但开放模型带来的灵活性就在于此:你可以自托管,也可以选信任的提供商,而不是被两家巨头完全锁死。这也是为什么欧洲那边一口气冒出了 EURouter、Eden AI、nexos.ai 等一大批路由服务。

女:换到开放模型这条路,当然不是一帆风顺。不过跟 AI 工具自身出的问题比起来,这些麻烦可能还不算什么。我这两天看到 OpenAI 的 Codex 有个日志 bug,听得我午饭都快喷出来了。

男:你说的是那个 SQLite 反馈日志?21 天写入了 37 TB,年化大约 640 TB。一块典型 1 TB 消费级 SSD 的总写入寿命也就 600 TBW,这个 bug 用一年时间就能把保修上限吃满。

女:这到底是怎么回事,能写掉这么多?

男:问题出在 Codex 的 SQLite 日志 sink——它用了全局 TRACE 级别的默认过滤器。所有依赖库的内部日志、原始 WebSocket 和 SSE 协议载荷、重复的 OpenTelemetry 事件全都往里灌。报告者给了一组数据:数据库只保留约 50 万行,但 SQLite 的 AUTOINCREMENT 计数器已经到 55 亿了。也就是说,写入后被修剪掉的行是保留行的 1 万倍以上。TRACE 级别占了总量的 70.7%,主要来源是底层 tokio-tungstenite 的连接日志和镜像的遥测事件,对反馈调试几乎没用。

女:那后来怎么修?

男:提交补丁的人把默认过滤器改成 INFO+,再把 codex_otelhyper_util 这些目标级别单独提升。两个 PR 合入后可以减少大约 85% 的写入。有用户提到,在 macOS 上只是把 Codex 窗口打开等待响应,GPU 就能飙到 100%,风扇狂转,这个问题已经存在近六个月了。

女:一边大肆宣传“AI 革命”,一边自家软件的开发质量这么糟糕,真的挺讽刺的。

男:社区里有人拿 Codex 跟 Claude Code 对比,说两者都是 slopware。Claude Code 也有终端闪烁、后台进程吃 CPU、不接受 AGENTS.md 配置这些槽点。但 Codex CLI 的优点在于它是开源 Rust 写的,比闭源的 Node.js 版本更容易修补和自定义。不少评论都在拷问,为什么这两家公司自己的产品质量如此低劣,却还在对外输出“颠覆性技术”的形象。

女:算了,聊点让人开心的事。Minecraft Java 版 26.2 更新,代号“Chaos Cubed”,内置了 Vulkan 渲染后端。阿迪,这算大新闻吧?

男:是的,这是 Minecraft 首个包含 Vulkan 1.2 渲染后端的版本。Vulkan 是一个低开销的跨平台图形 API,能更直接地控制现代显卡,效率比老旧的 OpenGL 高很多。这个版本把 Vulkan 标记为实验性,需要 GPU 支持动态渲染。如果系统不支持,会自动回退到 OpenGL。视频设置里现在提供“首选 Vulkan”或“首选 OpenGL”的选项。Mac 上通过 MoltenVK 把 Vulkan 桥接到 Metal。

女:为什么微软会让 Mojang 选 Vulkan 而不是 Direct3D?

男:主要是因为 Java 版必须跨平台,要兼顾 macOS 和 Linux。而且 Minecraft 的 Java 团队一直保持很强的技术独立性。社区里很多 Linux 用户这次特别高兴。有人在评论里说,OpenGL 已经无法很好地映射现代硬件,Vulkan 是实现“Vibrant Visuals”光照改进的前置条件。

女:这次更新还加了一个特别萌的新怪物,硫磺立方怪,能吃掉你给它的方块,然后像被施加了不同效果。

男:对,喂 TNT 它就会变成可以引爆的原型,通过红石或者火源引燃。喂木头会变得弹性十足,喂冰就滑溜溜的。小型方块怪可以用粘液球喂大,大的可以用桶装起来。这给红石玩家打开了一片新天地。

女:还有硫磺洞穴、间歇泉、新的好友列表。看来 Mojang 在持续维护技术底盘的同时,也没忘游戏内的社交和玩法。

男:朋友列表可以显示在线状态,隐私设置也比较细。Hoglins 这次被正式列为敌对生物,不再在和平难度下生成。床和黏液块的弹性行为也做了对齐基岩版的调整。粒子系统在超限时改为随机决定渲染,而不是直接删旧粒子。技术上数据包和资源包版本号都升了,床、告示牌改用方块模型,还加了 unpublish 指令移除已发布的局域网服务器。

女:社区里担心聊天举报系统滥用的问题,似乎也一直在。

男:是的,有些知名玩家因虚假举报被封,包括在私人服务器。有声音建议用 Mod 阻断举报数据,但也有人指出封禁未必基于聊天记录。整体看,技术进展和社区担忧就是并存的。

女:从方块世界出来,我想说说一个极小的实操项目。有人给自己的家庭问答机器人做了一个问题分类器,用的只是 6 亿参数的 Qwen 3,而且他是微调出来用的。

男:他的想法很朴素:机器人知识存在向量数据库里,检索前先做预处理,把问题归到预定义类别,比如“泳池”“暖通空调”“烹饪”,然后缩小搜索空间。他拿 131 个问题做基准,原始模型只对了 13 个,准确率也就 10% 左右,主要毛病是过度使用模糊标签,还会发明新类别。

女:微调能救回来吗?

男:第一次用 Unsloth 加 QLoRA,850 条数据,准确率提到 79%。模型会输出类别片段,比如把“hvac”写成“ac”,水相关类别之间混淆也比较多。第二次他做了个特别简单的改动:把所有类别名换成两个大写字母的无意义代码,比如 AA 代表电器,BB 代表砖墙。模型只需要输出固定代码,不再纠结语义,准确率一下子跳到 92%。剩下那些错误基本都集中在“热水器”和“泳池”之间,原因很简单——都跟水有关。他打算改进训练数据继续提分。

女:不过说实话,这种任务用传统机器学习方法是不是更合适?

男:不少评论也是这么说的。有人推荐 Scikit Learn 的 SGDClassifier 加 2-grams,训练不到一分钟,模型不到 1MB,还适合嵌入式设备。另一些人说 ModernBERT 加分类头或者基于 embedding 的余弦相似度也能很好解决。双向注意力在分类上比自回归的 decoder-only 模型有天然优势。作者后来也跑了 Logistic Regression,只是没公布结果。不过他的实验本身很有趣——就是想知道极小 LLM 的边界在哪里。

女:那再往底层走一步,最近看到 Fil-C 这个内存安全的 C 变体,居然实现了“内存安全的内联汇编”,这怎么做到的?

男:内联汇编本身很不安全,写错约束或漏掉 clobber,编译器就会生成错误代码。Fil-C 的做法是静态分析 LLVM IR 层的汇编字符串和约束,只允许那些没有内存访问、没有控制流、副作用完全被约束覆盖的指令。如果不安全,编译不会直接报错,而是在运行时触发 panic 或非法指令陷阱,目的是不让死代码里的汇编阻塞移植。

女:要审核成百上千条指令,这工作量太可怕了。

男:作者没有手动干,而是用 AI 代理来辅助。他先用 Kimi K2.7-code,后来切换成 GLM 5.2,写了一个循环机制,让子代理一条一条处理指令列表,输入白名单或拒绝。他每天检查两次,做合理性验证和测试。最终实现了数百条安全指令,包括 x87、SIMD、位运算、内存屏障等,附带大量正向和负向测试。

女:有人担心运行时 panic 不够安全,编译时能查的问题最好早点暴露。

男:对,有评论提了这个。作者的回答是,这种方式让死代码里的汇编不影响移植,而且 Fil-C 不提供捕获非法指令的能力,所以 panic 也是安全死亡。团队认为 AI 在严格护栏下完成这种复杂工作,效果超出了预期。这也引出另一个话题——AI 自己组织自己干活。

女:那正好收尾到 Sakana 的 Fugu。这是一个多智能体系统,能动态调度一堆前沿模型分工合作,像是给 AI 组建了一个项目组。

男:是的,Fugu 兼容 OpenAI API,用进化算法和强化学习训练出一个轻量协调器,自动给任务分配思考、执行、验证的角色。产品分两档:Fugu 讲究速度和成本的日常平衡,Fugu Ultra 则调度更多专家模型,追求论文复现、Kaggle 比赛那类复杂任务的最高质量。定价从每月 20 美元到 200 美元,按量计费也不便宜,Fugu Ultra 每百万输出 token 要 30 美元。

女:效果上呢?

男:基准测试里,Fugu Ultra 在 SWE Bench Pro、LiveCodeBench 等多项编码推理基准上,打平了顶尖闭源模型。有个案例挺有意思——它用 14 小时 123 次实验自主优化 GPT 训练超参,结果在语言模型困惑度上优于三个基线。盲棋还胜过 2100 Elo 的 Stockfish。早期用户反馈里,有人用它做专利地图分析,几小时就完成了平时三四天的工作。但社区评价很分裂,主要槽点在于订阅配额消耗极快,速度慢,在某些代码实现上的错误率比直接使用前沿模型高,有人觉得不如直接开 OpenAI 或 Claude。

女:有评论拿它和 OpenRouter 的 Fusion 比吗?

男:有人这么比,但 Fugu 的动态协调器比简单的并行调用更复杂,它会生成多步工作计划,比如先让某个模型推理,再让另一个模型验证安全,最后由第三个模型汇总。Sakana 和日本防卫省的合作也让部分用户顾虑,认为削弱了产品吸引力。但也有人觉得团队研究背景强,多模型编排这条路可以减少对单一大模型供应商的依赖,方向是合理的。

女:从偶然的欺诈到多模型协同,今天这些话题好像都在说同一件事——技术背后总有复杂的暗流,也有意外的小火花。阿迪,你感觉哪个印象最深?

男:可能还是 David Newgas 的故事吧。它提醒我们每个人的工作也许渺小,但渺小并不意味着毫无真实价值。那些乱流的系统里,善意和努力仍然存在。

女:好的,我们下期再见。提醒大家可以用泛用型播客客户端订阅我们,这样每次更新都不会错过。拜拜。

男:拜拜。

参考链接