欢迎来到 Agili 的 Hacker Podcast。今天我们将探讨 DeepSeek v4 的技术架构、大语言模型的底层运作原理,以及现代企业软件和开发基础设施面临的结构性挑战。
DeepSeek v4 兼容主流 API 接口
模型矩阵调整
DeepSeek 引入了 deepseek-v4-flash 和 deepseek-v4-pro 两款新模型。其 API 格式完全兼容 OpenAI 和 Anthropic 的 SDK,开发者修改 base_url 即可完成切换。原有的 deepseek-chat 和 deepseek-reasoner 模型名称将于 2026 年 7 月停用。新版本支持通过 thinking 参数开启思考模式,并提供 reasoning_effort 参数调节模型推理的时长与深度。
硬件依赖讨论
Hacker News 社区对该模型的硬件底层设施展开了讨论。有观点猜测该模型完全运行在华为芯片上,实现了零 CUDA 依赖。严谨的开发者指出,目前公开的技术文档并未提供脱离英伟达硬件的确凿证据。DeepSeek 官方披露的信息显示,随着下半年华为昇腾 950 超级节点的上线,Pro 版本的推理成本将进一步下降。
行业定价影响
DeepSeek 以极低的成本复现了前沿 AI 能力。社区用户普遍认为,这种模式打破了以往由高昂算力成本筑起的商业护城河。AI 领域正在从少数巨头垄断的技术扩张期,转向多元竞争与模型能力商品化的新阶段。
大语言模型运作原理解析
从抓取网页到生成文本
这份基于 Andrej Karpathy 讲座的可视化指南将 LLM 的构建分为四个阶段。预训练阶段收集并清洗海量网页数据(如 44TB 的 FineWeb 数据集)。文本随后通过 BPE 算法被拆分为 Token。在神经网络训练中,Transformer 架构利用注意力机制(Attention Mechanism)结合上下文消除多义词歧义,不断调整参数以预测下一个 Token。
幻觉现象与外部检索
完成预训练的基础模型本质上是一个自动补全引擎。通过有监督微调(SFT)和基于人类反馈的强化学习(RLHF),模型才具备对话助手的能力。针对模型自信编造虚假信息的“幻觉”现象,业界采用检索增强生成(RAG)作为缓解方案。部分社区评论指出,RAG 本质上是利用余弦相似度在外部数据库中进行检索,让数据抓取过程显性化。
呈现形式的争议
该可视化项目大量使用 AI 辅助生成 CSS 和文案。部分 Hacker News 用户批评其视觉风格缺乏品味且存在诸如“44TB 数据存入单个消费级硬盘”的事实错误。另一部分用户认为,将长视频转化为交互式文档降低了学习门槛。想要深入了解底层架构的开发者推荐阅读 Jay Alammar 的《图解 GPT-2》。
美军士兵涉嫌利用预测市场进行内幕交易
提前押注军事行动
美国陆军特种部队士兵加农·肯·范戴克参与策划了抓捕委内瑞拉领导人马杜罗的机密军事行动。在签署保密协议的情况下,范戴克于军事行动前在预测市场 Polymarket 上投入约 3.3 万美元,押注“美军进入委内瑞拉”及“马杜罗下台”。随着抓捕行动成功,其账户获利约 40.9 万美元。
资金转移与检方指控
范戴克将资金转移到海外加密货币金库,并尝试以“丢失邮箱访问权限”为由注销 Polymarket 账户以隐瞒身份。美国司法部对其提出商品欺诈、电信欺诈及非法货币交易等多项指控。代理司法部长明确表示,保护国家安全信息的联邦法律完全适用于新兴的预测市场。
预测市场的监管空白
Polymarket 平台在识别出异常交易后主动向司法部举报。Hacker News 社区讨论将焦点转向了司法体系的执行尺度。有用户对比了该士兵被捕与美国国会议员合法进行股票交易的现状,探讨预测市场在提供信息流通价值与防范内幕交易之间应如何建立监管平衡。
习惯性饮用咖啡重塑肠道菌群
菌群组成与生理指标改变
《Nature Communications》的一项研究分析了咖啡摄入对“微生物群-肠道-脑轴”的影响。习惯性饮用咖啡(每日 3-5 杯)会改变粪便微生物组成,降低代谢物和抑制性神经递质 GABA 的水平。咖啡饮用者的基础炎症指标(CRP)较低。脱咖啡因咖啡同样能改善睡眠质量和记忆力,表明咖啡中的多酚类物质在调节肠道健康中起关键作用。
认知表现与情绪调节
研究指出咖啡饮用者具有更高的冲动性。停止摄入咖啡两周后,参与者的血压显著下降。Hacker News 用户分享了将咖啡作为低成本生产力工具或用于缓解未诊断 ADHD 症状的经历。部分用户报告在戒断咖啡后经历了长达数月的快感缺失,远超研究设定的两周物理戒断期。
摄入量标准的社区分歧
该研究将“每日 3-5 杯”定义为适度摄入。社区开发者指出不同冲泡方式的咖啡因含量差异巨大,且个体代谢能力受遗传影响,该标准缺乏普适性。研究中立地指出了咖啡对记忆力测试的负面影响,为评估日常咖啡因摄入提供了数据参考。
TorchTPU 提升大模型硬件适配效率
动态图优先架构
Google 推出了 TorchTPU,使 PyTorch 能够原生运行在 TPU 集群上。开发者将初始化配置更改为“tpu”即可迁移工作负载。架构采用“动态图优先”理念,通过 PyTorch 的 PrivateUse1 接口接入,提供 Debug、Strict 和 Fused 三种执行模式,利用 TensorCores 动态融合计算步骤以提升性能。
编译优化与分布式执行
TorchTPU 使用 XLA 作为编译器后端,将算子映射为 StableHLO 中间表示层,修复了早期插件的静默挂起问题。在分布式训练中,新架构突破了单程序多数据的限制,支持处理执行分歧,允许单个节点独立记录日志而不拖垮整个系统。
实际迁移体验
为了最大化 TPU 效能,官方建议将模型注意力头维度设为 128 或 256。社区对“一行代码无缝迁移”的宣传持谨慎态度。Google 计划在近期开源代码仓库,并集成自定义内核语言 Helion 和高吞吐量推理库 vLLM。
Ubuntu 26.04 引入全盘加密与内核热补丁
核心工具集退回 GNU 版本
Ubuntu 26.04 LTS 版本增强了基于 TPM 的全盘加密和应用程序权限控制。发布前夕,用 Rust 重写的 coreutils 组件被曝出权限重置等漏洞。Canonical 决定在 cp、mv 和 rm 等关键工具上退回传统的 GNU 版本。社区认为 LTS 版本应优先保证系统稳定性,核心底层工具不应仓促替换。
桌面环境变更引发争议
默认的 GNOME 50 桌面环境禁用了中键点击粘贴,并启用了强制性的窗口平铺逻辑。这干扰了部分开发者的固有工作流。Snap 沙盒机制在限制应用访问外部驱动器时缺乏明确错误提示,导致使用体验受损。
替代方案与硬件支持
对于不适应新版 GNOME 或 Snap 机制的用户,社区倾向于转向 Debian 或 Linux Mint。Ubuntu 26.04 在处理 Nvidia 驱动和非标准化硬件配置上依然保持优势,适合需要快速完成大规模部署的非极客用户群体。
熟悉感成为企业软件创新的阻碍
购买保险而非产品
过去 60 年间,企业在知识管理系统上的投资大量转化为技术坏账。企业在采购决策时往往将“操作简单”与“品牌熟悉”混淆。采购微软或 IBM 等知名大厂的产品被视为规避职业风险的“保险”。这导致企业系统倾向于采用流行的编程语言和沉重的架构,排斥具有极高数据处理效率但不被大众熟知的技术栈。
RAG 架构的局限性
当前企业部署的 RAG(检索增强生成)系统面临结构性瓶颈。由于被切割的文档块之间缺乏关联,RAG 无法回答需要跨信息点推理的多跳问题。将大语言模型仅用作文本搜索引擎,无法解决非结构化数据中的实体关系提取难题。
图原生智能方案
利用 LLM 自动提取文档中的结构化数据并生成知识图谱,是一条可行的路径。评估企业知识系统的标准包括:能否识别当前风险体系中的缺失环节、能否准确关联不同表述的同一实体、支持历史状态查询,以及在司法管辖权变更时保持基础设施控制权。
现代软件栈急需声明式统一模型
系统连贯性破裂的成本
现代软件开发在数据库、缓存、队列和前端等组件之间存在模型割裂。组件必须通过低级的网络协议交互,导致接口语义不匹配和类型系统冲突。开发者将大量精力耗费在处理系统边界的连贯性问题上,而非编写核心业务逻辑。
组合性的行业实践
游戏引擎 Godot 将物理、渲染和音频置于统一架构下,证明了跨领域的模块组合性是可行的。Cambra 等项目试图建立一种声明式的编程系统,开发者只需描述领域模型,系统自动处理底层的并发控制和状态存储。这种模式旨在消除组件间的阻抗失配。
AI 时代的代码精确度
提示词具备天然的模糊性,而计算机代码要求绝对精确。目前的 AI 助手在处理缺乏结构的碎片化代码库时容易出错。AI 的效能最大化发生在规则清晰、领域对齐的连贯系统中,建立统一的数据处理底座是降低软件工程复杂度的基础。
《我为何写作》中的创作底层逻辑
驱动创作的四大动机
乔治·奥威尔在文章中剖析了非虚构写作的驱动力:纯粹的利己主义(渴望被关注与死后留名)、对外部世界和词语排列的审美热情、记录事实供后人参考的历史冲动,以及试图将世界推向特定方向的政治目的。他认为任何声称“艺术无关政治”的言论本身就带有政治性。
政治目的与艺术的融合
西班牙内战促使奥威尔明确了反对极权主义的立场。他面临的核心挑战是在不牺牲智慧诚实的前提下,将政治写作转化为艺术。《向加泰罗尼亚致敬》因包含大量政治辩护破坏了艺术完整性,直到《动物农场》,他才首次将政治目的和艺术表达融为一体。
窗格玻璃般的散文
奥威尔将写作形容为一场痛苦的挣扎。他认为优秀的散文应该像一块透明的窗格玻璃,直抵事实本身。当作者缺乏明确的政治目的时,文字往往会陷入辞藻华丽但空洞无物的状态,必须不断抹去过度的自我个性,才能产出具备可读性的作品。
播客全文
女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是小雅。
男:大家好,我是老冯。
女:老冯,最近 AI 圈子真的是被 DeepSeek 刷屏了。他们新发的 v4 版本,不仅价格极低,而且改一行代码就能直接把 OpenAI 的接口切过去。
男:对,只需要改个 base_url。这次他们推了两个新模型,Flash 和 Pro。有意思的是,你可以通过一个叫 reasoning_effort 的参数,直接手动调节模型思考的深度。你想让它多想一会儿,就把参数调高点,非常直观。
女:这对开发者太友好了。而且我看到有传闻说,这套模型做到了零 CUDA 依赖,完全跑在华为的芯片上。如果真的跑通了,那意味着算力成本能降下来一大截。
男:虽然目前还没有完全脱离英伟达的确凿技术文档公开,但官方确实提到了下半年随着新节点上线,推理成本还会大幅下降。其实这打破了以前那种只有砸几百亿美金才能做前沿 AI 的资金护城河。
女:确实。说到大模型到底是怎么运作的,最近有个基于 Andrej Karpathy 讲座的可视化指南特别火。对于咱们普通用户来说,其实可以把它想象成四个步骤。第一步就像是让 AI 把整个互联网当成图书馆,硬生生背下来。
男:没错,就是预训练。有个好玩的数据,他们用了大概 44TB 的高质量网页数据。原作者说这能塞进一块硬盘,结果被一群硬核网友纠正,说消费级市场你得买十块硬盘才装得下。
女:太严谨了。背完书之后就是分词,把句子拆成一个个音节或者词根。然后就是神经网络训练,让它玩猜下一个词的游戏。最后一步很关键,就是通过人类反馈来微调,把它从一个无情的自动补全机器,变成一个有问必答的助手。
男:这里面有个很头疼的问题,就是幻觉,它会一本正经地胡说八道。现在业界流行用 RAG,也就是检索增强生成来解决。
女:就像是开卷考试,回答问题前先去翻翻资料库。
男:对。不过有人觉得 RAG 本质上就是让剽窃显性化。你用余弦相似度这种数学方法,去数据库里捞别人写好的东西拼凑出来。
女:这个视角挺犀利。其实不管是训练模型还是跑检索,背后都离不开底层硬件的支持。除了英伟达,Google 最近也放了个大招,搞了个 TorchTPU。
男:这个我特别关注。以前你想在 Google 的 TPU 上跑 PyTorch 代码,中间的适配能让人掉半条命。现在他们做到了动态图优先,你只需要把初始化配置改成 tpu,核心逻辑几乎不用动就能跑。
女:这能给工程师省下好几天甚至几周的加班时间吧?
男:绝对的。它内部有个设计能自动把计算步骤融合成密集块,性能直接提升百分之五十到一倍。不过现在 TPU 还不能直接买,只能在云上用,算是个小遗憾。
女:其实说到技术选型,很多时候不是技术好不好,而是企业敢不敢用。我最近看了一篇吐槽企业级软件的文章,简直把大公司的采购心理扒得底朝天。
男:哦?怎么说?
女:文章里说,企业买小公司的创新产品叫勇敢,买大厂的烂系统叫买保险。因为大厂有大家熟悉的品牌和生态,哪怕这个知识管理系统非常难用,员工天天抱怨,IT 部门也觉得安全。
男:这让我想起当年惠普花一百多亿美金买 Autonomy 最后几乎全部减值的惨案。其实这就是把简单和容易搞混了。大家觉得用流行的语言容易,是因为好招人,但这往往会让整个架构变得极其平庸。
女:对,甚至现在很多公司搞 AI 也是这个思路,觉得套个 RAG 就算智能化了。但你要是问它那种需要跨好几个文档推理的问题,它根本答不上来。所以现在有人提出要做图原生智能,用 AI 把非结构化的数据直接抽成知识图谱。
男:知识图谱这东西确实能解决实体关联的问题。其实不管是知识管理,还是我们日常写的系统架构,现在都面临一个巨大的碎片化危机。
女:怎么讲?
男:你看,我们现在写代码的语言很优雅,但一旦你要把数据库、缓存、前端拼在一起,整个系统就碎了。你得通过很底层的网络协议去交互,每次改个接口字段,只有在程序跑起来崩溃的时候你才能发现。
女:所以现在的程序员要把一大半精力花在写测试和防御性编程上。连操作系统的选型大家也越来越保守,比如 Ubuntu 刚发的 26.04 长期支持版,本来想用 Rust 重写核心工具来提高安全性。
男:对,结果发布前夕发现了好几个漏洞,官方吓得又退回了以前的传统版本。这就印证了刚才说的,用新语言重写并不能免疫逻辑漏洞,有时候历经几十年战场考验的老工具反而更靠谱。
女:这也挺像企业采购的心态,大家最后还是选择了熟悉和稳妥。说到这些系统里的漏洞和捷径,最近有个大瓜,一个美国特种部队的军士长,竟然用机密信息在预测市场 Polymarket 上炒作牟利。
男:这哥们自己参与策划了一个海外的抓捕行动,然后跑去平台上押注目标人物会在 1 月前下台。砸了三万多美金,最后行动成功,他净赚四十万。
女:这简直是物理意义上的内幕交易啊。他事后还想把钱转到海外加密钱包,甚至假装邮箱丢了去注销账户。
男:结果还是被抓了,面临电汇欺诈等指控,最高能判 20 年。大家讨论的焦点是,去中心化的预测市场现在成了利用国家机器信息差进行降维打击的新渠道。
女:而且很多人觉得挺讽刺的,军人搞内幕交易被抓了,但那些提前知道政策、在股市里合法交易的政客却没事。这也引发了大家对预测市场到底该不该被强监管的讨论。
男:其实技术平台就是个放大器。有人提议与其封杀平台,不如强制限制这些掌握机密的人购买个股,或者只能买指数基金,切断利益驱动才是根本。
女:确实。聊了这么多硬核的技术和新闻,咱们来个轻松点的话题。老冯,你今天喝了几杯咖啡了?
男:这是第二杯。怎么了,咖啡因超标了?
女:我刚看了一篇自然通讯的研究,说长期喝咖啡会改变你的肠道菌群,进而影响大脑。
男:肠脑轴对吧。这研究怎么定义长期喝?
女:每天 3 到 5 杯。
男:这么多才叫适度摄入?这标准有点猛啊。
女:所以大家都在吐槽这个标准。不过研究发现,喝咖啡的人肠道里某些代谢物会减少,比如有一种叫 GABA 的神经递质会下降。这东西本来是起镇静作用的。
男:怪不得。很多人说戒了咖啡之后,感觉思维变得柔软、平静了。喝咖啡的时候总处于一种高度紧绷、有点冲动的状态。
女:对,甚至有人觉得喝咖啡就是在自我药疗,靠强行拉高多巴胺来顶住工作压力。但有个好消息,研究发现哪怕你喝的是脱因咖啡,也能改善睡眠和记忆力,因为里面有抗氧化的多酚类物质。
男:看来重点不仅是咖啡因,还有那份仪式感和植物成分。我决定明天试试脱因咖啡。
女:顺便保护一下肠胃。节目的最后,我想分享乔治·奥威尔的一段话。他在《我为何写作》里总结了人为什么要写东西。他说主要有四个动机,利己主义、审美热情、记录历史的冲动,还有政治目的。
男:其实写代码也挺符合这几点的。你想写出一个惊艳的算法,想留下一个牛逼的开源库,或者纯粹觉得这行代码写得很美。
女:奥威尔说,好的散文就像一块透明的窗玻璃,简洁而且直抵真相。写作是一场可怕又让人精疲力尽的挣扎。
男:深有同感。你在键盘上敲出每一个字、每一行代码的时候,其实都在抹去自己的个性,去追求那个最清晰的表达。
女:这也是我们做这档播客的初衷,希望能做一块透明的玻璃,带大家看清技术背后的真相和故事。
男:今天聊得很畅快。
女:感谢大家的收听。如果你喜欢我们的节目,记得使用泛用型播客客户端订阅我们,这样就不会错过任何一期更新了。咱们下期再见!
男:下期见。
参考链接
- DeepSeek v4
- Why I Write (1946)
- U.S. soldier charged with using classified info to profit from prediction market
- Show HN: How LLMs Work – Interactive visual guide based on Karpathy's lecture
- TorchTPU: Running PyTorch Natively on TPUs at Google Scale
- US special forces soldier arrested after allegedly winning $400k on Maduro raid
- Habitual coffee intake shapes the microbiome, modifies physiology and cognition
- Ubuntu 26.04
- Familiarity is the enemy: On why Enterprise systems have failed for 60 years
- Composition Shouldn't be this Hard

























