




















Liquid AI 发布的 LFM2.5-8B-A1B 是一个 MoE(Mixture of Experts,专家混合)模型,总参数 8B、每次只激活约 1B,并宣称在 38T tokens 上训练。它以 open-weight 形式提供,但评论立刻指出许可并不等于开源,商业组织可能会被收入门槛限制。讨论还在问它究竟该被当作通用聊天模型、代码模型,还是更像 agentic core(把任务交给工具和外部系统的核心)。很多人把它放进本地推理生态来比较,例如 llama.cpp(常见本地推理引擎)和 Ollama(基于 llama.cpp 的本地运行工具),因为量化和硬件速度直接决定它是否适合桌面端使用。评论里提到的 car wash 常识题,则是拿来检验模型是否真的理解现实前提,还是只会拼接语言模式的例子。
博客把它包装成 open-weight,并声称可以下载、微调和部署不受限制,但有人指出 Hugging Face 许可里对年收入超过 1000 万美元的组织有明显限制。争议点不只是条款细节,而是营销话术与实际商业可用性不一致。对想把模型放进产品或内部平台的公司来说,这会直接影响能不能用、怎么用。
实测反馈很分裂:有人在 bug fixing 基准上看到它远逊于 Qwen2.5-Coder-3B,也有人觉得它在长文本摘要上很强、速度很快。旧版 Liquid 模型在世界知识测试里也被说表现一般,甚至不如 Gemma 31B 或 Qwen 35B-A3B。另一层质疑是基准图表可能只展示赢的部分,因此 8B + MoE 的宣传看起来比实际能力更亮眼。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13]
不少人把它理解成更像 agentic core,而不是单纯聊天模型:负责低延迟交互、编排工具、再把复杂任务交给别的系统。这个思路下,离线、本地、异步调用云端更大的模型,才是它真正的价值。可是一试 OpenCode,很多人发现 tool calling 几乎不可用,于是怀疑通用 harness 与模型偏好不匹配。也有人把它拿来做邮件 triage、浏览器任务和其他个人工作流,觉得只要 harness 合适,小模型就有现实价值。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]
讨论里大量在比本地部署体验:有人关心它能否在 CPU 上跑,也有人拿 Strix Halo、M5 Max、R9700 这些设备报 token/s。量化层面,Q4/Q6/Q8 的差异被反复提起,普遍观点是 Q8 更接近 FP16/BF16,而更低位宽尤其是 KV-cache 量化会明显伤害技术任务。与此同时,llama.cpp 和 Ollama 的支持、更新速度,以及 MoE 带来的稀疏激活,都被看作它能否成为日常本地模型的关键。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13] [来源14] [来源15] [来源16] [来源17]
38T tokens 这个数字让不少人怀疑 8B 模型是否已经接近知识压缩的物理边界。有人担心继续堆 token 只会带来 overfitting 和基准过拟合,而不是更好的泛化。也有人拿 Chinchilla scaling 的直觉去算 8B 总参对 1B active 的 token 比例,觉得这个训练强度大得有点夸张。另一派则主张把知识放到工具和上下文窗口里,而不是全塞进权重。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8]
car wash 这组老梗成了讨论 LLM 常识的缩影。支持者认为题目本身就故意含糊:如果你已经在车洗店、是维修人员,或只是去店里办别的事,走过去完全说得通,甚至人类平均也不算稳定。批评者则用它证明模型只会拼语言关联,不会补全现实世界的隐含前提;而反驳者反过来说,真正的问题是人类自己平时就靠大量 tacit assumptions 在做判断。这也是为什么有人质疑,若模型连这种题都处理不好,又怎么放心让它进工作流或写代码。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13] [来源14] [来源15] [来源16] [来源17] [来源18] [来源19] [来源20] [来源21] [来源22] [来源23] [来源24] [来源25]
MoE(Mixture of Experts): 专家混合架构,推理时只激活部分专家,以降低计算量并保留较大总参数规模。
quantization(量化): 把模型权重或缓存压到更低 bit,换取更小内存和更快推理,但可能损失精度。
KV-cache: 推理时保存注意力键值的缓存,长上下文下对速度和质量影响很大。
tool calling: 让模型调用搜索、代码执行、数据库等外部工具来完成任务。
llama.cpp: 常见的本地 LLM 推理引擎,支持 GGUF 和多种量化格式。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。