惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
V
V2EX
博客园_首页
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Recent Announcements
Recent Announcements
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Latest news
Latest news
Vercel News
Vercel News
The Register - Security
The Register - Security
T
The Exploit Database - CXSecurity.com
S
Schneier on Security
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
小众软件
小众软件
L
Lohrmann on Cybersecurity
GbyAI
GbyAI
P
Privacy & Cybersecurity Law Blog
T
Tor Project blog
AWS News Blog
AWS News Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
K
Kaspersky official blog
B
Blog RSS Feed
G
Google Developers Blog
量子位
大猫的无限游戏
大猫的无限游戏
Google DeepMind News
Google DeepMind News
Scott Helme
Scott Helme
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
I
Intezer
雷峰网
雷峰网
Martin Fowler
Martin Fowler
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Blog — PlanetScale
Blog — PlanetScale
IT之家
IT之家
F
Full Disclosure
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 【当耐特】
The Hacker News
The Hacker News
U
Unit 42
S
SegmentFault 最新的问题
I
InfoQ
aimingoo的专栏
aimingoo的专栏
Y
Y Combinator Blog
宝玉的分享
宝玉的分享
罗磊的独立博客
Spread Privacy
Spread Privacy
C
CERT Recently Published Vulnerability Notes

est の 输入 输出和出入

iosevka字体让中文 ASCII diagram 图表对齐 为什么 Github OAuth 故意拦截 CORS gitweets改版,复刻微信「朋友圈」 MiMoCode 干完活儿发通知 写作能力和 locate cost grep vs sqlite 谁更适合微信聊天记录? [AI] curl -NT. 导致100% CPU原因 或许「数羊」真是个有效的入睡法 唯物主义「天命」论 我的 Vibe Coding 最佳实践——ADR文档 MacOS 快速插入当前时间 locate cost 基于 git 的零拷贝静态web服务器 AI和柜台费 Sutton 论 discovery Elon Musk 五步工作法 Playlet:DLNA听歌神器 免安装app播放NAS里的歌 不修改nginx接收websocket AI 硬伤 理解LLM的范式——它就是个差分机? 路径依赖 AI 流式接口的pattern FSRS核心字段 SVG 时钟 AI的自我觉醒是必然 唐宋之变 Louis Alexander 谈英语学习 Predict Next Word Instruct 的意义 Sentry 替代品 Bugsink 安装配置 浏览器通过WebGPU上做AI推理 Indent Is All You Need 语文学习和考试 失落的学习兴趣 如何跟孩子讲学习的意义 物权 Bonsai 在 M2 安装 The Porsche Diffusion 首页和404更新 无用之用——或许LLM真的还不是AGI 发明后训练的人真是天才 码奸 claw会代替员工? 如果拿 token 抵工资会发生什么? tmux enables AIs to operate servers safely chat.est.im launches at 3.14 2026 股灾? AI 弑父 Configurable Intelligence 巴别塔,Vibe Coding和Lisp之咒 Citrini的2028智力危机 中文不是唯一的意译语言 观星有感 体细胞阶级论——当繁衍权被剥夺
看好 Taalas
2026-03-23 · via est の 输入 输出和出入

可能你还没刷到过 https://chatjimmy.ai 我被它几万 tokens/s 的推理速度震惊了。也在zhihu上翻了不少技术细节讨论。它背后的公司叫 Taalas 号称把 4-bit LLaMA3.2-3B 直接刻电路上,当然很多人第一反应是,这玩意废品啊,模型升级了岂不是硬件就白费了。

但仔细研究,发现这里面另有乾坤。

大模型在显卡VRAM里,70%拿来存静态权重,推理的时候这玩意就一层一层做矩阵乘法只读不写,然后30% 才是 KVcache 上下文,又读又写。吞吐频繁

如果你懂一点LLM,那么你应该猜出来了。

聪明人就想到了ROM。类似游戏机里的卡带,插进去 CPU/GPU 能直接访问一块特殊的内存区域。ROM成本比DRAM便宜得多,速度极快,但是只读,烧制一次就成型了。其他部分可以直接上SRAM,也就是CPU里高速缓存那种。DRAM断电丢数据,SRAM是6个晶体管保存一个1bit,不需要持续通电。DRAM是一直通电刷新bit状态。

ROM+SRAM 非常省电,而且推理速度极快,基座模型的确是ROM做好就不能升级了。但是 SRAM 里可以做mask做LoRA啊。

而且更绝的一点是,SRAM里可以后期 fine-tune 一下,吧ROM里的坏快屏蔽掉,或者权重弥补一下。这样 ROM 的良率又回极大提高!

所以这玩意不是不能升级,是能可以一直挖掘座模型的能力天花板。

有人说这玩意过时快,我想如果你买一个 USB设备,你向它输入 bytes 它能返回 bytes,你觉得它智商不够用了,你可以出二手啊。现在很多地方都需要用到不是那么大的LLM,够用就行。所以这玩意跟卡带一样是有残值的。

不过今天突然想到,taalas这玩意最佳用途应该是自动驾驶:

  1. 超高速推理:即时决策,遇到路况实时反应
  2. 离线运行:无需依赖云端,本地VLA
  3. 智驾其实迟早成熟,只要练成了,很少更新。恰好适合固化到ROM里
  4. 功耗
  5. 你是真的买一块板子,而不是一个订阅,用户为智驾付费更有实物感和仪式感。
  6. 确定性推理:相同输入总会输出相同结果,事故或异常可以完全重现,便于追踪和取证。

现在智驾最大的问题就是L2 L3责任归因是个黑盒。如果把推理做成硬件,那么当 temperature 为0,把传感器数据也存一份,是可以精确还原replay当时智驾决策的。

遇到问题该升级升级该赔钱赔钱。商业的本质不是追求“零风险”,而是追求风险的可控与可定价。

唯一的问题就是知识产权盗窃。直接逆向板子不太可能,最大的隐患是蒸馏。

这里也只是做个记录,怕以后忘记了。希望看到 Taalas 或者类似的技术早日普及。