惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
MyScale Blog
MyScale Blog
博客园 - 【当耐特】
I
InfoQ
腾讯CDC
aimingoo的专栏
aimingoo的专栏
L
LangChain Blog
人人都是产品经理
人人都是产品经理
D
DataBreaches.Net
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Engineering at Meta
Engineering at Meta
A
About on SuperTechFans
Google DeepMind News
Google DeepMind News
Vercel News
Vercel News
C
Check Point Blog
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
美团技术团队
Stack Overflow Blog
Stack Overflow Blog
Y
Y Combinator Blog
D
Docker
MongoDB | Blog
MongoDB | Blog
量子位
博客园_首页

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
Claude的中文税:问同样内容比英文多花65%token,OpenAI只多1...
你这是违法行为 · 2026-04-29 · via LINUX DO - 最新话题
AI 研究者 Aran Komatsuzaki 把 Rich Sutton 的知名论文「苦涩的教训」(The Bitter Lesson)翻成 9 种语言,喂进 OpenAI、Gemini、Qwen、DeepSeek、Kimi、Claude 6 家模型的分词工具(tokenizer),以英文原文在 OpenAI 分词工具上的 token 数为 1 倍基准,看各语言在各模型上花多少倍。结果:同样的内容用中文问 Claude,token 消耗是基准的 1.65 倍;用 OpenAI 只有 1.15 倍。印地语在 Claude 上更夸张,超过基准 3 倍。6 家横评里 Anthropic 垫底。 翻译会改变文本长度,所以跟英文比的倍数不完全精确。但更有说服力的是同一段中文在不同模型上的表现(仍以同一基准):Kimi 只花 0.81 倍(比英文还少),Qwen 0.85 倍,到 Claude 上变成 1.65 倍。文本完全一样,差距纯粹是分词工具的效率问题。中国模型处理中文比英文还省,说明问题不在中文本身,而在分词工具有没有为该语言做过优化。 对用户来说,token 多了,API 直接变贵,模型回答前等待更久,上下文窗口也更快用完。分词工具的效率取决于训练数据中各语言的占比:英文数据多,英文词被高效压缩;非英文数据少,只能切得很碎。Aran 的结论:谁的市场大,谁就更省 token。 9 个帖子 - 8 位参与者 阅读完整话题