惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
P
Proofpoint News Feed
D
DataBreaches.Net
D
Docker
云风的 BLOG
云风的 BLOG
大猫的无限游戏
大猫的无限游戏
月光博客
月光博客
J
Java Code Geeks
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
Martin Fowler
Martin Fowler
U
Unit 42
Engineering at Meta
Engineering at Meta
IT之家
IT之家
Vercel News
Vercel News
B
Blog RSS Feed
人人都是产品经理
人人都是产品经理
博客园 - Franky
博客园 - 【当耐特】
Stack Overflow Blog
Stack Overflow Blog
G
Google Developers Blog
MongoDB | Blog
MongoDB | Blog

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
拆解有道“子曰4”全量开源:如何通过重构思维链打下落地成本?...
2026-05-20 · via 雷峰网

近日,网易有道宣布“子曰”大模型迎来 4.0 版本的全方位升级。“子曰4" 正式迈入全模态时代,不仅全面支持文本、图片、音频的融合交互,有道更宣布将核心的“多模态模型”与“语音合成(TTS)模型”正式开源。与此同时,翻译模型也迎来了深度的技术重构,翻译质量与效率实现双重提升。多模态模型视觉与数理斩获SOTA,纯文本数理难题性能行业领先据介绍,开源的“子曰4”多模态模型在 27B 参数规模上,面向教育场景,将支持视觉输入的数理能力拉到了行业顶尖水平(SOTA)。在同等参数规模的模型中,“子曰4”在处理带图表的数学题、物理题等高难度视觉数理问题上表现惊艳。中文纯文本数理难题的性能也获得显著提升,模型准确率达81.4%,达到行业领先水平。

拆解有道“子曰4”全量开源:如何通过重构思维链打下落地成本?

子曰4在多个视觉数理基准上达到同规模模型中最佳水平  

图片来源: https://huggingface.co/netease-youdao/Confucius4

更为关键的突破在于实际落地的“性价比”。相关负责人介绍,新模型采用了精细化思维链重构方案,通过汇聚大规模优质精简的推理样本进行深度优化,成功将推理思维链输出长度压缩了43.2%。这意味着它可以用更少的 Token、更短的推理路径更快地给出答案,为企业和开发者大幅降低了实际业务场景中的推理成本。

拆解有道“子曰4”全量开源:如何通过重构思维链打下落地成本?

子曰4在多个视觉数理基准上大幅降低了输出token的数量  

图片来源: https://huggingface.co/netease-youdao/Confucius4

此外,子曰研发团队针对国内学生真实的作业p、考试和提问场景进行了深度优化,让它能够真正解决中国学生在实际学习中遇到的真实问题,成为更有温度的数字化助手成为更有温度的数字化助手。

开源TTS:支持14 种语言,3秒克隆原声,跨语种不再有口音

此次与多模态模型一同开源的还有语音合成(TTS)引擎 ,该引擎基于前沿的“语音编码器 + LLM”架构打造,面向开发者及内容创作者提供零样本、低门槛的语音克隆与情感合成能力。

目前,它已全面支持中文、英语、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语及越南语共 14 种语言。

系统可支持不同语言间同一说话者音色的自然迁移,无需额外训练即可保持音色一致性,且合成结果具备母语级别的自然度与流畅度,跨语种克隆也没有口音泄露问题。

在声音克隆方面,子曰4实现了“上传即可克隆”的全量支持能力,用户仅需提供任意音频素材,系统即可在三秒内完成原声复制。

据介绍,该引擎在克隆任务中的准确度超过 97%,克隆音色与原声的相似度达 85% 以上。在保留说话人独特音色的同时,还可精准还原其情感色彩,综合能力达到该领域第一梯队。此外,该开源模型在真实多语言场景中展现出较好的稳健性,可应对日常对话、新闻播报、企业宣传等不同语境及复杂情感表达等多种合成需求。

翻译模型质量全面升级,推理速度提升80%

作为有道最为深厚的技术资产,翻译模型在本次升级中也迎来了重要的技术升级,使其在翻译任务中表现进一步提升。

在数据层面,子曰团队收集并清洗了上亿级别的多语言数据,并聘请具有专八认证的专业人员进行多维度人工评估,从源头保证语料的高品质。

在算法层面,模型采用了创新的“多专家 OPD ”模式,用一种更聪明的“软方式”博采众长,同时通过强化学习引入格式奖励和语言检测机制,有效解决了机翻常见的脱靶和语种混出问题。

为了应对高频、高并发的产业级应用,升级后的翻译模型配备了高效的加速机制,使得整体推理速度直接飙升80%。配合大模型自动评测与人工随机抽检相结合的定制化方案,新一代翻译模型在文本、图片和文档翻译等多场景下,都展现出了兼具速度与质量的极高水准。

回望有道在AI领域的探索历程,从最初子曰以首个教育垂直大模型姿态亮相、推出颠覆传统口语练习模式的“虚拟人口语教练Hi Echo”,到“子曰”2.0、3.0版本在软硬件生态中的全面扎根,有道始终走在 AI 赋能场景的最前沿。2026年,有道更是按下了应用落地的加

速键,陆续发布了LobsterAI、有道宝库、有道同传Agent、Thinkflow等一系列AI Agent产品,实现了全场景 AI Agent 矩阵的前瞻性布局。“子曰4” 的升级与核心模型全量开源,不仅大幅降低了开发者在多模态与语音合成领域的应用门槛,也向行业展示了以底层核心技术滋养上层 Agent 矩阵的生态闭环。有道希望,随着全球开发者与开源社区的共同注入,这一套全模态大模型生态将在更广泛的产业中激发出真正的生产力变革。(雷峰网雷峰网(公众号:雷峰网)雷峰网)

雷峰网原创文章,未经授权禁止转载。详情见转载须知