惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
Martin Fowler
Martin Fowler
B
Blog RSS Feed
D
DataBreaches.Net
L
LangChain Blog
月光博客
月光博客
S
SegmentFault 最新的问题
阮一峰的网络日志
阮一峰的网络日志
V
Visual Studio Blog
美团技术团队
Jina AI
Jina AI
博客园 - 司徒正美
雷峰网
雷峰网
Last Week in AI
Last Week in AI
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
IT之家
IT之家
博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
小众软件
小众软件
罗磊的独立博客
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
A
About on SuperTechFans
Engineering at Meta
Engineering at Meta

IT之家

消息称大疆 Pocket 4 目标超千万,可能是一英寸 CMOS 出货量最大的单品 OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 - IT之家 鸿蒙智行问界 M6 预订量突破 10 万台,预售 26.98 万元起 今年一季度全国铁路完成固定资产投资 1379 亿元,西十高铁、雄商高铁山东段联调联试 - IT之家 首届北京市中学生人形机器人足球赛今日启动,近 50 支队伍参赛 - IT之家 涉及“赵一鸣是日本品牌”等,抖音处置 1500 余条谣言内容 - IT之家 广汽集团与海尔集团签约,探索“人车家”互联生态 - IT之家 亚马逊调整云游戏平台 Luna 业务模式,取消 Ubisoft+、GOG 等第三方商店 消息称华擎将推出 X870E Taichi White,补全 AMD 800 系白色旗舰主板缺失 长城汽车归元平台首款方盒子全球征名,十二佳提名公布 - IT之家 消息称雷克萨斯新车即将支持苹果数字车钥匙 - IT之家 普京要求俄罗斯加速自研有竞争力的 AI 模型,彻底转向国产技术 - IT之家 影石刘靖康:已开源保真全景无人机仿真平台 AirSim360、DAP 全景度量深度模型等核心成果 - IT之家 长安汽车总经理赵非:当前车企仅靠卖车已难以盈利 - IT之家 地平线创始人余凯:4 月 22 日推出中国第一款舱驾融合智能体芯片“星空” - IT之家 冯兴亚:广汽集团具身智能机器人即将量产,飞行汽车预计今年完成适航认证并量产交付 - IT之家 模块化笔电制造商 Framework CEO 痛批业界追逐“AI 优先”,称个人计算设备可能就此消亡 16 年来首次:小米首届员工运动会今天启幕,雷军压轴致辞 - IT之家 比亚迪廉玉波:新能源汽车产业正进入确定性与不确定性并存的阶段 - IT之家 阿耳忒弥斯 2 号宇航员安全返回地球,有哪些技术和科研收获 - IT之家 曝索尼 Alpha 7R VI 全画幅无反相机将随 100-400mm f/4.0 GM 镜头一同登场,发布会预计在 5 月 小米产教融合最新成绩披露:合作院校超 400 家、成都基地启用 - IT之家 亚马逊 CEO 贾西:自研芯片年化收入预估 500 亿美元,规模超 AMD 与英特尔 马来西亚推动“AI 城市”转型,目标 2030 年成为“AI 国家” Galaxy S24 Ultra 手机用户反馈三星人为设限,无法使用 Galaxy Buds4 Pro 耳机高清语音 广汽集团董事长冯兴亚:当前县级市场新能源汽车渗透率不到 20% - IT之家 消息称《地铁:离去》新作下周公布,有望 State of Play 发布会亮相 广汽新一代智能座舱架构与电子电气架构明日发布,将宣布芯片生态建设的重大突破 - IT之家 苹果预订台积电 6 万片晶圆产能,2027 年全力冲刺 AI 服务器芯片 日本经济产业省向 Rapidus 追加 6315 亿日元支持,加速下一代半导体研发
中国科学家提出“AI 语言”:人类难懂但模型能懂,文本压缩至 2...
作者:问舟 · 2026-06-20 · via IT之家

IT之家 6 月 20 日消息,上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学的研究人员于 6 月 18 日在预印本平台 arXiv 上发表了一项有趣的研究。

正如论文标题《大语言模型并不总是需要可读语言》,他们发现 AI 能够理解人类理解不了的精简语言,所以 AI 提示词中的大部分自然语言都属于浪费 Token 的冗余信息。

他们提出了一种名为“BabelTele”的文本压缩方法,能够生成让人类几乎无法直接阅读的内容,但大语言模型(LLM)却可以准确理解其中的含义。

其研究的核心思想是,当前大语言模型之间的交互普遍采用为人类设计的自然语言,这包含了大量冗余信息。BabelTele 则是一种面向模型而非人类的文本表示方法,它通过融合多语言词汇、数学符号、逻辑运算符甚至表情符号,将原始文本压缩成一种高度密集的“模型语言”。

论文展示了这种方法的强大压缩能力:在实验中,BabelTele 能将文本压缩至原来的 27.9%,同时仍保持高达 99.5% 的语义准确性。

为了验证其有效性,研究团队设计了一系列实验。他们选取了 QuALITY 长文本问答数据集中的样本,分别让人类读者和 AI 模型(Gemini 3.1 Pro)阅读原文和 BabelTele 压缩后的文本并回答问题。

结果显示,人类读者在阅读 BabelTele 文本后,问答准确率显著下降,而 Gemini 3.1 Pro 的准确率则保持稳定。这表明,BabelTele 在牺牲人类可读性的同时,并未丢失模型可恢复的语义信息。

在更广泛的测试中,BabelTele 在多个基准测试中都表现出色。无论是处理会议纪要(MeetingBank)还是长文档问答(QuALITY),BabelTele 在同等压缩率下的准确率都优于传统的自然语言摘要和专门的提示压缩工具(如 LLMLingua-2)。

此外,BabelTele 还被验证可以在不同的大语言模型间“零样本”传递,即由一个模型生成的压缩文本,另一个模型无需额外训练即可理解,堪称 AI 之间的“AI 语言”。不过,研究也指出,其传输效果取决于压缩模型和阅读模型的配对。

在更贴近实际应用的场景中,BabelTele 也展现了相当不凡的潜力。在多智能体通信测试中,它能在减少约 40% 通信 Token 的同时,保持超过 96% 的任务完成度。在智能体记忆任务(LoCoMo 基准测试)中,BabelTele 的记忆保留效果也优于普通的摘要方法。

这项研究为 AI 行业提供了一个新的视角:在 AI Agent 和长文本处理等场景中,为大语言模型设计的“AI 语言”或许是提升效率的一种有效途径。虽然目前 BabelTele 更多是一个探索性的概念验证,但它打开了一扇通往“模型原生语言”的大门。

IT之家附论文地址:
https://doi.org/10.48550/arXiv.2606.19857

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。