

























Hy-MT1.5-1.8B-2bit 是腾讯混元团队发布的最新开源翻译模型,代表了端侧 AI 的重大突破。这个仅 1.8B 参数的模型,翻译质量却能媲美甚至超越参数规模 30-40 倍的大型模型——而且全部在手机上本地运行,无需联网。
模型基于 Hy-MT1.5-1.8B 基座模型构建,采用全链路多阶段训练流水线:
最终,1.8B 参数的模型原生支持 33 种语言、5 种方言/少数民族语言、1056 个翻译方向。
"2bit"指的是权重量化格式。原始 3.3GB FP16 模型压缩至仅 574MB,体积缩小 82%。更激进的 1.25-bit 版本(Hy-MT1.5-1.8B-1.25bit)更是只有 440MB。
提示:如果需要 llama.cpp 等框架使用的 GGUF 格式,可以在 Hugging Face 下载 AngelSlim GGUF 版。
Hy-MT1.5-1.8B-2bit 高效压缩的秘密是腾讯自研的 SEQ(Stretched Elastic Quantization,弹性延伸量化)算法,发表于 AngelSlim 技术报告(arXiv:2602.21233)。
传统 2-bit 量化通常使用对称量化网格如 {-1, 0, 1}(三值)或 {-1, 1}(二值),问题在于这些粗糙的网格对离群权重(outlier weights)的处理能力很差,会造成严重的信息损失。
SEQ 的创新在于将量化网格弹性延伸为 {-1.5, -0.5, 0.5, 1.5}——非对称、非均匀的排列,更贴合 Transformer 权重实际统计分布:
结果是:一个看起来不像 2-bit 的 2-bit 模型。在 Flores-200 中西互译 benchmark 上,Hy-MT1.5-1.8B-2bit 与 3.3GB FP16 基座模型差距极小,体积却缩小了 82%。
| 属性 | FP16 全精度 | 2-bit 版本 | 1.25-bit 版本 |
|---|---|---|---|
| 模型大小 | 3.3GB | 574MB | 440MB |
| 压缩倍率 | 1x | 约 5.7x | 约 7.5x |
| 量化网格 | N/A | {-1.5, -0.5, 0.5, 1.5} | {-1.25, -0.25, 0.25, 1.25} |
| 质量保留率 | 100% | 约 97%+ | 约 95%+ |
这是 Hy-MT1.5-1.8B-2bit 最令人印象深刻的地方——区区 574MB 的模型,全面超越:
在业界标准 Flores-200 多语言翻译质量评估 benchmark 上,Hy-MT1.5-1.8B-2bit 在中西翻译方向上名列前茅,尤其擅长:
这说明一个道理:专用翻译模型 + 恰当量化 >>> 通用大模型暴力 scaling。
Hy-MT1.5-1.8B-2bit 的一大亮点是可以在移动设备上完全离线运行,针对以下平台优化:
翻译在本地执行,数据永远不会离开你的手机。这与云端翻译 API 有本质区别:
任何场景——浏览外文网页、与外国朋友聊天、阅读外语文档——全部零网络延迟、完全隐私。
腾讯提供了开箱即用的 Android APK 演示,展示两大功能:
APK 一次性下载,永久离线使用,无需注册、无数据收集。
腾讯 benchmarks 显示,在支持 SME2(Scalable Matrix Extension 2)的硬件上,2-bit 模型推理速度极快。原因在于:
在 SME2 内核上,2-bit 模型在移动级硬件上达到实时翻译速度。标准 ARMv8 Neon 内核虽然稍慢,但非实时场景完全可用。
| 版本 | 格式 | 大小 | 下载链接 |
|---|---|---|---|
| Hy-MT1.5-1.8B-2bit | Safetensors | 574MB | 模型 |
| Hy-MT1.5-1.8B-2bit | GGUF | ~574MB | GGUF |
| Hy-MT1.5-1.8B-1.25bit | Safetensors | 440MB | 模型 |
| Hy-MT1.5-1.8B-1.25bit | GGUF | ~440MB | GGUF |
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
model_name = "AngelSlim/Hy-MT1.5-1.8B-2bit"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
# 英译中
inputs = tokenizer("The weather is great today.", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Hy-MT1.5-1.8B-2bit 基于腾讯的 AngelSlim 模型压缩工具包开发,该工具包支持从小型 1B 模型到超大规模 100B+ VLM 和音频模型的全面压缩。
AngelSlim 由腾讯混元 AI 基础设施团队持续维护,定期发布新功能。
| 模型 | 参数量 | 大小 | 语言数 | 部署方式 | 商业 API |
|---|---|---|---|---|---|
| Hy-MT1.5-1.8B-2bit | 1.8B | 574MB | 33 + 5 方言 | 端侧(手机) | 否 |
| Tower-Plus-72B | 72B | ~144GB | 200+ | 仅云端 | 是(付费) |
| Qwen3-32B | 32B | ~64GB | 100+ | 云端/GPU | API |
| Google 翻译 API | N/A | N/A | 130+ | 云端 | 是(付费) |
结论:Hy-MT1.5-1.8B-2bit 是唯一能在端侧、隐私保护、零成本条件下提供有竞争力翻译质量的方案。
A:每个模型权重(通常以 16 或 32 位浮点数存储)被压缩到仅 2 位。权重只能取 4 个值:-1.5、-0.5、0.5 或 1.5。这带来了 82% 的文件体积缩减。
A:基于腾讯在 Flores-200 数据集上的 benchmark,质量损失极小——标准翻译指标(BLEU、COMET)通常不超过 3%。多数语言对在人工评估中与 FP16 基座模型无统计显著差异。
A:目前腾讯的优化二进制文件针对 ARM SME2 的 Android 设备和 Apple M 系列芯片(Mac/iPad)。iPhone 部署需要 Core ML 转换等优化,暂未官方提供。GGUF 格式可通过 llama.cpp 在 Apple Silicon Mac 上运行。
A:33 种主要语言,包括英语、中文(简体/繁体)、西班牙语、法语、德语、日语、韩语、阿拉伯语、俄语、葡萄牙语、意大利语、荷兰语、波兰语、越南语、泰语、印尼语等,外加 5 种方言/少数民族语言变体和 1056 个语言方向。
A:是的。模型权重和 AngelSlim 工具包均为开源,基于 AngelSlim License 发布。Safetensors 和 GGUF 格式均可在 Hugging Face 免费获取。
Hy-MT1.5-1.8B-2bit 代表了机器翻译的新范式:领域专用训练 + 激进量化 + 端侧优先部署,全部整合在一个开源项目中。腾讯的 AngelSlim 工具包证明,极端量化(2-bit、1.25-bit)不必然导致灾难性的质量损失。
对于开发翻译应用、嵌入式系统、隐私敏感工具、离线移动体验的开发者,Hy-MT1.5-1.8B-2bit 值得认真考虑:
这是 LLM 压缩领域目前最实用、最落地的成果之一。
相关链接: - 模型:https://huggingface.co/tencent/Hy-MT1.5-1.8B-2bit - AngelSlim:https://github.com/Tencent/AngelSlim - Android 演示 APK:https://huggingface.co/AngelSlim/Hy-MT1.5-1.8B-1.25bit-GGUF/resolve/main/Hy-MT-demo.apk - AngelSlim 技术报告(arXiv:2602.21233):https://arxiv.org/abs/2602.21233 - HY-MT1.5 技术报告(arXiv:2512.24092):https://arxiv.org/abs/2512.24092
原文发表于 CurateClick | Dev.to | Zenn.dev
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。