StableLearn Logo

搜索内容

News 9 min read

腾讯开源 440MB 端侧翻译模型:1.25bit 量化,33 语言,质量超越 72B 大模型

腾讯开源 Hy-MT1.5-1.8B-1.25bit 端侧翻译模型,仅 440MB 支持 33 种语言 1056 个翻译方向。采用 Sherry 1.25bit 量化技术,压缩率达 87%,翻译质量超越 72B 大模型

Cover image for 腾讯开源 440MB 端侧翻译模型:1.25bit 量化,33 语言,质量超越 72B 大模型

本文发布于 143 天前,内容可能已过时,请注意甄别。

2026 年 4 月 29 日,腾讯混元团队通过 AngelSlim 开源了 Hy-MT1.5-1.8B-1.25bit 端侧翻译模型。

核心数据:模型大小仅 440MB(压缩率 87%),原生支持 33 种语言1,056 个翻译方向,翻译质量全面超越 Tower-Plus-72B、Qwen3-32B 等大参数模型,以及微软翻译、豆包翻译等主流商业 API。

技术突破:采用 Sherry 1.25bit 量化技术(ACL 2026 录用论文),通过 3:4 细粒度稀疏化策略,将原本 3.3GB 的 FP16 模型压缩到 440MB,精度损失极小。配合定制的 STQ 移动端 CPU 内核,普通手机即可流畅运行高质量离线翻译。

模型版本:两种量化方案

Hy-MT1.5-1.8B 提供两种量化版本:

版本模型大小量化位数压缩率适用场景
Hy-MT1.5-1.8B-1.25bit440MB1.25bit87%内存受限设备,追求极致体积
Hy-MT1.5-1.8B-2bit574MB2bit83%平衡性能和体积

两个版本都支持完整的 33 种语言和 1,056 个翻译方向,都提供权重文件和 GGUF 格式。

核心特性

1. 世界级翻译质量

Hy-MT1.5-1.8B-1.25bit 基于腾讯混元团队开发的 Hy-MT1.5-1.8B 基座模型

训练流程

  • MT 导向的预训练
  • 监督微调(SFT)
  • 在线策略蒸馏
  • 强化学习(RL)

语言覆盖

  • 原生支持 33 种语言
  • 支持 5 种方言/少数民族语言
  • 覆盖 1,056 个翻译方向

性能对比

对比维度Hy-MT1.5-1.8B (1.8B)Tower-Plus (72B)Qwen3 (32B)
参数规模1.8B72B32B
翻译质量✅ 全面超越❌ 落后❌ 落后
模型大小(1.25bit)440MB--

仅 1.8B 参数,全面超越 72B 和 32B 的大参数模型,同时超越微软翻译、豆包翻译等主流商业 API。

2. Sherry:极致 1.25bit 量化技术

最让人眼前一亮的是 Sherry 量化框架(ACL 2026 录用论文)。

核心创新:3:4 细粒度稀疏化

Sherry 引入了一种硬件高效的三值量化策略:

  • 每 4 个模型权重中,保留 3 个最重要的权重,用 1-bit 存储(1)
  • 剩余 1 个权重置零
  • 4 个权重仅需 5 bits 存储
  • 实现有效 1.25-bit 位宽,且符合 2 的幂次对齐

压缩效果

  • 原始 FP16 模型:3.3GB
  • 1.25bit 量化后:440MB
  • 压缩率:87%
  • 精度损失:极小

技术优势

技术指标Sherry 1.25bit传统量化
位宽1.25bit通常 4-8bit
压缩率87%50-75%
硬件对齐✅ 2 的幂次对齐❌ 可能不对齐
SIMD 优化✅ 完美对齐❌ 效率较低
精度损失极小中等

3. 端侧部署:普通手机即可运行

配合定制的 STQ 内核(专为移动端 CPU 设计),1.25bit 模型实现了完美的 SIMD 指令集对齐。

部署优势

  • 普通手机(内存受限)即可流畅运行
  • 无需联网,数据不离开设备
  • 高质量离线翻译
  • 一次下载,永久使用

速度对比

在骁龙 888、8GB RAM 设备上测试:

  • FP16 模型:基准速度
  • 1.25bit 模型:8 倍加速

翻译性能:Flores-200 基准测试

在 Flores-200 中外互译基准测试中,Hy-MT1.5-1.8B 展现出卓越的性能:

不同模型规模性能对比

模型参数规模翻译质量(BLEU)模型大小(1.25bit)
Hy-MT1.5-1.8B1.8B✅ 最高440MB
Tower-Plus72B❌ 较低-
Qwen332B❌ 较低-

数据不会骗人:1.8B 参数的 Hy-MT1.5 在翻译质量上全面超越 72B 和 32B 的大参数模型。

Android Demo:即开即用的离线翻译

腾讯混元团队提供了一个即开即用的 Android Demo,展示端侧翻译的实际效果。

核心功能

1. 离线翻译

  • 支持 33 种语言互译
  • 无需联网
  • 数据不上传
  • 一次下载永久使用

2. 后台取词模式(亮点功能)

跨应用取词翻译

  • 浏览邮件、网页、聊天消息时
  • 无需切换应用
  • 即时获取翻译
  • 完全离线运行

使用场景

  • 阅读外文邮件
  • 浏览外文网页
  • 查看外文聊天消息
  • 学习外语内容

测试设备

  • 翻译 Demo:骁龙 865、8GB RAM
  • 后台取词 Demo:骁龙 7+ Gen 2、16GB RAM

下载链接

模型权重

版本权重文件GGUF 格式
1.25bitModelScopeGGUF
2bitModelScopeGGUF

Android Demo

下载地址https://modelscope.cn/models/AngelSlim/Hy-MT1.5-1.8B-1.25bit-GGUF/resolve/master/Hy-MT-demo.apk

技术报告

报告链接
HY-MT1.5 技术报告https://arxiv.org/abs/2512.24092
Sherry 论文(ACL 2026)https://arxiv.org/abs/2601.07892
AngelSlim 技术报告https://arxiv.org/abs/2602.21233

AngelSlim:腾讯自研的大模型压缩工具包

Hy-MT1.5-1.8B-1.25bit 是 AngelSlim 工具包的成果之一。

AngelSlim 简介

  • 腾讯自研的大语言模型压缩工具包
  • 致力于打造更易用、更全面、更高效的压缩方案

开源算法

  • 量化(Quantization)
  • 投机采样(Speculative Sampling)
  • 稀疏化(Sparsification)
  • 蒸馏(Distillation)

覆盖范围

  • 主流最前沿的大模型
  • 端到端打通从压缩到部署的全流程

GitHub 地址https://github.com/Tencent/AngelSlim

技术突破的意义

1. 端侧 AI 的新标杆

Hy-MT1.5-1.8B-1.25bit 证明了:

  • 端侧模型可以达到世界级质量
  • 极致压缩不等于性能妥协
  • 440MB 可以支持 33 种语言和 1,056 个翻译方向

2. 量化技术的新突破

Sherry 1.25bit 量化技术:

  • 突破了传统量化的位宽限制
  • 实现了硬件高效的三值量化
  • 87% 的压缩率 + 极小的精度损失

3. 隐私保护的新方案

完全离线运行:

  • 数据不上传
  • 不依赖网络
  • 隐私完全保护

应用场景

应用场景核心能力实际价值
离线翻译33 语言互译无网络环境下的翻译需求
跨应用取词后台取词翻译阅读外文内容时即时翻译
隐私翻译完全离线敏感内容翻译,数据不泄露
学习辅助高质量翻译外语学习、文献阅读
商务沟通多语言支持跨国商务沟通、邮件翻译

写在最后

Hy-MT1.5-1.8B-1.25bit 的发布,标志着端侧 AI 进入了新阶段。

不再是「能在手机上跑」就叫端侧模型,而是要做到:440MB 体积 + 33 种语言 + 世界级翻译质量 + 完全离线运行

更重要的是,腾讯混元团队不仅开源了模型权重,还提供了:

  • 完整的技术报告(HY-MT1.5、Sherry、AngelSlim)
  • 即开即用的 Android Demo
  • GGUF 格式支持
  • 开源的压缩工具包(AngelSlim)

从技术创新来看,Sherry 1.25bit 量化技术(ACL 2026 录用)实现了:

  • 3:4 细粒度稀疏化
  • 硬件高效的三值量化
  • 87% 压缩率 + 极小精度损失
  • 完美的 SIMD 指令集对齐

从实际应用来看,1.8B 参数的模型在翻译质量上全面超越 72B 和 32B 的大参数模型,证明了「小而精」的技术路线完全可行。

端侧 AI 的未来,可能比我们想象的来得更快。

分享文章

更多文章