腾讯混元端侧翻译模型压缩至440MB 已落地B站实时翻译场景

腾讯混元团队近日发布端侧翻译模型技术突破,依托自研拉伸弹性量化(SEQ)技术将1.8B参数的Hy-MT2-1.8B翻译模型从3.3GB压缩至440MB,翻译质量几乎无损,支持33语种互译,同等尺寸下在FLORES-200评测中优于主流商业翻译API,目前该模型已落地B站直播弹幕实时翻译场景,可支撑高并发业务需求。

配图

经常看海外主播直播的用户大概率遇到过类似的尴尬:主播刚说完一个梗,弹幕的翻译要滞后两三秒才出现,遇上热门赛事弹幕大爆发时,甚至会出现翻译卡顿、丢包的问题,这背后恰恰是端侧AI翻译的落地难点。

作为腾讯混元翻译模型族的核心端侧产品,Hy-MT2-1.8B原生支持33个语种互译,在FLORES-200通用翻译评测中的表现已经超过了多款市面上的主流商业翻译API,本身的技术性能已达到商用标准。

但该模型在传统FP16精度下需要占用3.3GB内存,即便采用行业通用的4-bit量化方案,体积仍然超过1GB。而端侧设备运行直播类应用时,需要预留大量内存给视频解码、弹幕渲染、交互响应等任务,能分给AI翻译的内存空间通常不足500MB,这也导致这款性能优异的模型此前一直无法落地到真实业务场景。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。