
近日,英伟达正式开源轻量化语音大模型Canary-1B-v2,该模型参数规模仅1B,可同时实现多语种自动语音识别(ASR)、实时语音翻译、自动生成带时间戳的SRT字幕三大核心功能,支持长音频处理,开发者可通过Python快速搭建端到端语音处理pipeline,大幅降低多语种语音工具的开发门槛。

6月下旬,英伟达面向全球开发者社区推送了最新开源的Canary-1B-v2模型权重与开发文档,上线仅3天就在GitHub上收获了超过2700个Star,成为当前语音AI领域热度最高的开源项目之一。
近年来,跨境内容创作、跨国远程会议、出海直播等场景快速扩张,多语种语音处理的市场需求持续走高。据行业统计,2025年全球企业级语音转写与翻译服务的市场规模突破210亿美元,同比增速达42%。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录