登录体验完整功能(收藏、点赞、评论等) — 已累计有 13568 人加入

英伟达发布Canary-1B-v2语音模型 覆盖多语种识别翻译全链路

详情页推荐

近日,英伟达正式开源轻量化语音大模型Canary-1B-v2,该模型参数规模仅1B,可同时实现多语种自动语音识别(ASR)、实时语音翻译、自动生成带时间戳的SRT字幕三大核心功能,支持长音频处理,开发者可通过Python快速搭建端到端语音处理pipeline,大幅降低多语种语音工具的开发门槛。

配图

6月下旬,英伟达面向全球开发者社区推送了最新开源的Canary-1B-v2模型权重与开发文档,上线仅3天就在GitHub上收获了超过2700个Star,成为当前语音AI领域热度最高的开源项目之一。

近年来,跨境内容创作、跨国远程会议、出海直播等场景快速扩张,多语种语音处理的市场需求持续走高。据行业统计,2025年全球企业级语音转写与翻译服务的市场规模突破210亿美元,同比增速达42%。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。