
近日字节跳动旗下AI研发团队Seed正式推出多模态大模型产品SeedRealtime,该产品是业内首款落地的原生音视频全双工大模型,单模型架构即可同步实现视觉感知、语音识别理解、自然语音生成能力,支持边听边说、实时响应的双向交互,端到端交互延迟较传统拼接式多模态方案降低42%,可广泛应用于智能硬件、虚拟人等多个交互场景。

不少用户都有过类似的体验:和智能语音助手对话时必须等它完成整段回复才能发出新指令,一旦中途打断就会出现识别混乱;带有视觉识别功能的智能硬件,往往需要等待数秒才能给出反馈,完全达不到自然交流的流畅度。这些痛点的核心,就在于传统多模态方案的拼接式架构瓶颈。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录