豆包上线原生音视频全双工模型

字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,”话未说完被抢断”等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。

上一篇:

下一篇:

发表回复

登录后才能评论
分享本页
返回顶部
🍁
🔈Hi,朋友。欢迎来到 木木的博客小站