字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,”话未说完被抢断”等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。
豆包上线原生音视频全双工模型
下一篇:FFmpeg 9.0 正式发布
字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,”话未说完被抢断”等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。
下一篇:FFmpeg 9.0 正式发布