![]()
官方背景
SeedRealtime 是字节跳动 Seed 团队于 2026 年 8 月 5 日推出的原生音视频全双工大模型,也是走向全模态交互的关键一步。它用统一端到端架构原生融合音频、视频与文本,已在豆包 App 全量上线——用户更新到最新版本后,通过「打电话」功能即可进入视频通话界面,体验实时音视频 AI 交互。
核心能力
① 统一端到端架构原生融合音视频文本,在连续多模态信息流上同步感知、理解、决策与表达;② 全双工实时交互,实现「边看、边听、边说」;③ 音视频联合理解:借视觉消除同音词歧义、识别手势与指代对象、持续跟踪画面变化;④ 主动交互:目标出现时主动提醒用户;⑤ 对话节奏更自然,相比级联系统节奏问题减少约 50%;⑥ 不再依赖外部 VAD 做轮次判断,抗背景噪声误触发。
应用场景
在豆包 App 里可用于多人聚会身份识别与对应发言者、外国游客实时理解中文菜单、博物馆持续观察并主动提醒指定文物、辅助操作咖啡机实时纠错、阅读论文时监测翻页并在指定章节提示。复杂嘈杂环境下能区分用户与旁人对话,避免被无关聊天误触发。
定价与可及性
SeedRealtime 随豆包 App 向用户免费提供,无需单独订阅。它代表豆包从「文本对话工具」向「全能 AI 伴侣」升级的关键一步,未来字节将继续优化端到端时延、主动感知与工具调用能力。
SeedRealtime · SeedRealtime 是字节跳动 Seed 团队于 2026 …
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END
暂无评论内容