首页»资讯

豆包视频通话升级:实现边看边听边说 更像真人聊天了

时间:2026-09-19 21:09:06 浏览:

  今日,豆包宣布视频通话功能重大升级,正式接入原生音视频全双工大模型SeedRealtime,在业界率先实现该技术的大规模落地。

  SeedRealtime原生支持音视频联合理解,可综合声音、画面与时序信息,判断"该听谁说、何时回应、何时沉默",实现边看、边听、边说的自然连续交互。这意味着豆包视频通话能在动态真实场景中保持上下文连贯,不再依赖"一问一答"的割裂模式。

  三项核心突破

  音视频联合理解:深度融合声音、图像与时间轴,既能结合场景消解同音词歧义,也能准确捕捉画面中的时序指代,让"所见、所闻、所说"互为上下文。

  主动交互能力:具备持续环境感知,当画面状态变化或关键目标出现时可主动提醒用户,并能调用工具辅助表达,交互从"被动应答"升级为"主动协作"。

  流畅节奏控制:实时判定用户对话状态,在恰当节点自然接话、停顿或回应,告别机械轮次切换。

  此外,模型具备较强抗干扰能力,可区分用户发言、旁人闲聊与背景噪声,大幅降低误触发概率,使多模态对话更接近真人交流。

  豆包视频通话现在能"边看边听边说",甚至画面一变就主动提醒你,你觉得这种主动交互是贴心助手,还是有点"管太宽"?如果手机摄像头一直开着理解环境,你会担心隐私,还是更在意效率?欢迎在评论区聊聊。

添加微信

长按复制微信号,打开微信添加