跳到正文
今天10月8日周四1 条
9月25日周五
  1. Google DeepMind

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为 Gemini 的实时对话模型加入近实时的视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多模态对话、异步工具调用与 97 种语言适配的具体设计。

9月23日周三
9月16日周三
8月5日周三
  1. 字节 Seed

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,可在连续多模态信息流上实时交互,实现边看、边听、边说。端到端人工评测显示,相比级联模型,其音视频对话节奏问题减少了一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新至最新版本后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方给出音视频全双工的统一架构与端到端评测结果,可了解实时多模态交互的落地形态。

7月20日周一
  1. 字节 Seed

    字节 Seed 发布音频创作模型 Seed Audio 1.0

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端完成影视级音频创作。模型支持一条 prompt 统一编排对白、音效与环境声,时间控制精度达 100ms,单次可生成约 2 分钟音频并继续延长,覆盖 20+ 语种。目前已在火山方舟体验中心上线。

    推荐理由:官方给出统一建模思路与多场景评测数据,可了解音频创作模型从拼接生成到完整声音场景的转变。