Google Flow
Google 的 AI 影像创作入口;使用前核查所在地区、套餐与当前模型的可用性。
Google 的 AI 影像创作入口;使用前核查所在地区、套餐与当前模型的可用性。
面向创意生产的 AI 工具入口,可结合已有 Adobe 制作流程评估使用。
连接生成素材与后期制作,适合从官方模型说明和流程示例出发评估。
面向视频与音画创作的工具方向;从官方说明了解参考、生成与编辑入口。
从官方示例中观察白模参考、角色素材和镜头调度如何组织,再建立自己的验证标准。
从 Runway 官方客户案例观察:同一创意如何做成多个风格版本,并在真实投放中比较结果。
Higgsfield 在 Ads Studio 上线 Ad Multiplier,可基于一条参考广告替换角色、产品、服装或场景,同时保留原视频的运动、构图、剪辑与节奏,并支持逐版本修改 hook、脚本和 CTA。
Higgsfield 提供了一套从选题到发布的 AI 无露脸 YouTube 频道工作流:Supercomputer 规划频道定位并起草脚本,Cinema Studio 4.0。
Google Research 发布 AI video co-director 等多智能体框架,将长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,读者可了解多镜头一致性问题的具体解法与评测基准。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为 Gemini 的实时对话模型加入近实时的视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多模态对话、异步工具调用与 97 种语言适配的具体设计。
字节 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,可在连续多模态信息流上实时交互,实现边看、边听、边说。端到端人工评测显示,相比级联模型,其音视频对话节奏问题减少了一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新至最新版本后在对话框选择打电话进入视频通话即可体验。
推荐理由:官方给出音视频全双工的统一架构与端到端评测结果,可了解实时多模态交互的落地形态。
字节 Seed 官方发布 Seedance 2.5,介绍视频延长、多种参考输入、按时间描述镜头与编辑等能力,并展示空间参考示例。厂商演示需结合自己的镜头任务验证,完整说明与作品见原文。