ElevenReader 登陆巴西:Fábio Porchat 配音,7 万本巴西葡萄牙语有声书上线
ElevenLabs 的消费级音频平台 ElevenReader 正式登陆巴西,并与 Bookwire Brasil 合作引入 7 万本获得授权的巴西葡萄牙语图书,其中多数此前从未有过有声版本。
ElevenLabs 的消费级音频平台 ElevenReader 正式登陆巴西,并与 Bookwire Brasil 合作引入 7 万本获得授权的巴西葡萄牙语图书,其中多数此前从未有过有声版本。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。
ElevenLabs 发布联系中心自动化指南,介绍 AI 智能体如何以极少人工干预处理客服流程。文中援引三个 ElevenAgents 部署案例:Klarna 为 3500 万美国用户实现最高 10 倍更快解决,Rohlik 自动处理 90% 客户沟通,Getmobil 实现 75% 首次联系解决率和 60% 成本下降。
用于配音与声音创作;选择声音后,还需要导演说明与剪辑时间线中的听回判断。
把对白、环境、动作音效和音乐分别安排,让 AI 声音素材服务于画面与叙事。
Higgsfield 提供了一套从选题到发布的 AI 无露脸 YouTube 频道工作流:Supercomputer 规划频道定位并起草脚本,Cinema Studio 4.0。
Google 官方介绍,创作者可用自然语言在 Flow Music 的 Spaces 中制作乐器或效果工具,并导出为 VST3 / AU 插件,在熟悉的数字音频工作站中使用。具体可用条件请查看原文与产品说明。
AWS 展示了一套基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 的航空公司语音旅行助手方案,用户可通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
ElevenLabs 发布对话智能企业指南,介绍其通过 Scribe v2 和 Scribe v2 Realtime 实现通话录音转写与 AI 分析,支持 SOC 2、HIPAA、GDPR 及欧盟数据驻留。
ElevenLabs 发布 ElevenAgents Architect,一个内置专家,团队通过语音或文字对话即可创建和改进 ElevenAgents 智能体。
推荐理由:ElevenLabs 官方说明新智能体如何用对话方式分析通话记录并生成改动草案,可了解语音 Agent 的运维方式。
ElevenLabs 的 Scribe 采用原生词级转写模型,单次 API 调用即可输出带时间戳的结构化 token 数组,每个 token 标记为 word、spacing 或 audio_event 三类,可识别笑声、掌声等非语音事件。
官方指南介绍了 [pause]、[long pause] 和标点三种节奏控制方式。Eleven v4 使用 Audio Tags,而不支持旧式 SSML 停顿标签;停顿长度随语境变化,不能当作固定秒数的剪辑指令。
ElevenLabs 的 ElevenAgents 已在 Banner Health 部署,用于患者来电接诊,首批上线基层医疗预约场景。该智能体可 7×24 小时接听来电、直接在 Banner 电子病历中预约改约和取消,并在需要时带通话上下文转接人工。系统运行于 Banner 的 AI 治理框架内,具备企业级安全和 HIPAA 合规。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为 Gemini 的实时对话模型加入近实时的视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多模态对话、异步工具调用与 97 种语言适配的具体设计。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定预设变成可逐句导演的创作流程,并给出基准排名与开放入口。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:两款语音模型给出基准成绩与开放入口,可据此判断实时语音智能体的能力边界。
字节 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,可在连续多模态信息流上实时交互,实现边看、边听、边说。端到端人工评测显示,相比级联模型,其音视频对话节奏问题减少了一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新至最新版本后在对话框选择打电话进入视频通话即可体验。
推荐理由:官方给出音视频全双工的统一架构与端到端评测结果,可了解实时多模态交互的落地形态。
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端完成影视级音频创作。模型支持一条 prompt 统一编排对白、音效与环境声,时间控制精度达 100ms,单次可生成约 2 分钟音频并继续延长,覆盖 20+ 语种。目前已在火山方舟体验中心上线。
推荐理由:官方给出统一建模思路与多场景评测数据,可了解音频创作模型从拼接生成到完整声音场景的转变。