跳到正文
  1. The Decoder

    OpenAI 发布 GPT-6,ChatGPT 输出改为图表、按钮与迷你应用的交互界面

    OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,回答不再以纯文本呈现,而是根据问题自动生成图形、按钮、图表和表单等交互界面,比较类问题并排展示,解释类内容可转为交互图表,用户还能在对话内直接构建储蓄计算器或游戏等小工具。

    推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为可交互界面,并给出分版本与分阶段开放安排,可据此判断使用方式的变化。

  1. Google

    Google 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的 740M 参数多模态嵌入模型,可将文本、图像、音频和视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把多模态嵌入压到 740M 参数并给出端侧内存占用,可据此判断本地检索与 RAG 的可行边界。

  1. Latent Space

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,目前仅向政府用户和 Fairwind 计划中的可信网络防御者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测差异,可对照其与 Astra、Opus 5.5 的取舍。

  2. Google DeepMind

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步面向开发者、企业和消费者推出。

    推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全场景的定位。

  1. Google DeepMind

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为 Gemini 的实时对话模型加入近实时的视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多模态对话、异步工具调用与 97 种语言适配的具体设计。

  1. Google DeepMind

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定预设变成可逐句导演的创作流程,并给出基准排名与开放入口。

  1. Google DeepMind

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。

    推荐理由:两款语音模型给出基准成绩与开放入口,可据此判断实时语音智能体的能力边界。

已经到底了