Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为 $0.10/$0.50 每百万 token,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测了 Haiku 5.5 的定价、tokenizer 变化与推理档位表现,可据此判断不同用量下的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词最高降价 90%,超过 10 万 token 的提示词价格则是五倍。
推荐理由:Haiku 5.5 的定价与基准数据一并给出,可对照 GPT-6 Luna 与 Sonnet 5.5 判断小模型在智能体任务上的性价比。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。官方称其在编码、智能体工作流和多模态理解上表现突出,在网络安全等企业任务上达到开放模型 SOTA,视觉定位等部分领域甚至超过前沿闭源模型。
推荐理由:Mistral 迄今最大模型以开放权重和自部署切入网络安全等企业场景,可对照其与闭源模型的取舍。
OpenAI 公布内部前沿模型在数学开放问题上的一批研究结果,并在 GitHub 分享研究细节和部分证明的 Lean 形式化资料,供研究社区进一步检查与讨论。
推荐理由:Danbo 编辑部核对官方原文整理
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
推荐理由:Reflection 发布 501B 总参数的开源 MoE Beam,并给出预训练与 RL 训练规模细节,可对照同期开源模型判断其位置。
官方指南面向应用开发者,介绍模型选择、推理强度、提示词与技能、工具协作,以及工作流进入生产环境前的准备。
推荐理由:Danbo 编辑部核对官方原文整理
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,目前仅向政府用户和 Fairwind 计划中的可信网络防御者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测差异,可对照其与 Astra、Opus 5.5 的取舍。
Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步面向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全场景的定位。