跳到正文
  1. Latent Space

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。

    推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。

  2. Simon Willison

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为 $0.10/$0.50 每百万 token,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。

    推荐理由:作者实测了 Haiku 5.5 的定价、tokenizer 变化与推理档位表现,可据此判断不同用量下的成本取舍。

  1. Hugging Face Blog

    Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。

  1. Latent Space

    Reflection 发布 Beam:501B 总参数 23B 激活的开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。

    推荐理由:Reflection 发布 501B 总参数的开源 MoE Beam,并给出预训练与 RL 训练规模细节,可对照同期开源模型判断其位置。

  1. GitHub Blog · AI & ML

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 审查能力的衡量方式。

  1. Hugging Face Blog

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。

  1. Latent Space

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,目前仅向政府用户和 Fairwind 计划中的可信网络防御者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测差异,可对照其与 Astra、Opus 5.5 的取舍。

  1. Mistral AI

    Mistral 发布 Agentic Search 检索层,FinanceBench 正确率提升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环的五个工具与两组基准数据,可据此判断它相对一次性 RAG 的取舍。

  1. 字节 Seed

    字节 Seed 发布 EdgeBench 评测集,发现环境学习新 Scaling Law

    字节 Seed 发布用于衡量真实世界环境学习的超长程评测集 EdgeBench,包含 134 个真实任务,横跨六大能力领域,Agent 在每个任务上可持续工作至少 12 小时。

    推荐理由:字节 Seed 开源 EdgeBench 并给出环境学习曲线,读者可了解 Agent 长程学习如何被量化。

已经到底了