Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
Z.ai 的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,已作为 Asta 的 Fast 模式上线,并同步开放权重和训练数据。
推荐理由:原文公开了 AstaBrief 的训练数据构造与引用过滤细节,可供做科学报告生成的团队参考。
H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两个版本,并同步更新 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 任意接口操作软件,在 OSWorld 2.0 上 27B 得分 61.7%、35B-A3B 得分 30.9%,官方称以远少于前沿闭源模型的参数量和更低成本接近其表现。
推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的多接口路线。