Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。
ServiceNow CoreAI 构建的 AutoSynthData 能把企业智能体的能力短板转化为训练数据:它利用目标模型的失败案例和更强教师的成功轨迹定位待学能力,再生成并校验新任务,课程随模型进步动态调整。该方法在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性和难度三项属性,并通过一致性、可靠性和完备性的验证器筛选。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实本身为真但被归因到错误来源。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中 ProvenanceGuard 拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。