Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
微软研究院对移动机器人操作负载的系统测量显示,把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统测量,给出端侧、边缘与云端算力取舍的量化依据。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成与重排序融合两者互补优势。
字节 Seed 发布用于衡量真实世界环境学习的超长程评测集 EdgeBench,包含 134 个真实任务,横跨六大能力领域,Agent 在每个任务上可持续工作至少 12 小时。
推荐理由:字节 Seed 开源 EdgeBench 并给出环境学习曲线,读者可了解 Agent 长程学习如何被量化。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
伯克利 AI 研究团队提出一种直接基于信息量评估和优化成像系统的框架,用互信息量化测量对物体的区分能力,并仅从含噪测量与噪声模型估计该指标。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器。