GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 审查能力的衡量方式。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 审查能力的衡量方式。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合各变电站纬度与地质电导率,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院对移动机器人操作负载的系统测量显示,把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统测量,给出端侧、边缘与云端算力取舍的量化依据。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成与重排序融合两者互补优势。