跳到正文
  1. GitHub Blog · AI & ML

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 审查能力的衡量方式。

  1. Hugging Face Blog

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。

  1. Microsoft Research

    微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载的系统测量显示,把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软对移动操作机器人推理负载的系统测量,给出端侧、边缘与云端算力取舍的量化依据。

已经到底了