跳到正文
  1. Microsoft Research

    微软开源 Agent Lightning v1.0:3500 行轻量级 Agentic RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级 Agentic RL 框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与强化学习,无需在训练框架内重新实现 agent。

    推荐理由:Agent Lightning v1.0 用约 3500 行代码实现完整 agent RL 控制面,并给出 SWE-bench Verified 上的训练增益数据。

  2. GitHub Blog · AI & ML

    GitHub 推出基于 ModernBERT 的密钥检测模型,将 push 保护扩展到非结构化密钥

    GitHub 发布与 Microsoft Applied Sciences 联合构建的 ModernBERT 分类器,用代码上下文识别非结构化密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测搬进 push 环节的模型方案。

  3. NVIDIA Blog

    NVIDIA 与 Microsoft 发布 RTX Spark 与 Windows 智能体基础设施

    NVIDIA 与 Microsoft 在旧金山 Windows AI 活动上宣布为 AI 智能体共同设计 Windows PC 的软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级基础设施和本地算力硬件一并给出,读者可据此判断 Windows PC 上跑本地智能体的门槛变化。

  1. GitHub Blog · AI & ML

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解 AI 审查能力的衡量方式。

  1. Hugging Face Blog

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。

  1. Microsoft Research

    微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载的系统测量显示,把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软对移动操作机器人推理负载的系统测量,给出端侧、边缘与云端算力取舍的量化依据。

已经到底了