跳到正文
10月4日周日
  1. Hugging Face Blog

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。

9月29日周二
  1. Hugging Face Blog

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实本身为真但被归因到错误来源。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中 ProvenanceGuard 拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。