跳到正文
10月7日周三
10月6日周二
  1. AWS Machine Learning Blog

    GLM 5.3 上线 Amazon Bedrock

    Z.ai 的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。

10月4日周日
  1. Hugging Face Blog

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话检查智能体留下的后端终态和副作用,而非其生成的回答,并让每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务是否真正完成。

10月2日周五
  1. Hugging Face Blog

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 能把企业智能体的能力短板转化为训练数据:它利用目标模型的失败案例和更强教师的成功轨迹定位待学能力,再生成并校验新任务,课程随模型进步动态调整。该方法在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性和难度三项属性,并通过一致性、可靠性和完备性的验证器筛选。

9月30日周三
9月29日周二
  1. Hugging Face Blog

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实本身为真但被归因到错误来源。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中 ProvenanceGuard 拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。

9月28日周一
  1. Hugging Face Blog

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两个版本,并同步更新 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 任意接口操作软件,在 OSWorld 2.0 上 27B 得分 61.7%、35B-A3B 得分 30.9%,官方称以远少于前沿闭源模型的参数量和更低成本接近其表现。

    推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的多接口路线。