Google Research 三个月实地实验:AI 辅助提升专利撰写产出,但初级律师无辅助判断力未同步提升
Google Research 在 NBER 发布专利撰写三个月实地实验,将 Google Labs 未发布的 AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实地实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了少见的长期证据。
Google Research 在 NBER 发布专利撰写三个月实地实验,将 Google Labs 未发布的 AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实地实验区分了AI带来的即时产出提升与无辅助判断力的变化,为理解AI对专业能力的影响提供了少见的长期证据。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可复用其训练与推理流程。
Google Research 以 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)为概念验证,将自监督预训练的"地点"嵌入向量作为即插即用输入接入现有流行病学流程,无需任务特定微调。
Google Research 与全球卫生伙伴发布新研究论文,展示 Google Earth AI 如何结合环境信号、卫星影像、移动数据和 AlphaEarth Foundations、Population Dynamics Foundation Model(PDFM)等基础模型,并搭配地理空间推理智能体原型,帮助公共卫生团队预测疾病暴发。
推荐理由:Google 与 WHO 等机构用 Earth AI 在刚果(金)埃博拉疫情中实测地理空间推理智能体,展示公共卫生预测从被动响应转向主动预防的路径。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产环境,知识、上下文缺失与遗留数据系统是主要失败点。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,通过远程可验证的 TEE 提供可审计的数据匿名化保证,并已用于 Gboard 的英语和日语下一词预测模型。
ServiceNow CoreAI 构建的 AutoSynthData 能把企业智能体的能力短板转化为训练数据:它利用目标模型的失败案例和更强教师的成功轨迹定位待学能力,再生成并校验新任务,课程随模型进步动态调整。该方法在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性和难度三项属性,并通过一致性、可靠性和完备性的验证器筛选。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合各变电站纬度与地质电导率,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,在数字模型和合成出的实体蛋白质上均可验证,同时保持其生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其原理与生物安全筛查中的定位。
Google Research 发布 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量"转向阻尼器"网络在不改动基座模型权重的前提下调控生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持仅凭最终奖励分数进行微调,可作用于黑盒或灰盒的闭源模型。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成与重排序融合两者互补优势。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在 CollabBench 协作编码任务上,采用基于重构的信念评分后,ABBEL 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 长度也显著低于全上下文设置。
字节 Seed 发布用于衡量真实世界环境学习的超长程评测集 EdgeBench,包含 134 个真实任务,横跨六大能力领域,Agent 在每个任务上可持续工作至少 12 小时。
推荐理由:字节 Seed 开源 EdgeBench 并给出环境学习曲线,读者可了解 Agent 长程学习如何被量化。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
伯克利 AI 研究团队提出一种直接基于信息量评估和优化成像系统的框架,用互信息量化测量对物体的区分能力,并仅从含噪测量与噪声模型估计该指标。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测了解码器性能,优化后的设计达到端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器。