Microsoft 研究员 Jennifer Neville 谈 AI 评测的意外失败与真实用户需求
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中表示,把模型放到传统 benchmark 之外测试时会出现"意外失败",评测是推动 AI 系统性能边界、贴合用户需求的关键。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中表示,把模型放到传统 benchmark 之外测试时会出现"意外失败",评测是推动 AI 系统性能边界、贴合用户需求的关键。
一位数据挖掘课程教师用 Gemini in Google Colab 充当学生的个人导师,取代传统编程语法测试,学生需自行判断 AI 给出的代码建议并说明最终建模决策的理由。教师通过口头面试让学生为自己的选择辩护、排查问题并指出 AI 建议可能有误之处,同时借助 Gemini Canvas 和 Gemini Notebook 规模化评估这些作业。
一位在加州任教的中学技术教师表示,Gemini 帮助她以极短时间完成备课和差异化教学,备课资料安全保存在 Google Drive 中。她认为,让学生亲眼看到 AI 的实际运作有助于消除对未知的恐惧,但 AI 只是人类设计的映射,真正的力量来自推理、质疑,以及始终把批判性思维放在第一位。
美国佐治亚州八年级物理科学教师 Chanel Johnson 在课堂上用交互式模拟让学生亲手发现科学规律,并借助 Gemini 对照课程标准审查单元教案、构思新教学思路。她还向学生公开示范 Gemini 和 Gemini Notebook 的用法,帮助他们建立真正的数字素养。
一位教师用 Gemini 作为备课搭档,在英语课上快速搭建多站点角色扮演挑战,让学生通过走动解题、在阅读气候变化与人权故事前建立共情;在生活技能课上,Gemini 帮她设计奶昔配方与饮食档案,让学生亲手调配并实践正念营养。她强调 Gemini 并非替代主动教学,而是把运动和更深参与带进课堂的工具。
NVIDIA 提出 AI 工厂投资回报由产出能力、使用寿命和需求三要素决定,其平台以每兆瓦吞吐量、硬件寿命和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体自行合成的数据系统。
一篇综述指出,并行推理正从固定结构走向自适应控制——让模型自行决定何时分解任务、并行多少线程以及如何协调。现有 Self-consistency、Best-of-N、Tree of Thoughts、MCTS 等方法均在模型外部预设并行结构,而 ParaThinker、GroupThink、Hogwild!