Microsoft 研究播客:AI 评测的意外失败能教会我们什么
Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。
Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的定位差异与多项语音基准成绩,可据此判断实时语音智能体的能力边界。
Berkeley AI Research 与 IBM Research 基于 K-Search 演化式内核搜索框架,为 Apple Silicon 的 MLX 构建后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被改写为 MLX 内核。
推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可看跨平台内核知识迁移的具体做法。
伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分(belief grading)作为辅助 RL 任务。在 CollabBench 协作编程任务上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也明显低于全上下文设置。
伯克利人工智能研究实验室(BAIR)展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,未教会模型自适应行为。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索,并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长视野规划变得可行。该方法针对长视野下梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型中的脆弱梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别影响 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。