跳到正文
10月10日周六
10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。

    推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。

10月1日周四
9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

9月21日周一
  1. Microsoft Research50

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测,在十项挑战性靶标的多步合成路线评测中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    Berkeley AI Research 与 IBM Research 基于 K-Search 演化式内核搜索框架,为 Apple Silicon 的 MLX 构建后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被改写为 MLX 内核。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可看跨平台内核知识迁移的具体做法。

7月26日周日
  1. Berkeley AI Research34

    伯克利提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分(belief grading)作为辅助 RL 任务。在 CollabBench 协作编程任务上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也明显低于全上下文设置。

4月20日周一
  1. Berkeley AI Research32

    GRASP:面向世界模型的更长视野梯度规划方法

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索,并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长视野规划变得可行。该方法针对长视野下梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型中的脆弱梯度问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research30

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化信息量,无需任务专用解码器。该方法在彩色摄影、射电天文、无镜头成像和显微镜四个领域验证,信息估计能预测解码器性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。