跳到正文
10月8日周四
  1. Latent Space80

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 相同,官方称其平均运行成本比 Haiku 4.5 低约 75%。

    推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断低价小模型在智能体工作流中的实际成本。

  2. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的位置。

  3. NVIDIA Blog78

    NVIDIA 与 Microsoft 发布 RTX Spark 及面向 Windows 智能体的 MXC

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体工作流的落地条件。

  4. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。

  5. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一 agent harness 直接参与 RL,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出约 3500 行代码的智能体 RL 框架与真实 harness 训练路径,可据此判断训练与部署一致性的实现方式。

10月7日周三
  1. AWS Machine Learning Blog28

    如何为 agentic automation 构建商业论证:AWS 提出 Agentic Value Model

    AWS 提出 Agentic Value Model,用于替代以"节省工时×人力成本"为核心的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调释放的工时只有转化为实际支出削减或可衡量的再部署产出才算价值,并以理赔分流流程为例给出测算。

  2. Latent Space84

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开数学难题中的 90 个

    OpenAI 在公开 GitHub 仓库发布了一批来自内部前沿模型的数学成果,称其来自约 4000 道研究问题的评测,包含 722 篇手稿、归入 372 个相关结果族,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身未发布。

    推荐理由:OpenAI 用内部未发布模型产出 722 篇数学手稿,读者可据此了解 AI 做数学研究的规模与算力成本。

  3. Microsoft Research22

    Microsoft 研究播客:AI 评测的意外失败能教会我们什么

    Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。

10月6日周二
10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。

    推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。

  2. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何迈入智能体 AI 时代

    企业 AI 的竞争前沿已从预测精度转向自主决策,核心挑战是让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 称,"分析"一词正让位于 AI。

  3. MIT Technology Review · AI26

    人们一边痛恨 AI,一边为何又离不开它?

    全球民调显示公众对 AI 的负面情绪快速上升:Pew 数据显示更多美国成年人认为 AI 对个人和社会的影响是负面的,Gallup 5 月调查中 71% 美国成年人反对在本地新建 AI 数据中心。但使用量仍在飙升,ChatGPT 5 月月活达 10 亿,Gemini 7 月达 9.5 亿,Pew 称一半美国成年人已使用聊天机器人。文章认为人们反感的不是技术本身,而是公司无孔不入的推销方式。

  4. MIT Technology Review · AI8

    EmTech Future 2026:当 AI 与万物相遇

    MIT Technology Review 的 EmTech Future 2026 活动聚焦 AI 与生物学、基础设施、制造业和科学的交叉融合,Google Research 副总裁兼负责人 Yossi Matias 就此分享了 AI 如何开始重塑这些领域。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

  2. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,双机集群可扩展至 200B 参数模型

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,单机支持最高 1000 亿参数模型。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群实测数据,可据此判断本地跑大模型的成本与扩展方式。

  3. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,把水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,使其不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物学,读者可了解 AI 生成蛋白质如何在保留功能的前提下被标记与验证。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Microsoft Research18

    微软亚洲研究院新加坡分院成立一年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。

    推荐理由:GitHub 安全实验室把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

  2. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型原生耦合,让对话智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。

    推荐理由:官方给出实时视频与语音耦合的能力细节和开放入口,读者可据此判断企业级对话智能体的形态变化。

9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块懒测量、锚定到文件与行,避免滚动跳变。