跳到正文
今天10月11日周日1 条
  1. Latent Space40

    Standard Bots 谈工业机器人如何实现可靠执行:十亿级参数模型、本地推理与全栈协同

    Standard Bots 用共享基础模型加演示微调的方式驱动机器人手臂,最大模型仅十亿级参数,靠超十亿张图像训练实现零样本感知,推理在本地边缘 GPU 上运行以保障工厂可靠性。其机器 tending 方案由模型负责识别零件、传统编程负责运动控制,公司同时掌控机械臂、末端执行器、控制系统与 AI 以协同优化。

10月10日周六
  1. The Decoder60

    微软发布 Decision-1 决策模型,基于 Qwen3.5-9B

    微软推出自研决策模型 Decision-1,用于分类、评估和路由决策,官方称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,达到 83.5%、延迟 85 ms,速度是第二名 H2O-Lightning-4B 的 2.5 倍。

  2. TechCrunch · AI22

    Amazon 放弃数据中心保密协议,AI 智能体想要你的信用卡

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议,此前 Microsoft 今年早些时候已采取类似举措。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是网站愿意放行。TechCrunch Equity 播客讨论了放弃保密协议是否会改变数据中心交易方式,以及信任为何可能是个人 AI 初创公司真正的产品。

10月9日周五
  1. NVIDIA Blog30

    NVIDIA Omniverse 如何用前沿 AI 智能体把创意变成仿真应用

    NVIDIA 开发者正用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库,通过自然语言指令搭建仿真应用。案例包括仓库人形机器人模拟器、基于旧金山 Market Street 的自动驾驶测试环境 Zero to Alpamayo、数字孪生传感器校验,以及 Unitree G1 人形机器人跨栏实验——100 次仿真中成功 64 次。

10月8日周四
  1. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的位置。

  2. NVIDIA Blog78

    NVIDIA 与 Microsoft 发布 RTX Spark 及面向 Windows 智能体的 MXC

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体工作流的落地条件。

  3. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一 agent harness 直接参与 RL,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出约 3500 行代码的智能体 RL 框架与真实 harness 训练路径,可据此判断训练与部署一致性的实现方式。

10月7日周三
  1. AWS Machine Learning Blog28

    如何为 agentic automation 构建商业论证:AWS 提出 Agentic Value Model

    AWS 提出 Agentic Value Model,用于替代以"节省工时×人力成本"为核心的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调释放的工时只有转化为实际支出削减或可衡量的再部署产出才算价值,并以理赔分流流程为例给出测算。

10月6日周二
10月5日周一
10月2日周五
  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,双机集群可扩展至 200B 参数模型

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,单机支持最高 1000 亿参数模型。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群实测数据,可据此判断本地跑大模型的成本与扩展方式。

  2. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
9月25日周五
9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块懒测量、锚定到文件与行,避免滚动跳变。

  2. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

  3. Google DeepMind62

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让 AI 助手在跨设备场景下持久保留上下文,同时维持端侧级别的隐私标准。

    推荐理由:Google 公布 Private AI Compute 的持久化服务端记忆方案,读者可了解云端 AI 如何在保留上下文的同时维持端侧级隐私。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    Berkeley AI Research 与 IBM Research 基于 K-Search 演化式内核搜索框架,为 Apple Silicon 的 MLX 构建后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被改写为 MLX 内核。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可看跨平台内核知识迁移的具体做法。

7月7日周二
  1. Berkeley AI Research32

    智能免费之后怎么办?面向智能体、由智能体构建的数据系统

    UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统需应对三大新挑战:为智能体服务、由智能体运行、由智能体合成。其中智能体查询会产生大量重复子计划,文本到 SQL 基准中仅 10-20% 子计划不同,80-90% 属重复工作。

5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的下一个范式

    伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,未教会模型自适应行为。