谷歌 Gemini 4 "Carbon" 模型据称编程性能接近 Anthropic Opus 5.5
谷歌正在内部测试 Gemini 4 的多个变体 Argon、Barium 和 Carbon,其中 Carbon 已部署在内部编程平台 Jetski 上,据称在编程任务上优于 Argon,一名员工将其编程能力比作 Anthropic 最强的编程模型 Opus 5.5。
谷歌正在内部测试 Gemini 4 的多个变体 Argon、Barium 和 Carbon,其中 Carbon 已部署在内部编程平台 Jetski 上,据称在编程任务上优于 Argon,一名员工将其编程能力比作 Anthropic 最强的编程模型 Opus 5.5。
AINews 汇总 10 月 8 日至 9 日动态:TypeSafe 宣布 Series AI 融资,Sequoia 透露其上线首周 ARR 突破 1 亿美元,Jev 成为多家厂商决策模型的对标基准。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、逾 70 万名员工的 3 亿条工作事件,发现人类代码审查成为 AI 编码工具整体效率的显著瓶颈。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里几乎全程靠说话为博客开发出 Newsletters 页面,所用模型为 GPT-6 Astra High。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让浏览器智能体的模型成本降低 76 倍、速度提升 5 倍,从而为客户提供更强的模型。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是把 Astra、Sol 和 Luna 匹配到不同任务,并对预算进行策略性管理。
Artcraft 品牌从面向艺术家的可控 AI 转向开源应用套件,用七个应用复刻 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具。
Reflection 发布 Beam,一个面向编码、智能体和科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月放出。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应随风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据外的上下文,减少 token 浪费并降低答案不完整的概率。