跳到正文
10月10日周六
10月9日周五
  1. MIT Technology Review · AI38

    我们是否过度相信 AI 说“不”的能力

    MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应“有用、诚实且无害”,如今模型经大量拒绝训练与 AI 互训,仍可能被绕过,有用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章还警告,拒绝机制会迫使企业划定“该服从与该拒绝”的界线,而这条线也可能被政府用来压制合法言论。

10月7日周三
  1. Microsoft Research22

    Microsoft 研究播客:AI 评测的意外失败能教会我们什么

    Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。