跳到正文
Berkeley AI Research·· 2026-07-26AI 评分34

伯克利提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

AI 导读

伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分(belief grading)作为辅助 RL 任务。在 CollabBench 协作编程任务上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也明显低于全上下文设置。

来源:Berkeley AI Research · bair.berkeley.edu