← 返回洞察
洞察

一次答对还不够:为什么 Agent 应该重复测同一道题

平均成功率和“每次都成功”回答的是不同问题。一份 AppWorld 实验把两者的差距摆在了一起。

原文对比平均成功率与五次全部成功的比例
原文对比平均成功率与五次全部成功的比例 · 图源:IBM Research

两个指标,两种问题

IBM Research 的公开文章比较平均通过率 Mean@5 与五次都通过的 Pass⁵。后者也不同于“多试几次,至少成功一次”的 Pass@5。

实验显示的差距

在作者使用的 GPT-4.1 ReAct 与 AppWorld test_normal 配置中,平均成功率为 77.4%,五次都成功的任务占 53.0%,相差 24.4 个百分点。

可以借用的方法

作者分析已记录轨迹中容易改变的决策,再生成一致性指导。对实际产品,更直接的启发是固定任务反复运行,同时保留失败路径。文中改进属于特定实验,不能推成所有 Agent 的可靠性承诺。

AI 辅助整理,由发布者核对后分享;请核对事实与不同观点,不代表各方已达成共识。

举报此内容

说明问题

处理记录