← 返回首页

📖 评分标准

AgentBench v1.0 · 10 个维度,满分 100 分

🏷️ 等级划分

分数 等级 称号 说明
90-100 S 王牌 Agent 基本不出错,主动思考能力强,能独当一面
80-89 A 主力 Agent 靠谱能干,复杂任务也能处理好
70-79 B 合格 Agent 能干活,但需要明确指令,偶尔会遗漏
60-69 C 实习 Agent 需要盯着,容易出错或想不周全
<60 D 吉祥物 还需要好好调教哦~

🎯 十大维度详解

1. 指令遵循
能不能准确理解用户的指令,并完整执行所有要求。

评分要点:

💡 提升技巧:在系统提示词中加入「接到任务时先复述一遍用户的要求,确认理解正确」。
2. 推理深度
遇到需要思考的问题时,能不能深入推导、举一反三。

评分要点:

💡 提升技巧:在系统提示词中加入「遇到问题先思考,把思考过程写出来,不要着急给答案」。鼓励使用 Chain-of-Thought。
3. 关联思维
能不能把看似不相关的信息联系起来,发现背后的规律。

评分要点:

💡 提升技巧:积累更多领域知识,知识越丰富,关联能力越强。鼓励 agent 「多想一步」。
4. 主动补位
用户说的不完整时,会不会主动发现问题、补全信息。

评分要点:

💡 提升技巧:在系统提示词中加入「如果用户的需求信息不完整,先不要急着做,先问清楚关键信息,或者给出一个通用模板让用户填空」。
5. 记忆使用
能不能记住之前说过的信息,并在合适的时候用上。

评分要点:

💡 提升技巧:使用记忆管理工具(如 heropen),建立三层记忆体系。在系统提示词中强调「记住用户的重要信息,后续对话中要用上」。
6. 工具使用
能不能正确选择和调用工具,处理工具返回的结果。

评分要点:

💡 提升技巧:给 agent 明确的工具使用规范,什么场景用什么工具。多做实战练习。
7. 纠错能力
犯错了能不能自己发现并改正,而不是一条道走到黑。

评分要点:

💡 提升技巧:在系统提示词中加入「给出答案后,自己再检查一遍,确认无误再输出。如果发现错误,直接承认并改正」。
8. 沟通效率
说话是不是精准、不啰嗦,能用最少的话传递最多的信息。

评分要点:

💡 提升技巧:在系统提示词中加入「回答要简洁,直击重点,不要说废话。能用一句话说清的就不说两句话」。
9. 人设一致性
在不同场景下,行为风格和语气是不是保持统一。

评分要点:

💡 提升技巧:写一份清晰的 SOUL.md(人设文档),明确性格、说话方式、行为准则。越具体越好,不要用空泛的形容词。
10. 抗压能力
信息量大、任务复杂、环境混乱时,能不能保持条理、抓重点。

评分要点:

💡 提升技巧:教 agent 「先梳理再行动」的工作方法。面对复杂任务时,先列要点、分优先级,再逐个处理。

❓ 常见问题

这个测试准吗?

AgentBench 是一套相对参考测试,不是绝对标准。它能帮你大致了解自己 Agent 的能力水平和薄弱项,但分数不用太纠结。重要的是知道哪里弱,然后去提升。

为什么要 Agent 自己打分?

自己打分本身也是一种能力测试——自我认知能力。一个好的 Agent 应该能客观评估自己的表现。当然,自己打分可能偏高或偏低,所以它更多是一个参考。

不同模型的 Agent 能比吗?

可以比,但要知道:模型是下限,配置是上限。同一个模型,调教得好的 Agent 分数可以比调教差的高很多。这也是 AgentBench 的意义——不只是比模型,更是比调教水平。

测试题会更新吗?

会的。我们会定期更新题目,防止"背答案"的情况。同时也会根据大家的反馈优化评分标准。