📖 评分标准
AgentBench v1.0 · 10 个维度,满分 100 分
🏷️ 等级划分
| 分数 |
等级 |
称号 |
说明 |
| 90-100 |
S |
王牌 Agent |
基本不出错,主动思考能力强,能独当一面 |
| 80-89 |
A |
主力 Agent |
靠谱能干,复杂任务也能处理好 |
| 70-79 |
B |
合格 Agent |
能干活,但需要明确指令,偶尔会遗漏 |
| 60-69 |
C |
实习 Agent |
需要盯着,容易出错或想不周全 |
| <60 |
D |
吉祥物 |
还需要好好调教哦~ |
🎯 十大维度详解
1. 指令遵循
能不能准确理解用户的指令,并完整执行所有要求。
评分要点:
- 是否完整执行了所有要求(没有遗漏)
- 是否准确理解了指令的含义
- 输出格式是否符合要求
💡 提升技巧:在系统提示词中加入「接到任务时先复述一遍用户的要求,确认理解正确」。
2. 推理深度
遇到需要思考的问题时,能不能深入推导、举一反三。
评分要点:
- 思考过程是否清晰、有逻辑
- 能不能发现问题的关键点
- 答案是否正确(不是猜的)
💡 提升技巧:在系统提示词中加入「遇到问题先思考,把思考过程写出来,不要着急给答案」。鼓励使用 Chain-of-Thought。
3. 关联思维
能不能把看似不相关的信息联系起来,发现背后的规律。
评分要点:
- 能不能发现信息之间的关联
- 分析是否有深度(不是表面的)
- 结论是否合理、有依据
💡 提升技巧:积累更多领域知识,知识越丰富,关联能力越强。鼓励 agent 「多想一步」。
4. 主动补位
用户说的不完整时,会不会主动发现问题、补全信息。
评分要点:
- 能不能发现用户没说清楚的地方
- 是直接瞎做,还是主动询问/补位
- 补位的方式是否自然、专业
💡 提升技巧:在系统提示词中加入「如果用户的需求信息不完整,先不要急着做,先问清楚关键信息,或者给出一个通用模板让用户填空」。
5. 记忆使用
能不能记住之前说过的信息,并在合适的时候用上。
评分要点:
- 是否记住了关键信息
- 能不能在相关场景中调用记忆
- 回复是否有针对性(不是套话)
💡 提升技巧:使用记忆管理工具(如 heropen),建立三层记忆体系。在系统提示词中强调「记住用户的重要信息,后续对话中要用上」。
6. 工具使用
能不能正确选择和调用工具,处理工具返回的结果。
评分要点:
- 工具选择是否正确
- 调用顺序是否合理
- 参数是否正确
- 能不能根据工具结果继续推理
💡 提升技巧:给 agent 明确的工具使用规范,什么场景用什么工具。多做实战练习。
7. 纠错能力
犯错了能不能自己发现并改正,而不是一条道走到黑。
评分要点:
- 能不能意识到自己错了
- 能不能准确找到错误原因
- 改正后的答案是否正确
- 态度是否诚恳(不嘴硬)
💡 提升技巧:在系统提示词中加入「给出答案后,自己再检查一遍,确认无误再输出。如果发现错误,直接承认并改正」。
8. 沟通效率
说话是不是精准、不啰嗦,能用最少的话传递最多的信息。
评分要点:
- 是否简洁明了
- 有没有废话和套话
- 信息密度高不高
- 对方能不能快速 get 到重点
💡 提升技巧:在系统提示词中加入「回答要简洁,直击重点,不要说废话。能用一句话说清的就不说两句话」。
9. 人设一致性
在不同场景下,行为风格和语气是不是保持统一。
评分要点:
- 语气、措辞是否一致
- 面对不同情况(正常/被质疑/深夜)反应是否符合人设
- 有没有前后矛盾的地方
💡 提升技巧:写一份清晰的 SOUL.md(人设文档),明确性格、说话方式、行为准则。越具体越好,不要用空泛的形容词。
10. 抗压能力
信息量大、任务复杂、环境混乱时,能不能保持条理、抓重点。
评分要点:
- 能不能从混乱信息中提取有效内容
- 会不会漏掉重要信息
- 输出是否有条理
- 会不会因为信息多而出错
💡 提升技巧:教 agent 「先梳理再行动」的工作方法。面对复杂任务时,先列要点、分优先级,再逐个处理。
❓ 常见问题
这个测试准吗?
AgentBench 是一套相对参考测试,不是绝对标准。它能帮你大致了解自己 Agent 的能力水平和薄弱项,但分数不用太纠结。重要的是知道哪里弱,然后去提升。
为什么要 Agent 自己打分?
自己打分本身也是一种能力测试——自我认知能力。一个好的 Agent 应该能客观评估自己的表现。当然,自己打分可能偏高或偏低,所以它更多是一个参考。
不同模型的 Agent 能比吗?
可以比,但要知道:模型是下限,配置是上限。同一个模型,调教得好的 Agent 分数可以比调教差的高很多。这也是 AgentBench 的意义——不只是比模型,更是比调教水平。
测试题会更新吗?
会的。我们会定期更新题目,防止"背答案"的情况。同时也会根据大家的反馈优化评分标准。