AI Agent智能体能力的量化评测是大模型应用落地的核心环节。传统的对话质量评估方式已无法反映智能体在真实终端环境中的任务完成能力,Terminal Bench、SWE-Bench等基准测试框架应运而生,通过模拟真实办公场景对AI Agent进行多维度能力测量。AI Agent评测体系的搭建涉及任务设计、环境隔离、执行监控和结果判定四个环节,需要结合自动化测试工具链实现端到端的评测流程。
AI Agent能力评测框架设计原则
AI Agent评测框架的核心理念是将”能回答问题”升级为”能完成任务”。评测体系从单轮对话扩展到多轮交互,从文本生成扩展到工具调用,从静态问答扩展到动态操作。评测维度覆盖指令理解、任务规划、工具选择、执行准确性和错误恢复五个层级。
框架设计遵循三个原则:任务真实性,评测场景来自实际办公需求而非人工构造;环境可控性,评测过程在隔离的沙箱环境中执行,避免对生产系统造成影响;结果可量化,每个任务都有明确的成功判定标准,支持自动化评分。
Terminal Bench基准测试环境搭建
Terminal Bench通过模拟终端操作环境,评测AI Agent在文件管理、代码编写、系统配置等场景下的任务完成率。搭建测试环境需要Docker容器作为隔离执行环境,配合任务编排脚本实现自动化评测流程。
# Dockerfile for Terminal Bench environment
FROM ubuntu:22.04
RUN apt-get update && apt-get install -y \
python3.10 python3-pip git curl wget vim \
nodejs npm openjdk-17-jdk \
&& rm -rf /var/lib/apt/lists/*
# 安装评测依赖
RUN pip3 install pytest requests beautifulsoup4 selenium
# 创建评测工作目录
WORKDIR /app/terminal-bench
# 复制任务定义和评测脚本
COPY tasks/ ./tasks/
COPY evaluator.py ./evaluator.py
COPY runner.py ./runner.py
# 设置评测执行入口
ENTRYPOINT ["python3", "runner.py"]
任务定义与评测脚本实现
每个评测任务以JSON格式定义,包含任务描述、初始环境配置、工具白名单和成功判定条件。评测脚本读取任务定义后,将任务分发给待测AI Agent,收集执行过程日志,并根据判定条件自动评分。
import json
import subprocess
import time
from pathlib import Path
class TaskRunner:
def __init__(self, task_dir: str):
self.task_dir = Path(task_dir)
self.tasks = self._load_tasks()
def _load_tasks(self):
tasks = []
for task_file in sorted(self.task_dir.glob("*.json")):
with open(task_file, "r", encoding="utf-8") as f:
task = json.load(f)
task["task_id"] = task_file.stem
tasks.append(task)
return tasks
def run_task(self, task: dict, agent_endpoint: str) -> dict:
"""执行单个评测任务"""
sandbox = self._create_sandbox(task)
request_payload = {
"task_id": task["task_id"],
"instruction": task["instruction"],
"tools": task.get("allowed_tools", []),
"env_config": sandbox["config"]
}
start_time = time.time()
result = self._call_agent(agent_endpoint, request_payload)
elapsed = time.time() - start_time
score = self._evaluate(task, sandbox, result)
return {
"task_id": task["task_id"],
"success": score["passed"],
"score": score["details"],
"elapsed_seconds": round(elapsed, 2),
"agent_actions": result.get("actions", [])
}
def _evaluate(self, task: dict, sandbox: dict, result: dict) -> dict:
"""根据判定条件评估任务完成情况"""
checks = task.get("success_criteria", [])
details = {"total": len(checks), "passed": 0, "items": []}
for check in checks:
check_result = self._run_check(check, sandbox)
details["items"].append({
"check": check["type"],
"target": check.get("target", ""),
"passed": check_result
})
if check_result:
details["passed"] += 1
details["passed_all"] = details["passed"] == details["total"]
return {"passed": details["passed_all"], "details": details}
def _run_check(self, check: dict, sandbox: dict) -> bool:
"""执行单个判定检查"""
check_type = check["type"]
if check_type == "file_exists":
path = sandbox["workdir"] / check["target"]
return path.exists()
elif check_type == "file_content_contains":
path = sandbox["workdir"] / check["target"]
if not path.exists():
return False
content = path.read_text(encoding="utf-8")
return check["expected"] in content
elif check_type == "command_output":
proc = subprocess.run(
check["command"], shell=True,
capture_output=True, text=True,
cwd=sandbox["workdir"]
)
return check["expected"] in proc.stdout
elif check_type == "regex_match":
path = sandbox["workdir"] / check["target"]
if not path.exists():
return False
import re
content = path.read_text(encoding="utf-8")
return bool(re.search(check["pattern"], content))
return False
多Agent横向对比评测方案
对多个AI Agent进行横向对比时,需要统一评测任务集、统一评分标准和统一环境配置。每个Agent在相同的任务集上独立执行,最终汇总各Agent的任务通过率、平均执行时间、工具调用次数和错误恢复率。
class AgentBenchmark:
def __init__(self, config_path: str):
with open(config_path, "r", encoding="utf-8") as f:
self.config = json.load(f)
self.runner = TaskRunner(self.config["task_dir"])
self.agents = self.config["agents"]
def run_benchmark(self) -> dict:
results = {}
for agent in self.agents:
agent_name = agent["name"]
agent_endpoint = agent["endpoint"]
results[agent_name] = []
for task in self.runner.tasks:
task_result = self.runner.run_task(task, agent_endpoint)
results[agent_name].append(task_result)
return self._generate_report(results)
def _generate_report(self, results: dict) -> dict:
report = {"summary": {}, "details": results}
for agent_name, task_results in results.items():
total = len(task_results)
passed = sum(1 for r in task_results if r["success"])
avg_time = sum(r["elapsed_seconds"] for r in task_results) / total if total else 0
report["summary"][agent_name] = {
"pass_rate": f"{passed}/{total} ({passed/total*100:.1f}%)" if total else "N/A",
"avg_time_seconds": round(avg_time, 2),
"total_tasks": total,
"passed_tasks": passed
}
return report
评测指标体系与Harness得分计算
Harness得分是衡量AI Agent综合能力的加权评分指标,由任务通过率、执行效率、工具调用准确率和错误恢复率四个维度加权计算。权重设置根据评测场景侧重点调整,办公场景偏重任务通过率和工具调用准确率,开发场景偏重执行效率和错误恢复率。
def calculate_harness_score(results: list, weights: dict = None) -> float:
"""计算Harness综合得分"""
if not results:
return 0.0
default_weights = {
"pass_rate": 0.40,
"efficiency": 0.20,
"tool_accuracy": 0.25,
"error_recovery": 0.15
}
w = weights or default_weights
pass_rate = sum(1 for r in results if r["success"]) / len(results)
times = [r["elapsed_seconds"] for r in results]
max_time = max(times) if times else 1
efficiency = sum(1 - t/max_time for t in times) / len(times) if times else 0
tool_calls = [len(r.get("agent_actions", [])) for r in results]
successful_calls = [sum(1 for a in r.get("agent_actions", [])
if a.get("success", False)) for r in results]
total_calls = sum(tool_calls) or 1
total_success = sum(successful_calls)
tool_accuracy = total_success / total_calls
error_recovery = 0
error_count = 0
for r in results:
for action in r.get("agent_actions", []):
if action.get("error"):
error_count += 1
if action.get("recovered"):
error_recovery += 1
error_recovery_rate = error_recovery / error_count if error_count else 1.0
score = (pass_rate * w["pass_rate"] +
efficiency * w["efficiency"] +
tool_accuracy * w["tool_accuracy"] +
error_recovery_rate * w["error_recovery"])
return round(score * 100, 2)
评测结果可视化与对比分析
评测完成后生成对比报告,包含各Agent的任务通过率分布、执行时间箱线图、工具调用热力图和错误类型统计。报告以HTML格式输出,支持交互式数据筛选和下钻分析。
import matplotlib
matplotlib.use("Agg")
import matplotlib.pyplot as plt
import numpy as np
def generate_comparison_chart(report: dict, output_path: str):
"""生成Agent能力对比雷达图"""
agents = list(report["summary"].keys())
categories = ["通过率", "执行效率", "工具准确率", "错误恢复"]
scores = {}
for agent in agents:
s = report["summary"][agent]
pr = float(s["pass_rate"].split("(")[1].rstrip("%)")) / 100
eff = 1 - (s["avg_time_seconds"] / max(
report["summary"][a]["avg_time_seconds"] for a in agents))
scores[agent] = [pr*100, eff*100, 85, 70]
angles = np.linspace(0, 2 * np.pi, len(categories), endpoint=False).tolist()
angles += angles[:1]
fig, ax = plt.subplots(figsize=(8, 8), subplot_kw=dict(polar=True))
for agent in agents:
values = scores[agent] + scores[agent][:1]
ax.plot(angles, values, linewidth=2, label=agent)
ax.fill(angles, values, alpha=0.15)
ax.set_xticks(angles[:-1])
ax.set_xticklabels(categories)
ax.set_ylim(0, 100)
ax.legend(loc="upper right", bbox_to_anchor=(1.3, 1.1))
plt.tight_layout()
plt.savefig(output_path, dpi=150, bbox_inches="tight")
plt.close()
评测体系落地注意事项
评测任务集需要定期更新,防止Agent通过过拟合特定任务集刷分。任务设计应覆盖不同难度等级,简单任务验证基础能力,复杂任务验证规划和推理能力。环境隔离要彻底,Agent执行的操作不能影响宿主系统和其他评测任务的初始状态。
评分标准要明确且可自动化执行,避免人工评判引入主观偏差。对于开放性任务,可以采用多维度评分而非二元判定,比如代码任务同时检查功能正确性、代码风格和测试覆盖率。评测结果要可复现,同一Agent在相同任务集上的多次评测结果偏差应控制在5%以内。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/aiagent-zhi-neng-ti-neng-li-ping-ce-ti-xi-gou-jian-yu/