Skip to main content
用这个 cookbook 验证 AgentCompass、Docker 执行、本地 GLM-5.2 endpoint 和结果写入是否正常,再运行更大规模 benchmark。

前置条件

  • 已在仓库根目录安装 AgentCompass。
  • MODEL_BASE_URL 指向本地 OpenAI-compatible GLM-5.2 endpoint,例如 http://localhost:8000/v1
  • 已导出 MODEL_API_KEY。如果本地 endpoint 需要鉴权,请使用真实 key;如果本地服务忽略 API key,可以使用 EMPTY
  • Docker 已安装、daemon 正在运行,并且可以拉取 SWE-bench 任务镜像。
  • 已安装 SWE-bench 和 mini-SWE-agent 依赖:

命令

命令含义

预期输出

结果会写到 results/swebench_verified/glm-5.2/<timestamp>/

常见调整