README.md 705 B

Global Data 0.3 Evals

这是一组小而稳定的离线 Eval,不调用真实模型或媒体生成服务。cases.json 固定 8 个代表性案例,覆盖:

  • final_output:最终报告、COMPLETED 终态重验;
  • trajectory:远程工具调用顺序、Replan 保留已 PASS Task;
  • single_step:Plan 覆盖、Artifact 本地化、Validator 前置检查;
  • adversarial:同一个远程 URL 在首次下载后替换内容。

运行:

uv run python evals/global_data/run.py

这些 Eval 验证确定性合同和执行轨迹,不代替真实模型质量评估。后续积累真实失败 样本时,应替换或扩充案例本身,而不是把数量无限增加。