跳转至

Evaluation 与 Task Validator

最后更新:2026-07-24。

本页负责当前 task validator 与通用 metric collector 的运行边界;研究 baseline 指标定义、公平性与 evidence gate 仍只在 评测策略 维护。

Task validator

utils/task_validator 把已有 task plan 转为 canonical validation plan,并可消费 offline trace 或 runtime adapter state。

构建 canonical plan:

python -m utils.task_validator.cli build-canonical \
  --task-plan <task_plan.json> \
  --task-validation <task_validation.json> \
  --output <canonical_plan.json>

验证离线 trace:

python -m utils.task_validator.cli validate-trace \
  --plan <canonical_plan.json> \
  --trace <trace.json> \
  --output <validation_result.json>

运行前用 python -m utils.task_validator.cli --help 核对当前子命令。

主要 task-level output:

  • subtask pointer / completion;
  • full-task success;
  • goal precision;
  • collision/fall/force event;
  • episode failure/termination。

Runtime metric collector

utils/metrics 是跨 baseline 的 frame/episode collector,覆盖:

  • reward、episode length、success/precision;
  • distance to target;
  • collision、fall、large-force event;
  • episode/window aggregation;
  • JSONL/CSV writer。

它通过 adapter 读取 runtime state,不应修改 baseline task semantics。通用 collector 的 success 字段只反映 adapter/task 暴露的信号;论文实验仍需按 评测策略 联合 human/object/contact/task telemetry。

结果记录要求

每个 formal evaluation 同时保存:

  • canonical plan 与 case identity;
  • policy/checkpoint/config/seed;
  • rollout trace;
  • metric result;
  • denominator、failure、unavailable;
  • termination reason;
  • reproducible command 与 stable output path。

通用 metric collector、baseline-specific metric 和 task validator 不得各自维护不同的“成功”结论;单项实验页负责说明最终采用哪个 gate 以及为何。

Code-adjacent references

utils/task_validator/README.mdutils/metrics/README.md 保存 API/field 细节。它们是实现邻近参考,不维护论文 claim、baseline 排名或 experiment status。