Evaluation 与 Task Validator
最后更新:2026-07-24。
本页负责当前 task validator 与通用 metric collector 的运行边界;研究 baseline 指标定义、公平性与 evidence gate 仍只在 评测策略 维护。
Task validator
utils/task_validator 把已有 task plan 转为 canonical validation plan,并可消费 offline trace 或 runtime adapter state。
构建 canonical plan:
python -m utils.task_validator.cli build-canonical \
--task-plan <task_plan.json> \
--task-validation <task_validation.json> \
--output <canonical_plan.json>
验证离线 trace:
python -m utils.task_validator.cli validate-trace \
--plan <canonical_plan.json> \
--trace <trace.json> \
--output <validation_result.json>
运行前用 python -m utils.task_validator.cli --help 核对当前子命令。
主要 task-level output:
- subtask pointer / completion;
- full-task success;
- goal precision;
- collision/fall/force event;
- episode failure/termination。
Runtime metric collector
utils/metrics 是跨 baseline 的 frame/episode collector,覆盖:
- reward、episode length、success/precision;
- distance to target;
- collision、fall、large-force event;
- episode/window aggregation;
- JSONL/CSV writer。
它通过 adapter 读取 runtime state,不应修改 baseline task semantics。通用 collector 的 success 字段只反映 adapter/task 暴露的信号;论文实验仍需按 评测策略 联合 human/object/contact/task telemetry。
结果记录要求
每个 formal evaluation 同时保存:
- canonical plan 与 case identity;
- policy/checkpoint/config/seed;
- rollout trace;
- metric result;
- denominator、failure、unavailable;
- termination reason;
- reproducible command 与 stable output path。
通用 metric collector、baseline-specific metric 和 task validator 不得各自维护不同的“成功”结论;单项实验页负责说明最终采用哪个 gate 以及为何。
Code-adjacent references
utils/task_validator/README.md 和 utils/metrics/README.md 保存 API/field 细节。它们是实现邻近参考,不维护论文 claim、baseline 排名或 experiment status。