全局实验计划
最后更新:2026-07-24。
本页是全局实验矩阵与执行状态的唯一权威来源。baseline 定义和 metric 只在 评测策略 维护;每个结果的数值与输出路径在对应实验页维护。
当前决策
- 先冻结一条 canonical SMPL-X pick–place input 并完成 temporal review。
- 在同一 input 上完成 A0/A1/A4/A6/A8 的最小可比组。
- RePHO 作为 per-reference teacher-refiner 主候选接入,但不引入 video front-end。
- 只有 teacher gate 通过后,才生成 rollout dataset 并训练 InterPrior-style object-goal-only student。
- TokenHSI/UniHSI/VLM-RMD goal interface 放在第二阶段。
实验矩阵
| 工作包 | 对应决策 | 当前状态 | 证据等级 | Canonical 页面 |
|---|---|---|---|---|
| Kinematic generation | 输入是否满足统一接口与几何质量 | parity 通过;temporal manual review 未完成 | 阶段性 | Kinematic Generation |
| Grasp refinement | map-free proposal/refinement 是否跨对象稳定 | 8-object static gate 有结果;physics grasp 待验证 | 阶段性 | Grasp Refinement |
| A0/A1 direct tracking | raw/scene-agnostic lower bounds | current direct pipeline 可运行;同序正式结果待补 | 待验证 | Physics Teacher Selection |
| OmniGrasp A4 | object-control prior 是否迁移 | 历史 zero-shot 有 diagnostic;strict current run 失败 | 阶段性 | OmniGrasp |
| InterMimic A4/A8 | HOI prior/scratch 是否能追踪 project motion | native official-aligned 成功;current 597-frame scratch 正在训练 | 阶段性 | Physics Teacher Selection |
| RePHO A6 | alternating refinement 是否优于 fixed reference | official repo 已拉入;adapter/运行未完成 | 待验证 | Physics Teacher Selection |
| GRAIL latent baseline | GRAIL-Min-SMPLX 是否可公平适配 | 29 项 CPU/contract tests 通过;hash-bound E0 需随最新源码重跑,正式训练禁止启动 | 待验证 | GRAIL Minimal |
| External kinematic generators | 其它 generator 是否改善 input | HOI-FHLI 仅历史结果;InteractMove/HOSIG 无 reproduced result | 阶段性/待验证 | External Generators |
| Shared teacher | per-reference 结果能否规模化 | 未开始 | 待验证 | Physics Teacher Selection |
| Object-goal-only student | teacher→state-based policy 闭环 | 未开始 | 待验证 | 项目范围 |
| Goal-interface expansion | token/contact/relation condition | 未开始 | 待验证 | 方法主线 |
执行顺序与 stop gate
Phase 0:冻结输入
- 完成 current 597-frame temporal render manual review。
- 固定 body-shape、geometry、coordinate 和 active-hand contract。
- 为所有 teacher adapter 生成同一 case manifest。
任何一项失败则不进行 architecture ranking。
Phase 1:最小 teacher comparison
- A0 reference PD/open-loop。
- A1 frozen PHC-X/ProtoMotions。
- A4 pretrained InterMimic / OmniGrasp 严格适配。
- A6 RePHO-style per-reference refinement。
- A8 scratch contact-aware expert。
先做 single-case multi-seed overfit。只有完整 human/object/contact telemetry 的结果进入表格。
Phase 2:因果消融
- base action vs action residual;
- fixed reference vs reference residual;
- fixed policy vs alternating policy/reference;
- body-only vs fingertip/contact condition;
- per-reference vs shared refiner。
Phase 3:teacher dataset
- 扩展 object/scene/motion split;
- 记录成功与失败 rollout;
- 自动 quality filtering;
- 冻结 teacher dataset schema 与 provenance。
Phase 4:student
- S1 distillation;
- S2 state-based RL post-training;
- S3 scratch RL;
- reference leakage audit;
- held-out goal/object/scene evaluation。
Phase 5:统一 goal interface
分别加入 TokenHSI-style token、UniHSI-style contact chain 与 VLM-RMD-style relation goal;不同时改变 motor prior、reward 和 dataset。
当前阻断项
- Kinematic case 的 manual temporal QA 尚未签字。
- current full-sequence InterMimic 尚无 deterministic evaluation。
- RePHO 尚无 PhysHSI canonical motion/shape/geometry adapter。
- GRAIL E0 artifact 早于最新 critical source,需要重跑;E1/P0/P1 仍无正式 raw gate output。
- student dataset 和 deployment observation contract 尚未实现。