项目范围与 Claim Boundary
最后更新:2026-07-24。
本页是项目范围、任务边界和 claim ladder 的唯一权威来源。当前主线是“生成 kinematic HOI/HSI → 物理 teacher → 无 dense reference 的 state-based student”;本页不维护实验数值,实验协议见 评测策略,执行状态见 全局实验计划。
一句话目标
给定 SAGE 场景、task plan 和 KIMODO 生成的 SMPL-X HOI/HSI trajectory,构建一个能产生物理可执行 teacher rollout、再训练自主 state-based loco-manipulation policy 的可审计闭环。
SAGE scene + task plan
→ KIMODO kinematic SMPL-X human/object trajectory
→ grasp/contact refinement
→ physics refiner / full-reference teacher
→ executable state–action–contact rollouts
→ distillation + state-based RL post-training
→ deployment student
研究问题
RQ-A:单条 generated motion 如何变成可执行 teacher trajectory?
输入已经是 canonical SMPL-X pick–place trajectory,而不是视频。候选方法包括:
- frozen scene-agnostic full-body tracker;
- pretrained HOI tracker;
- tracker + action/reference residual;
- per-reference optimization 或 RL refinement;
- 从 scratch 训练的 contact-aware HOI policy;
- kinematic/trajectory optimizer 与 policy 联合或交替 refinement。
这些方法共享同一输入 motion 和物理评测协议。baseline 的唯一分层定义在 评测策略。
RQ-B:如何从 teacher rollouts 学到无 reference 的最终 policy?
部署 student 不读取 dense human/object reference trajectory。首个目标接口固定为:
- current simulator state;
- object goal state;
- 必要 proprioception;
- 必要 object/scene geometry。
随后才评价 TokenHSI-style task tokens、UniHSI-style contact chain 和 VLM-RMD-style relation goals。InterPrior 提供的是 teacher-to-motor-prior 的训练模板,而不是 RQ-A 的 full-reference refiner baseline。
明确不做什么
- 不是视频重建。 RePHO 的视频前端不属于项目问题;项目只借用其 per-sequence physics refinement 机制。
- 不是只修一条好看的动画。 kinematic render 是输入质量诊断,不能替代 physics rollout 和 task metric。
- 不是部署时复现 reference。 dense reference 只允许存在于 generator、refiner、teacher 和训练期 distillation。
- 不是只报告成功样本。 任何结果都必须保留总分母、失败数和 unavailable 数。
- 不是让 refiner 重新规划任务。 validated object goal、scene identity 和 task semantics 不能被 physics stage 静默改写。
Claim ladder
| 层级 | 可支持的表述 | 最低证据 |
|---|---|---|
| C0 接口有效 | 能从 task/layout 生成 canonical motion artifact | 代码、测试、单 case 输出 |
| C1 Kinematic quality | 轨迹满足指定几何、接触和时序 gate | 全分母 kinematic metrics + render audit |
| C2 Physical tracking | 某 teacher/refiner 能在物理仿真复现该 trajectory | 多 seed rollout、human/object/contact/physics metrics |
| C3 Task execution | rollout 完成 pick–carry–place,而非只跟踪局部 | task success、失败归因和 telemetry completeness |
| C4 Generalization | 同一方法能跨 object、scene、motion 或 goal | 未见过的明确 split 与置信区间 |
| C5 Autonomous student | 无 dense reference 的 student 能自主完成任务 | deployment observation audit + held-out task success |
| C6 Unified HSI/HOI | 单一 student 支持多类 goal interface 与 long-horizon task | 多任务 controlled comparison 与消融 |
当前公开证据最多到 C1 的单例阶段性状态;C2–C6 均不能由计划或外部论文能力代替。
不可轻易改变的接口约束
- Kinematic public input 是
task_plan.json、layout_json和out_dir。 - canonical motion 保存 human motion、object identity 和 pose trajectory,不内嵌动态物体 mesh。
layout_json + dynamic_object_id是 geometry consumer boundary。pipeline_manifest.json是 provenance,不是 pipeline runtime state。- teacher baseline 排名必须统一 body shape、coordinate frame、object geometry、simulator、budget 和 metric denominator。
- student deployment dataloader 必须可证明不含 dense HOI reference 或 future teacher state。
当前状态
- 已验证: task-first generation 入口、canonical artifact 收口和动态物体 geometry consumer boundary 有代码与测试支持。
- 阶段性: 一条 597-frame left-hand pick–place motion 通过接口与 kinematic parity;temporal render 仍待人工复核。
- 当前推断: RePHO-style per-reference refiner 是 RQ-A 的强主候选;它可能比直接把生成 motion 交给通用 tracker 更适合吸收 reference 噪声。
- 待验证: teacher baseline 排名、refiner 规模化、teacher-to-student 闭环以及 object-goal-only student 的自主任务成功。