跳转至

项目范围与 Claim Boundary

最后更新:2026-07-24。

本页是项目范围、任务边界和 claim ladder 的唯一权威来源。当前主线是“生成 kinematic HOI/HSI → 物理 teacher → 无 dense reference 的 state-based student”;本页不维护实验数值,实验协议见 评测策略,执行状态见 全局实验计划

一句话目标

给定 SAGE 场景、task plan 和 KIMODO 生成的 SMPL-X HOI/HSI trajectory,构建一个能产生物理可执行 teacher rollout、再训练自主 state-based loco-manipulation policy 的可审计闭环。

SAGE scene + task plan
  → KIMODO kinematic SMPL-X human/object trajectory
  → grasp/contact refinement
  → physics refiner / full-reference teacher
  → executable state–action–contact rollouts
  → distillation + state-based RL post-training
  → deployment student

研究问题

RQ-A:单条 generated motion 如何变成可执行 teacher trajectory?

输入已经是 canonical SMPL-X pick–place trajectory,而不是视频。候选方法包括:

  • frozen scene-agnostic full-body tracker;
  • pretrained HOI tracker;
  • tracker + action/reference residual;
  • per-reference optimization 或 RL refinement;
  • 从 scratch 训练的 contact-aware HOI policy;
  • kinematic/trajectory optimizer 与 policy 联合或交替 refinement。

这些方法共享同一输入 motion 和物理评测协议。baseline 的唯一分层定义在 评测策略

RQ-B:如何从 teacher rollouts 学到无 reference 的最终 policy?

部署 student 不读取 dense human/object reference trajectory。首个目标接口固定为:

  • current simulator state;
  • object goal state;
  • 必要 proprioception;
  • 必要 object/scene geometry。

随后才评价 TokenHSI-style task tokens、UniHSI-style contact chain 和 VLM-RMD-style relation goals。InterPrior 提供的是 teacher-to-motor-prior 的训练模板,而不是 RQ-A 的 full-reference refiner baseline。

明确不做什么

  • 不是视频重建。 RePHO 的视频前端不属于项目问题;项目只借用其 per-sequence physics refinement 机制。
  • 不是只修一条好看的动画。 kinematic render 是输入质量诊断,不能替代 physics rollout 和 task metric。
  • 不是部署时复现 reference。 dense reference 只允许存在于 generator、refiner、teacher 和训练期 distillation。
  • 不是只报告成功样本。 任何结果都必须保留总分母、失败数和 unavailable 数。
  • 不是让 refiner 重新规划任务。 validated object goal、scene identity 和 task semantics 不能被 physics stage 静默改写。

Claim ladder

层级 可支持的表述 最低证据
C0 接口有效 能从 task/layout 生成 canonical motion artifact 代码、测试、单 case 输出
C1 Kinematic quality 轨迹满足指定几何、接触和时序 gate 全分母 kinematic metrics + render audit
C2 Physical tracking 某 teacher/refiner 能在物理仿真复现该 trajectory 多 seed rollout、human/object/contact/physics metrics
C3 Task execution rollout 完成 pick–carry–place,而非只跟踪局部 task success、失败归因和 telemetry completeness
C4 Generalization 同一方法能跨 object、scene、motion 或 goal 未见过的明确 split 与置信区间
C5 Autonomous student 无 dense reference 的 student 能自主完成任务 deployment observation audit + held-out task success
C6 Unified HSI/HOI 单一 student 支持多类 goal interface 与 long-horizon task 多任务 controlled comparison 与消融

当前公开证据最多到 C1 的单例阶段性状态;C2–C6 均不能由计划或外部论文能力代替。

不可轻易改变的接口约束

  1. Kinematic public input 是 task_plan.jsonlayout_jsonout_dir
  2. canonical motion 保存 human motion、object identity 和 pose trajectory,不内嵌动态物体 mesh。
  3. layout_json + dynamic_object_id 是 geometry consumer boundary。
  4. pipeline_manifest.json 是 provenance,不是 pipeline runtime state。
  5. teacher baseline 排名必须统一 body shape、coordinate frame、object geometry、simulator、budget 和 metric denominator。
  6. student deployment dataloader 必须可证明不含 dense HOI reference 或 future teacher state。

当前状态

  • 已验证: task-first generation 入口、canonical artifact 收口和动态物体 geometry consumer boundary 有代码与测试支持。
  • 阶段性: 一条 597-frame left-hand pick–place motion 通过接口与 kinematic parity;temporal render 仍待人工复核。
  • 当前推断: RePHO-style per-reference refiner 是 RQ-A 的强主候选;它可能比直接把生成 motion 交给通用 tracker 更适合吸收 reference 噪声。
  • 待验证: teacher baseline 排名、refiner 规模化、teacher-to-student 闭环以及 object-goal-only student 的自主任务成功。

下一步阅读 方法主线,然后按 评测策略 查看哪些比较才是公平比较。