跳转至

项目范围与 Claim Boundary

最后更新:2026-07-27。

本页是项目范围、任务边界和 claim ladder 的唯一权威来源。当前主线是“生成 kinematic HOI/HSI → 物理 teacher → 无 dense reference 的 state-based student”;本页不维护实验数值,实验协议见 评测策略,总进度见 Experiments,两段的执行状态分别见 Teacher ModelStudent Model

一句话目标

给定 SAGE 场景、task plan 和 KIMODO 生成的 SMPL-X HOI/HSI trajectory,构建一个能产生物理可执行 teacher rollout、再训练自主 state-based loco-manipulation policy 的可审计闭环。

SAGE scene + task plan
  → KIMODO kinematic SMPL-X human/object trajectory
  → grasp/contact refinement
  → physics refiner / full-reference teacher
  → executable state–action–contact rollouts
  → distillation + state-based RL post-training
  → deployment student

这张图定义项目工程边界,不定义论文 novelty。SUGAR、MaskedManipulator/ MimicManipulator、InterPrior、HumanVLA、OmniH2O、HumanPlus、VisualMimic、CWI、GRAIL 与 DeVI 已覆盖其中两个或全部三个阶段;完整原因与来源见 Deep-Research Audit

研究问题

RQ-A:单条 generated motion 如何变成可执行 teacher trajectory?

输入已经是 canonical SMPL-X pick–place trajectory,而不是视频。候选方法包括:

  • frozen scene-agnostic full-body tracker;
  • pretrained HOI tracker;
  • tracker + action/reference residual;
  • per-reference optimization 或 RL refinement;
  • 从 scratch 训练的 contact-aware HOI policy;
  • kinematic/trajectory optimizer 与 policy 联合或交替 refinement。

这些方法共享同一输入 motion 和物理评测协议。baseline 的唯一分层定义在 评测策略

RQ-B:如何从 teacher rollouts 学到无 reference 的最终 policy?

部署 student 不读取 dense human/object reference trajectory。首个目标接口固定为:

  • current simulator state;
  • object goal state;
  • 必要 proprioception;
  • 必要 object/scene geometry。

随后才评价 TokenHSI-style task tokens、UniHSI-style contact chain 和 VLM-RMD-style relation goals。InterPrior 的完整论文同时含 full-reference expert 与 teacher-to-motor-prior;其 expert 属于 RQ-A competitor,而其 distillation/post-training 属于 RQ-B competitor,不能只取其中一半定义它。MaskedManipulator/MimicManipulator 同时是 RQ-A 的 full-reference teacher 与 RQ-B 的 masked body/object-goal student;CWI 则是相邻的 MoCap-to-bimanual deployment actor。

上一版将 InterPrior 仅视为 student template 是错误的:其原方法含 full-reference InterMimic+ expert、distillation 和 RL post-training。SUGAR 同时含 noisy-prior refiner 与 reference-free tracker/generator,MaskedManipulator 同时含 MimicManipulator teacher、online DAgger 与 masked-goal student,HumanVLA/OmniH2O/HumanPlus/VisualMimic/CWI 已有 state/VL、 privileged-to-sparse、human-shadowing、vision/keypoint 或 MoCap/bimanual teacher 到 deployment actor,GRAIL 与 DeVI 分别从 digital asset/video prior 训练 task-general tracking/downstream visual policy 或 dexterous physics HOI controller。因此:

  • 不能把“teacher + student”或“generated reference + physics”本身写成贡献;
  • GRAIL-Min 和 ResMimic-style adaptation 只能是 RQ-A baseline,不是最终方法名;
  • 论文若要成立,必须证明一个更窄的、可测的差异:跨 reference source 的 robustness、 contact/failure contract、或 new refinement mechanism,并对上述竞争系统作公平讨论。

明确不做什么

  • 不是视频重建。 RePHO 的视频前端不属于项目问题;项目只借用其 per-sequence physics refinement 机制。
  • 不是只修一条好看的动画。 kinematic render 是输入质量诊断,不能替代 physics rollout 和 task metric。
  • 不是部署时复现 reference。 dense reference 只允许存在于 generator、refiner、teacher 和训练期 distillation。
  • 不是只报告成功样本。 任何结果都必须保留总分母、失败数和 unavailable 数。
  • 不是让 refiner 重新规划任务。 validated object goal、scene identity 和 task semantics 不能被 physics stage 静默改写。

Claim ladder

层级 可支持的表述 最低证据
C0 接口有效 能从 task/layout 生成 canonical motion artifact 代码、测试、单 case 输出
C1 Kinematic quality 轨迹满足指定几何、接触和时序 gate 全分母 kinematic metrics + render audit
C2 Physical tracking 某 teacher/refiner 能在物理仿真复现该 trajectory 多 seed rollout、human/object/contact/physics metrics
C3 Task execution rollout 完成 pick–carry–place,而非只跟踪局部 task success、失败归因和 telemetry completeness
C4 Generalization 同一方法能跨 object、scene、motion 或 goal 未见过的明确 split 与置信区间
C5 Autonomous student 无 dense reference 的 student 能自主完成任务 deployment observation audit + held-out task success;不得仅借用 SUGAR/InterPrior/HumanVLA 的外部结论
C6 Unified HSI/HOI 单一 student 支持多类 goal interface 与 long-horizon task 多任务 controlled comparison 与消融

当前公开证据最多到 C1 的单例阶段性状态;C2–C6 均不能由计划或外部论文能力代替。

不可轻易改变的接口约束

  1. Kinematic public input 是 task_plan.jsonlayout_jsonout_dir
  2. canonical motion 保存 human motion、object identity 和 pose trajectory,不内嵌动态物体 mesh。
  3. layout_json + dynamic_object_id 是 geometry consumer boundary。
  4. pipeline_manifest.json 是 provenance,不是 pipeline runtime state。
  5. teacher baseline 排名必须统一 body shape、coordinate frame、object geometry、simulator、budget 和 metric denominator。
  6. student deployment dataloader 必须可证明不含 dense HOI reference 或 future teacher state。

当前状态

  • 已验证: task-first generation 入口、canonical artifact 收口和动态物体 geometry consumer boundary 有代码与测试支持。
  • 阶段性: 一条 597-frame left-hand pick–place motion 通过接口与 kinematic parity;temporal render 仍待人工复核。
  • 当前推断: RePHO-style per-reference refinement、SUGAR-style privileged refiner、 MimicManipulator-style HOI teacher、InterMimic-family tracker 与 GRAIL/ResMimic-style adaptation 都是 RQ-A 候选;没有项目内 controlled result 前,不能选定赢家。
  • 待验证: teacher baseline 排名、contact/finger interface、跨 reference-source robustness、refiner 规模化、teacher-to-student 闭环以及 object-goal-only student 的自主任务成功。

下一步阅读 方法主线,然后按 评测策略 查看哪些比较才是公平比较。