跳转至

Teacher Model

最后更新:2026-07-26。

本页是 full-reference Teacher Model 的实验矩阵与执行状态的唯一权威来源。 它回答“哪一个 tracker/refiner 能把 generated SMPL-X reference 变成可信的 physics rollout”。项目级顺序见 Experiments,最终 state-conditioned student 的独立计划见 Student Model。 baseline 定义和 metric 只在 评测策略 维护;每个结果的数值与输出路径在对应实验页维护。

Teacher Model 只消费已经冻结的 canonical reference。motion 的 temporal/geometry QA 与 grasp/contact input quality 由 Kinematic GenerationGrasp Refinement 独立负责;它们不是本页 baseline。

方法目标与阶段边界

当前正在比较的是前置 Teacher 阶段:full-reference tracker / refiner 能否把 generated SMPL-X reference 变成可信 teacher rollout。它们的术语不能混用:

  • tracker:跟踪 frozen reference 的控制骨干;
  • refiner:修正 action、reference 或二者的机制;
  • teacher:通过完整 physics gate、可进入 rollout dataset 的 policy/rollout;
  • student:部署时不读取 dense reference、仅以 state/geometry/goal 行动的最终 loco-manipulation policy;它的训练和评测不属于本页。

所以 GRAIL、ResMimic、InterMimic、OmniGrasp 和 RePHO 当前都是 teacher-candidate experiments;任何一个在通过 gate 前都不得被称为 teacher 结果或最终方法。

实验矩阵

完成 工作包 对应决策 当前事实 Canonical 页面
A0 reference PD/open-loop raw reference 是否可直接物理执行 未找到 current canonical case 的正式 deterministic artifact 本页
A1 frozen PHC-X direct tracking human-only prior 的直接 tracking 下界 历史 597-frame physics-scene diagnostic 已运行;但 source motion/object-task telemetry 与 current canonical contract 不一致,需正式重跑 本页
A2-R ResMimic-PHC-X frozen PHC-X + released-style direct action residual strict runner/contract 已实现;current canonical case 尚无正式 training result 本页
A2-G GRAIL–PULSE-X adaptation frozen PULSE-X encoder/decoder + GRAIL 48D scene-aware latent residual canonical implementation、official-loader parity、zero-residual runtime 与 PPO smoke 已通过;seeds 0/1/2 尚未训练,故没有 teacher result GRAIL–PULSE-X
OmniGrasp zero-shot transfer (legacy case) object-control prior 是否有可运行信号 旧 163-frame cup case 有完整 artifact;它不满足 current full-sequence ranking contract OmniGrasp
InterMimic official teacher-specialist checkpoint + fine-tune official teacher-specialist checkpoint 在 current full reference 上能否适配 500e deterministic artifact 已完成;valid 526/597、completion 0,终止于 frame 527 本页
InterMimic student_new fine-tune pretrained HOI tracker 在 current full reference 上能否适配 500e→1000e deterministic artifact 已完成;valid 582/597、completion 0,终止于 frame 583 contact mismatch 本页
RePHO A6 alternating refinement 是否优于 fixed reference real-input adapter smoke 已完成;alternating refinement rollout 尚未运行 本页
Shared teacher per-reference 结果能否规模化 尚未开始 本页

只表示该行的预定 deliverable 已闭合、原始 artifact 可复核;例如 native reproduction 完成不表示 project-motion teacher 已成功。其余行不使用“阶段性”或 “待验证”标签,而直接写清已完成的事实与尚缺的可执行证据。

比较规则与当前结果

本页的核心比较是:RePHO-style 的逐序列 policy/reference refinement,是否比 fixed-reference tracker 更能吸收 generated motion 中 wrist、finger 与 contact 的 噪声;pretrained HOI prior 是否比 human-only prior 或 scratch expert 更节省每条 motion 的适配成本。

所有主比较使用同一条 597-frame canonical motion、body shape、scene/object geometry、simulator、control frequency、episode horizon 和 telemetry。native reproduction、旧 shape/reference contract 与 partial clip 只能作为单列诊断,不能 进入主表。deterministic evaluation 与训练时的 stochastic rollout 分开;每个主条件 必须同时报告 completion、lift/hold/place、human/object tracking、contact 与 termination。

OmniGrasp: legacy zero-shot transfer and strict run

旧 163-frame cup transfer 在 zero fine-tuning 下完成 object trajectory,但 body-shape/reference contract 与当前主比较不一致。它仅说明该 cup/scene 上的 pretrained object-control 有可运行信号,不能替代 597-frame full-sequence teacher gate。

在 strict current run 中,保持 observation、reward、48D latent action、PPO、 target-attributed contact 与 0.50 m object termination 不变,从 human-only epoch 400 恢复,并加入 0.25 m whole-body mean-human termination。epoch 700 的 [0,219) deterministic evaluation 为:

指标 数值
completion 219/219
human body mean / p95 12.03 / 24.06 cm
active arm-hand mean / p95 12.00 / 21.44 cm
object position mean / RMSE / p95 4.75 / 6.36 / 11.16 cm
max / final lift 58.00 / 38.58 cm
longest lift hold 108 frames
sustained lift success 1
target-contact gate ratio 1.0
human/object/fall early termination false / false / false

该结果只覆盖 219-frame pick clip。它表明 human termination 能阻止 object-first policy 的严重人体漂移,但仍不能作为 full-sequence teacher 的选择依据。

Pretrained InterMimic and RePHO

同一 597-frame cup reference 的 1-env deterministic zero-shot study 已完成:

初始化 first termination left arm/hand mean 说明
scratch initial 86 71.73 cm contact 前失败
sub2.pth official teacher specialist 87 11.01 cm contact 前失败
student_new.pth RePHO general student 87 11.56 cm contact 前失败

预训练 policy 改善了初始人体跟踪,但没有修复 frame 76--77 的 contact mismatch。 后续 fixed-reference 对照只加载 modelrunning_mean_stdamp_input_mean_std,不恢复 optimizer、epoch 或环境状态。其评估顺序固定为首次 termination、completion、最后一个 physics-valid frame 的 object error、required contact hold 和 left arm/hand error。

InterMimic official teacher-specialist checkpoint + fine-tune

InterMimic 发布的 teacher-specialist checkpoint(文件名 sub2.pth)以 init_from 启动 500 epoch full-reference fine-tune。环境同样读取 motion_filesourceMotion,故属于 Teacher Model:

checkpoint valid frames full completion contact F1 lift success human body mean object position mean 末有效帧 object position error
official teacher-specialist zero-shot 86/597 0 0 0 9.53 cm 1.61 cm unavailable
fine-tune 500e 526/597 0 0.990 1 14.18 cm 11.13 cm 46.08 cm

它学到 lift 与 required contact hold,但在 frame 527 终止,且 human/object tracking 都比后续的 student_new fine-tune 弱。因此该条件完成了可复核的 fine-tune/evaluation,但没有通过 full-sequence teacher gate。

InterMimic student_new fine-tune

student_new.pth 是 RePHO 发布的预训练 checkpoint 名称,不是本项目最终的 reference-free Student Model。它在这次实验中以 init_from 初始化 500 epoch 的 InterMimic full-reference training,1000 epoch 运行再从 500 epoch checkpoint resume。两个环境配置都读取 motion_filesourceMotion,所以这是 Teacher Model 的 pretrained tracker fine-tune。

checkpoint valid frames full completion contact F1 lift success human body mean object position mean 末有效帧 object position error
zero-shot student_new 86/597 0 0 0 8.09 cm 1.61 cm unavailable
fine-tune 500e 582/597 0 0.993 1 9.32 cm 5.70 cm 27.67 cm
fine-tune 1000e 582/597 0 0.995 1 8.38 cm 5.63 cm 30.38 cm

fine-tune 已把 rollout 从 frame 87 推进到 frame 583,并学到 lift 与 required contact hold;但两次仍在同一 frame 因 contact mismatch 终止,full completion 仍为 0。1000e 相对 500e 改善 human tracking 和 contact F1,却没有突破终止帧, 也没有改善末有效帧 object position error。因此它是一个已完成、但尚未通过 full-sequence teacher gate 的 pretrained-InterMimic 结果。

旧 PHC-X direct-residual GRAIL-Min 的 E0 formal clean exit 已通过、E1 曾被 SONIC hand-action loader defect 阻断;该链只保留为 legacy evidence。Canonical GRAIL–PULSE-X 已独立完成 official-loader parity、zero-residual runtime 与真实 PPO smoke。Zero-residual 在 frame 109 前提前终止,说明 frozen base 不是稳定 teacher;这不否定代码合同,也不能替代三 seed residual-policy 训练。

RePHO 的 real-input adapter smoke 已完成:它使用 canonical motion 与真实 cup geometry,生成 [597,591] finite tracking tensor 和 hash-identical humanoid XML。 正式 alternating run 仍需在独立 GPU 上完成 forward/backward policy/reference update 后,再报告 refined rollout。

所有上述运行目录、源码位置和复现命令属于工程实现细节,统一见 Implementation Details;本页只保留它们支持 或尚不支持的实验结论。

执行顺序与 stop gate

Phase 0:冻结输入

  • 完成 current 597-frame temporal render manual review。
  • 固定 body-shape、geometry、coordinate 和 active-hand contract。
  • 为所有 teacher adapter 生成同一 case manifest。

任何一项失败则不进行 architecture ranking。

Phase 1:single-case teacher-candidate comparison

1A:直接下界(不训练)

  • A0 reference PD/open-loop。
  • A1 frozen PHC-X direct tracking。
  • ProtoMotions 仅作 body-tracking diagnostic;由于当前 full HOI hand/object contract 不等价,它不进入 primary teacher 排名。

1B:tracker-correction system baselines

  • A2-R ResMimic-style PHC-X adaptation:保留 direct base action + residual control、current-object observation、reward 和 PPO;只做 SMPL-X/reference/scene contract 必需适配。
  • A2-G GRAIL-style PULSE-X adaptation:保留 GRAIL observation、reward、termination 和 PPO;用 frozen PULSE-X reference encoder/decoder 执行 48D latent residual。 代码修改与 Layer A/B 验收已完成; 本项保持未勾选,直到唯一训练条件的三个 seed 与正式评估结束。

这两个条件必须共享 reference、shape、scene/object geometry、evaluation budget 和 telemetry,但分别保留 PHC-X direct action 与 PULSE-X latent action 的上游 controller contract。它们是 system-level baseline,不是只改变 scene awareness 的单因素消融。二者都属于 per-reference teacher candidate,不是最终 student。

1C:HOI prior、reference refinement 与 no-prior 对照

  • A4 pretrained InterMimic full-reference tracker 严格适配。
  • OmniGrasp 作为 object-control diagnostic,单列报告;它不能以部分 clip 的 object 结果代替 full-reference teacher ranking。
  • A6 RePHO-style per-reference alternating policy/reference refinement。
  • A8 scratch contact-aware expert。

先做 single-case multi-seed overfit。只有完整 human/object/contact telemetry 的 结果进入表格;GRAIL 的 runtime defect 不得被其他条件静默绕过或从比较中删除。

Phase 2:因果消融

  • base action vs action residual;
  • fixed reference vs reference residual;
  • fixed policy vs alternating policy/reference;
  • body-only vs fingertip/contact condition;
  • per-reference vs shared refiner。

Phase 3:teacher dataset

  • 扩展 object/scene/motion split;
  • 记录成功与失败 rollout;
  • 自动 quality filtering;
  • 冻结 teacher dataset schema 与 provenance。

交接给 Student Model 的门槛

单条 case 只有在 G3 single-case teacher gate 通过、成功和失败 rollout 都被记录、 并且 teacher/config/reference provenance 冻结后,才能成为 student pilot dataset。 要宣称多 case teacher 或支持 held-out student 泛化,则还需 G4 multi-case teacher gate。之后的蒸馏、state-based RL、reference-leakage audit 与 goal-interface 扩展 只在 Student Model 中排程。

当前阻断项

  • Kinematic case 的 manual temporal QA 尚未签字。
  • RePHO 尚无 PhysHSI canonical motion/shape/geometry adapter。
  • GRAIL–PULSE-X Layer A/B 已通过;唯一剩余主项是按冻结配置启动 seeds 0/1/2 并完成 deterministic full-sequence evaluation。

接下来怎么做

  1. 先冻结一条 canonical SMPL-X pick–place input,并完成 temporal review。
  2. 在同一 input 上建立 direct lower bound,再比较 ResMimic-style PHC-X adaptation 与 GRAIL-style PULSE-X adaptation 两条 tracker-correction 路线;后者使用 frozen PULSE-X latent controller,不是 frozen-PHC-X direct action。
  3. 将 InterMimic、OmniGrasp、RePHO 和 scratch expert 分别作为 HOI prior、 policy/reference refinement 与 no-prior 对照;不把它们混入 Generation 比较。
  4. 只有至少一个条件通过 physics gate,才冻结 rollout dataset 并交给 Student Model 训练 state-conditioned, perception-ready loco-manipulation policy。