Teacher Model
最后更新:2026-07-26。
本页是 full-reference Teacher Model 的实验矩阵与执行状态的唯一权威来源。 它回答“哪一个 tracker/refiner 能把 generated SMPL-X reference 变成可信的 physics rollout”。项目级顺序见 Experiments,最终 state-conditioned student 的独立计划见 Student Model。 baseline 定义和 metric 只在 评测策略 维护;每个结果的数值与输出路径在对应实验页维护。
Teacher Model 只消费已经冻结的 canonical reference。motion 的 temporal/geometry QA 与 grasp/contact input quality 由 Kinematic Generation 和 Grasp Refinement 独立负责;它们不是本页 baseline。
方法目标与阶段边界
当前正在比较的是前置 Teacher 阶段:full-reference tracker / refiner 能否把 generated SMPL-X reference 变成可信 teacher rollout。它们的术语不能混用:
- tracker:跟踪 frozen reference 的控制骨干;
- refiner:修正 action、reference 或二者的机制;
- teacher:通过完整 physics gate、可进入 rollout dataset 的 policy/rollout;
- student:部署时不读取 dense reference、仅以 state/geometry/goal 行动的最终 loco-manipulation policy;它的训练和评测不属于本页。
所以 GRAIL、ResMimic、InterMimic、OmniGrasp 和 RePHO 当前都是 teacher-candidate experiments;任何一个在通过 gate 前都不得被称为 teacher 结果或最终方法。
实验矩阵
| 完成 | 工作包 | 对应决策 | 当前事实 | Canonical 页面 |
|---|---|---|---|---|
| — | A0 reference PD/open-loop | raw reference 是否可直接物理执行 | 未找到 current canonical case 的正式 deterministic artifact | 本页 |
| — | A1 frozen PHC-X direct tracking | human-only prior 的直接 tracking 下界 | 历史 597-frame physics-scene diagnostic 已运行;但 source motion/object-task telemetry 与 current canonical contract 不一致,需正式重跑 | 本页 |
| — | A2-R ResMimic-PHC-X | frozen PHC-X + released-style direct action residual | strict runner/contract 已实现;current canonical case 尚无正式 training result | 本页 |
| — | A2-G GRAIL–PULSE-X adaptation | frozen PULSE-X encoder/decoder + GRAIL 48D scene-aware latent residual |
canonical implementation、official-loader parity、zero-residual runtime 与 PPO smoke 已通过;seeds 0/1/2 尚未训练,故没有 teacher result |
GRAIL–PULSE-X |
| ✅ | OmniGrasp zero-shot transfer (legacy case) | object-control prior 是否有可运行信号 | 旧 163-frame cup case 有完整 artifact;它不满足 current full-sequence ranking contract | OmniGrasp |
| ✅ | InterMimic official teacher-specialist checkpoint + fine-tune | official teacher-specialist checkpoint 在 current full reference 上能否适配 | 500e deterministic artifact 已完成;valid 526/597、completion 0,终止于 frame 527 |
本页 |
| ✅ | InterMimic student_new fine-tune |
pretrained HOI tracker 在 current full reference 上能否适配 | 500e→1000e deterministic artifact 已完成;valid 582/597、completion 0,终止于 frame 583 contact mismatch |
本页 |
| — | RePHO A6 | alternating refinement 是否优于 fixed reference | real-input adapter smoke 已完成;alternating refinement rollout 尚未运行 | 本页 |
| — | Shared teacher | per-reference 结果能否规模化 | 尚未开始 | 本页 |
✅ 只表示该行的预定 deliverable 已闭合、原始 artifact 可复核;例如 native
reproduction 完成不表示 project-motion teacher 已成功。其余行不使用“阶段性”或
“待验证”标签,而直接写清已完成的事实与尚缺的可执行证据。
比较规则与当前结果
本页的核心比较是:RePHO-style 的逐序列 policy/reference refinement,是否比 fixed-reference tracker 更能吸收 generated motion 中 wrist、finger 与 contact 的 噪声;pretrained HOI prior 是否比 human-only prior 或 scratch expert 更节省每条 motion 的适配成本。
所有主比较使用同一条 597-frame canonical motion、body shape、scene/object geometry、simulator、control frequency、episode horizon 和 telemetry。native reproduction、旧 shape/reference contract 与 partial clip 只能作为单列诊断,不能 进入主表。deterministic evaluation 与训练时的 stochastic rollout 分开;每个主条件 必须同时报告 completion、lift/hold/place、human/object tracking、contact 与 termination。
OmniGrasp: legacy zero-shot transfer and strict run
旧 163-frame cup transfer 在 zero fine-tuning 下完成 object trajectory,但 body-shape/reference contract 与当前主比较不一致。它仅说明该 cup/scene 上的 pretrained object-control 有可运行信号,不能替代 597-frame full-sequence teacher gate。
在 strict current run 中,保持 observation、reward、48D latent action、PPO、
target-attributed contact 与 0.50 m object termination 不变,从 human-only epoch
400 恢复,并加入 0.25 m whole-body mean-human termination。epoch 700 的
[0,219) deterministic evaluation 为:
| 指标 | 数值 |
|---|---|
| completion | 219/219 |
| human body mean / p95 | 12.03 / 24.06 cm |
| active arm-hand mean / p95 | 12.00 / 21.44 cm |
| object position mean / RMSE / p95 | 4.75 / 6.36 / 11.16 cm |
| max / final lift | 58.00 / 38.58 cm |
| longest lift hold | 108 frames |
| sustained lift success | 1 |
| target-contact gate ratio | 1.0 |
| human/object/fall early termination | false / false / false |
该结果只覆盖 219-frame pick clip。它表明 human termination 能阻止 object-first policy 的严重人体漂移,但仍不能作为 full-sequence teacher 的选择依据。
Pretrained InterMimic and RePHO
同一 597-frame cup reference 的 1-env deterministic zero-shot study 已完成:
| 初始化 | first termination | left arm/hand mean | 说明 |
|---|---|---|---|
| scratch initial | 86 | 71.73 cm |
contact 前失败 |
sub2.pth official teacher specialist |
87 | 11.01 cm |
contact 前失败 |
student_new.pth RePHO general student |
87 | 11.56 cm |
contact 前失败 |
预训练 policy 改善了初始人体跟踪,但没有修复 frame 76--77 的 contact mismatch。
后续 fixed-reference 对照只加载 model、running_mean_std 与
amp_input_mean_std,不恢复 optimizer、epoch 或环境状态。其评估顺序固定为首次
termination、completion、最后一个 physics-valid frame 的 object error、required
contact hold 和 left arm/hand error。
InterMimic official teacher-specialist checkpoint + fine-tune ✅
InterMimic 发布的 teacher-specialist checkpoint(文件名 sub2.pth)以 init_from
启动 500 epoch full-reference fine-tune。环境同样读取 motion_file 与
sourceMotion,故属于 Teacher Model:
| checkpoint | valid frames | full completion | contact F1 | lift success | human body mean | object position mean | 末有效帧 object position error |
|---|---|---|---|---|---|---|---|
| official teacher-specialist zero-shot | 86/597 |
0 |
0 |
0 |
9.53 cm |
1.61 cm |
unavailable |
| fine-tune 500e | 526/597 |
0 |
0.990 |
1 |
14.18 cm |
11.13 cm |
46.08 cm |
它学到 lift 与 required contact hold,但在 frame 527 终止,且 human/object
tracking 都比后续的 student_new fine-tune 弱。因此该条件完成了可复核的
fine-tune/evaluation,但没有通过 full-sequence teacher gate。
InterMimic student_new fine-tune ✅
student_new.pth 是 RePHO 发布的预训练 checkpoint 名称,不是本项目最终的
reference-free Student Model。它在这次实验中以 init_from 初始化 500 epoch 的
InterMimic full-reference training,1000 epoch 运行再从 500 epoch checkpoint
resume。两个环境配置都读取 motion_file 与 sourceMotion,所以这是 Teacher
Model 的 pretrained tracker fine-tune。
| checkpoint | valid frames | full completion | contact F1 | lift success | human body mean | object position mean | 末有效帧 object position error |
|---|---|---|---|---|---|---|---|
zero-shot student_new |
86/597 |
0 |
0 |
0 |
8.09 cm |
1.61 cm |
unavailable |
| fine-tune 500e | 582/597 |
0 |
0.993 |
1 |
9.32 cm |
5.70 cm |
27.67 cm |
| fine-tune 1000e | 582/597 |
0 |
0.995 |
1 |
8.38 cm |
5.63 cm |
30.38 cm |
fine-tune 已把 rollout 从 frame 87 推进到 frame 583,并学到 lift 与 required contact hold;但两次仍在同一 frame 因 contact mismatch 终止,full completion 仍为 0。1000e 相对 500e 改善 human tracking 和 contact F1,却没有突破终止帧, 也没有改善末有效帧 object position error。因此它是一个已完成、但尚未通过 full-sequence teacher gate 的 pretrained-InterMimic 结果。
旧 PHC-X direct-residual GRAIL-Min 的 E0 formal clean exit 已通过、E1 曾被 SONIC hand-action loader defect 阻断;该链只保留为 legacy evidence。Canonical GRAIL–PULSE-X 已独立完成 official-loader parity、zero-residual runtime 与真实 PPO smoke。Zero-residual 在 frame 109 前提前终止,说明 frozen base 不是稳定 teacher;这不否定代码合同,也不能替代三 seed residual-policy 训练。
RePHO 的 real-input adapter smoke 已完成:它使用 canonical motion 与真实 cup
geometry,生成 [597,591] finite tracking tensor 和 hash-identical humanoid XML。
正式 alternating run 仍需在独立 GPU 上完成 forward/backward policy/reference
update 后,再报告 refined rollout。
所有上述运行目录、源码位置和复现命令属于工程实现细节,统一见 Implementation Details;本页只保留它们支持 或尚不支持的实验结论。
执行顺序与 stop gate
Phase 0:冻结输入
- 完成 current 597-frame temporal render manual review。
- 固定 body-shape、geometry、coordinate 和 active-hand contract。
- 为所有 teacher adapter 生成同一 case manifest。
任何一项失败则不进行 architecture ranking。
Phase 1:single-case teacher-candidate comparison
1A:直接下界(不训练)
- A0 reference PD/open-loop。
- A1 frozen PHC-X direct tracking。
- ProtoMotions 仅作 body-tracking diagnostic;由于当前 full HOI hand/object contract 不等价,它不进入 primary teacher 排名。
1B:tracker-correction system baselines
- A2-R ResMimic-style PHC-X adaptation:保留 direct
base action + residualcontrol、current-object observation、reward 和 PPO;只做 SMPL-X/reference/scene contract 必需适配。 - A2-G GRAIL-style PULSE-X adaptation:保留 GRAIL observation、reward、termination 和
PPO;用 frozen PULSE-X reference encoder/decoder 执行
48Dlatent residual。 代码修改与 Layer A/B 验收已完成; 本项保持未勾选,直到唯一训练条件的三个 seed 与正式评估结束。
这两个条件必须共享 reference、shape、scene/object geometry、evaluation budget 和 telemetry,但分别保留 PHC-X direct action 与 PULSE-X latent action 的上游 controller contract。它们是 system-level baseline,不是只改变 scene awareness 的单因素消融。二者都属于 per-reference teacher candidate,不是最终 student。
1C:HOI prior、reference refinement 与 no-prior 对照
- A4 pretrained InterMimic full-reference tracker 严格适配。
- OmniGrasp 作为 object-control diagnostic,单列报告;它不能以部分 clip 的 object 结果代替 full-reference teacher ranking。
- A6 RePHO-style per-reference alternating policy/reference refinement。
- A8 scratch contact-aware expert。
先做 single-case multi-seed overfit。只有完整 human/object/contact telemetry 的 结果进入表格;GRAIL 的 runtime defect 不得被其他条件静默绕过或从比较中删除。
Phase 2:因果消融
- base action vs action residual;
- fixed reference vs reference residual;
- fixed policy vs alternating policy/reference;
- body-only vs fingertip/contact condition;
- per-reference vs shared refiner。
Phase 3:teacher dataset
- 扩展 object/scene/motion split;
- 记录成功与失败 rollout;
- 自动 quality filtering;
- 冻结 teacher dataset schema 与 provenance。
交接给 Student Model 的门槛
单条 case 只有在 G3 single-case teacher gate 通过、成功和失败 rollout 都被记录、 并且 teacher/config/reference provenance 冻结后,才能成为 student pilot dataset。 要宣称多 case teacher 或支持 held-out student 泛化,则还需 G4 multi-case teacher gate。之后的蒸馏、state-based RL、reference-leakage audit 与 goal-interface 扩展 只在 Student Model 中排程。
当前阻断项
- Kinematic case 的 manual temporal QA 尚未签字。
- RePHO 尚无 PhysHSI canonical motion/shape/geometry adapter。
- GRAIL–PULSE-X Layer A/B 已通过;唯一剩余主项是按冻结配置启动
seeds
0/1/2并完成 deterministic full-sequence evaluation。
接下来怎么做
- 先冻结一条 canonical SMPL-X pick–place input,并完成 temporal review。
- 在同一 input 上建立 direct lower bound,再比较 ResMimic-style PHC-X adaptation 与 GRAIL-style PULSE-X adaptation 两条 tracker-correction 路线;后者使用 frozen PULSE-X latent controller,不是 frozen-PHC-X direct action。
- 将 InterMimic、OmniGrasp、RePHO 和 scratch expert 分别作为 HOI prior、 policy/reference refinement 与 no-prior 对照;不把它们混入 Generation 比较。
- 只有至少一个条件通过 physics gate,才冻结 rollout dataset 并交给 Student Model 训练 state-conditioned, perception-ready loco-manipulation policy。