跳转至

Related Work

最后更新:2026-07-24。

本页维护研究定位和方法关系,不记录本项目实验成功。外部论文声称、源码 native capability、本项目 reproduced result 与 adapted result 必须分开;实际运行证据见 Evidence Dashboard

1. Full-body tracking prior

PHC/PHC-XProtoMotions 提供 scene-agnostic humanoid tracking prior。它们适合作为 human tracking control family 或 frozen base policy,但本身不定义动态物体抓取、接触归因或目标物体成功条件。

ResMimic 的核心启发是冻结基础 tracker 并学习 residual correction。PhysHSI 把“control family”与“object/contact observation”拆成独立设计轴;加入 object condition 后必须命名为 adapted architecture,不能称为原始 ResMimic 严格复现。

2. Physics-based HOI imitation

OmniGrasp 以 object-centric goal 驱动物理 humanoid grasp/control,适合测试 pretrained object control 的迁移能力。InterMimic 联合追踪人体、物体和 interaction,是当前 pretrained HOI tracker 家族的关键基线。

PhysHOISkillMimic 代表 contact-aware scratch expert 路线:它们有助于判断 pretrained tracker 是否必要,但 per-reference cost 较高。

ContactMimic 强调位置轨迹不足以唯一确定接触语义;WristMimic 则把较可靠的 body/wrist tracking 与 contact-rich finger control 解耦。这两者分别对应 contact-command 和 noisy finger-reference 消融,不应无条件混入主 baseline。

3. Per-sequence physics refinement

RePHO 以 pretrained InterMimic 初始化 per-sequence refinement,并交替改善 policy rollout 与 motion reference。它最贴合 PhysHSI 的 RQ-A:我们跳过视频重建,只把 generated SMPL-X HOI 当作 noisy kinematic input。

SUGAR 提供“kinematic prior → privileged refiner → distilled tracker/generator”的更完整数据闭环。它适合作为长期系统结构参考,但第一条 overfit 实验只需验证 refiner,而不是同时实现全栈。

GRAIL / GEAR-SONIC 提供生成式控制先验与适配路线。本项目当前只预注册 GRAIL-Min-SMPLX 适配,尚无可排名的 GPU 结果。

4. State-based motor prior 与 student

InterPrior 与本项目最终目标最接近:先从 full-reference expert 蒸馏 motor prior,再进行 state-based RL post-training;部署 actor 接收 current human/object/contact state 和 masked sparse goal,而非 dense HOI trajectory。它回答 teacher data 如何变成自主 policy,不替代 RQ-A refiner。

TokenHSI 将 proprioception 与不同 task observation 编成可组合 token;UniHSI 通过 Chain-of-Contacts 表达 static HSI 的 contact goal;VLM-RMD 用 human–object relative movement 描述 goal/reward。三者是后续 goal-interface baseline,而不是 full-reference teacher baseline。

5. Kinematic HOI 与 scene/task generation

HOI-FHLI 等 kinematic generator 可提供 motion proposal,但不能凭 kinematic render 声称 physics execution。CHORD 等 video-to-data 工作说明大规模 reference generation 的价值;PhysHSI 当前输入来自 SAGE/KIMODO,而不是 video。

6. 本项目的差异化组合

现有方法分别覆盖 motion generation、full-reference physics tracking、per-sequence refinement 或 sparse-goal control。PhysHSI 的论文主张必须由完整闭环支持:

  1. task/scene-conditioned kinematic HOI/HSI generation;
  2. 对 generated motion 噪声显式鲁棒的 physics teacher/refiner;
  3. 保存成功与失败的可审计 rollout dataset;
  4. 不读取 dense reference 的 state-based student;
  5. 从 object-goal-only 扩展到 task/contact/relation goal interface。

这是一项待验证的系统组合假设,不是 related-work 列表本身能够支持的结论。