跳转至

Related Work

最后更新:2026-07-27。本文只维护论文定位;外部论文能力、官方 release、项目复现和 adapted result 严格分开。完整检索协议、纳入表和逐条来源见 2026-07-27 Deep-Research Audit

先修正论文边界

PhysHSI 不能声称首次提出“kinematic HOI/HSI → physics teacher/refiner → 无 dense reference student”的总体结构:SUGAR 已有 noisy prior→privileged refiner→reference-free tracker/generator,InterPrior 先训练 full-reference expert 后蒸馏/RL post-train,HumanVLA 已有 teacher→vision-language student。GRAIL 也从数字资产/视频先验得到 robot-trackable 4D HOI、训练 SONIC adaptations,再训练 egocentric policy。

因此本项目当前是一个待验证的 SMPL-X generated-reference physics problem:在固定 scene/object/body/contact contract 下,哪种 teacher/refiner 能把有噪声的外部 canonical motion 变为可审计 rollout,以及这种 rollout 是否能改善 reference-free student。这个问题 的差异化必须来自受控证据、跨输入源鲁棒性、contact/failure contract 或新的算法,不能来自 把已有 pipeline 重新画一遍。

1. Kinematic HSI/HOI generation 与 scene interface

HUMANISESceneDiffuserTRUMANSLINGO 建立了 language/scene-conditioned HSI 的主要谱系。CHOIS 把 language、initial human/object state 与 sparse object waypoints 转为 synchronized human/object motion,因而是 SAGE path-conditioned proposal 的直接 generation comparison。

近年的 HSI-GPTSceneMIHOSIGDyn-HSISSOMotionDIPInterPhysPAMotion 进一步覆盖 noisy in-betweening、dynamic scenes、semantic occupancy、unpaired scenes、 force/contact-aware kinematic generation 和 multi-object interaction。它们大多不是 physics closed-loop teacher,故可作为 input/reference quality comparison,而不能用 trajectory render 代替 physics execution。

HOI-FHLI 在这一层尤其关键:它不是单纯的 kinematic generator,而是 LLM plan → full-body, finger and object motion → RL physics tracker 的端到端系统。本仓库已 checkout 的官方 release 也包含 Isaac Gym physics_tracking/。对 PhysHSI 而言,它既是 external reference generator,也是 direct physics tracker baseline family。

DeVI 是另一个应直接对照的 generated-input system:它从 text-conditioned synthetic HOI video 提取 3D human 与 2D object 的 hybrid imitation target, 再以 hybrid tracking reward 学习 dexterous physics controller。其对象 target 与 PhysHSI 的 canonical 3D object trajectory 不同,且官方仓库仍为待发布的 code stub;这仅影响可复现性, 不消除其对“生成 input → physics HOI”主张的论文优先性。

2. Instruction / VLM / script 到物理 HSI

HOI-FHLI、SIMSBiBoVLM-RMD 已分别覆盖 LLM execution plan、RAG long script、 VLM instruction compiler + physical-feedback executor,以及 VLM-generated relation goal/ reward 到 physics policy。故 PhysHSI 不应以“task semantics 驱动物理 humanoid”为独有 贡献。

它们仍留下可区分的边界:BiBo 的公开 simulator/planner 尚未 release,且其手部是 key-joint IK,不是 articulated SMPL-X finger tracking;VLM-RMD 的公开 repo 截至审计日只含 project/ dataset assets,不含可执行 policy source;SIMS 的 repo 仍声明 code/data 待发布。这些是 reproducibility facts,不是削弱其论文优先权的理由。

3. Physics-based HOI imitation 与 residual adaptation

PhysHOISkillMimic 是 scratch contact-aware expert 下界; OmniGrasp 是 object-centric control diagnostic; InterMimic 是 pretrained full-reference HOI tracker family 的关键 baseline。

ResMimic 以 frozen general motion tracker 加 object-conditioned direct-action residual,并使用 object/contact reward 和 virtual-force curriculum。任何 PHC-X direct residual 都是 ResMimic-style adaptation,而非严格复现。 PULSE 提供物理 motion-latent controller,官方仓库 也暴露 SMPL-X PULSE-X preview task;但是原始 PULSE 论文报告的是 32D latent,而本项目 PULSE-X checkpoint 的 48D interface 属于须单独核验的 checkpoint contract。 MaskedMimic 是强大的 masked partial-reference physics prior,但当前官方预训练模型卡明确为 SMPL checkpoint,不能把 ProtoMotions 对 SMPL-X morphology 的支持误写成“现成 SMPL-X 手部 tracker”。 TWIST 已公开完整的 retargeted human/MoCap → RL+BC whole-body tracking/teleoperation code、data 和 checkpoint; Expert-Guided Imitation 则在 真实机器人 box pick--carry--place 中将上肢/root human reference 与 walking expert BC 结合。它们不等价于 dense object/contact HOI teacher,却排除了“human reference + physics whole-body controller”作为空白。 H2O/OmniH2O 更早已经从 human-motion retargeting 训练 privileged policy,再蒸馏为 sparse-sensor sim-to-real controller,并支持手部 teleoperation 和 autonomous skills;HumanPlus 从 human shadowing 收集实机 whole-body demonstrations 后训练 egocentric skill policy。因此文中必须把 “external/generated SMPL-X 的 object/contact failure contract”限定为待验证差异,不能把 human-motion-to-autonomy data path 本身当作贡献。 GRAIL 的 manipulation branch 则是 frozen SONIC encoder/FSQ/decoder 上的 latent residual 加 binary hand primitive;任何 SMPL-X/PULSE-X integration 也是 GRAIL-style baseline/adaptation,不能写成新 controller family。

MaskedManipulator 更直接:其 MimicManipulator 是 full-reference SMPL-X physics tracker,随后以 online DAgger 蒸馏为 masked body/object spatio-temporal goal policy,并设计 approach/engagement/release 分阶段 contact reward。这是 teacher 与 student 两层都必须对照的直接系统,而不只是“SMPL-X manipulation 证据”。ULTRA 已把 physics-driven retargeting、dense tracking 与 sparse-goal/egocentric autonomous loco-manipulation 连成一个 G1 系统;CWI 也从 whole-body MoCap teacher 得到只读 bimanual hand pose/command 的 deployment actor; HumanoidMimicGen 则以 whole-body planning 产生 physics data 再训练 visuomotor policy。因此“先 tracker、后感知 student”不能作为整体结构 新颖性,最多是需要在 generated SMPL-X reference 条件下被严格比较的工程/研究设定。 VisualMimic 也已经通过 teacher–student 训练低层 human-motion keypoint tracker,再从 egocentric vision/proprioception 生成高层 keypoint command。它不解决 dense object/contact reference,却是 perception-ready hierarchical student 的直接结构性反例。

ContactMimic 表明 keypoint trajectory 不足以指定 functional contact;WristMimic 则表明 human finger-pose replay 可能过度约束接触丰富的手。前者应影响 contact-command interface,后者应形成 finger-posewrist + object/contact 的明确消融,而不是把 finger 当作普通 joint index mapping。

4. Noisy reference refinement 与 teacher-to-student bridge

RePHO 从 InterMimic 初始化 forward/backward tracker, 以 rollout 更新 noisy reference buffer,是 per-sequence physics refinement 的直接基线。 本项目不做其 monocular video 前端,但可以在同一 generated SMPL-X input 上复用其 policy/reference refinement 闭环。

SUGAR 已公开更完整的 noisy kinematic prior → privileged refiner → refined rollout dataset → command tracker/generator 闭环; InterPrior 的 full-reference expert、variational distillation 与 RL post-training 已覆盖 teacher/student bridge; HumanVLA 则已有 physical state teacher → vision-language student 的开源实现。它们是最终 student 路线的首要竞争系统,而不只是 可随意借用的架构灵感。

ComplexMimic 进一步直接处理 imperfect MoCap 与 complex 3D scene,使用 imitation/interaction experts 和 difficulty-aware distillation; InterReal 则以 contact-constrained augmentation 和 automatic reward learner 改进 HOI tracking。二者压缩了“生成 input 有噪声”可主张的空间。

5. 当前可支持的最窄论文表述

只有完整实验闭环后,PhysHSI 才可表述为:

  1. 在受控 SMPL-X/reference/scene/object/contact contract 下建立公平 teacher selection;
  2. 证明某个 refinement mechanism 对 generated input 的 failure modes 有可重复收益;
  3. 保存成功和失败 rollout,并证明它们训练出的 deployment actor 不读 dense reference;
  4. 在 held-out object/scene/reference-source 上报告 generalization。

这是一项待验证的研究计划,不是外部 related work 自动授予的贡献。当前可运行或阶段性 artifact 只能进入 Evidence Dashboard,不能升格为 paper result。