Chengkai Hou
Peking University
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- Demo-JEPA: ワンショット異種エンボディメント模倣のための共同埋め込み予測アーキテクチャ模倣学習2026/5/1
デモンストレーションを動作ではなく将来の目標状態として捉え、JEPAベースの世界モデルで視覚デモを目標エージェントの潜在軌跡に変換し、自己の学習済みダイナミクスで計画・実行する異種エンボディメント模倣フレームワークを提案。
- HEX: 人間型アライメント専門家によるクロスエンボディ全身操作全身操作/VLA2026/4/1
全身協調操作を実現するため、人間型ロボットに特化した状態中心フレームワークHEXを提案。多様な身体構造に適用可能な状態表現と、全身協調と時間的運動ダイナミクスをモデル化する専門家混合機構を導入し、実機での操作成功率と汎化性能を向上させた。
- URDF-Anything+: シミュレーション可能な関節物体を単一画像からエンドツーエンド生成sim2real2026/3/1
単一のRGB画像から、関節パラメータを含むシミュレーション実行可能なURDFモデルを自己回帰拡散モデルで直接生成する手法を提案。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- RoboMIND 2.0:汎用身体知能のためのマルチモーダル両腕移動マニピュレーションデータセットマニピュレーション2025/12/1
6種類のロボットで集めた31万件超の両腕操作・移動マニピュレーション軌道(触覚・シミュレーション含む)を公開し、階層型VLM+VLAシステムMIND-2を提案した論文。
- URDF-Anything: 3Dマルチモーダル言語モデルによる関節物体の構築sim2real2025/11/1
点群とテキストを入力とする3Dマルチモーダル大規模言語モデルで、関節物体の幾何分割と運動学パラメータをエンドツーエンドに予測し、ロボットシミュレーション用デジタルツインを自動生成する手法を提案。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- SpikePingpong:スパイク視覚を用いた高速・低速卓球ロボットシステムマニピュレーション2025/6/1
スパイク視覚と模倣学習を組み合わせ、高速な球検出と軌道予測を行うファスト・スローシステムで高精度なロボット卓球を実現した。
- H2R: 動画からのロボット事前学習のための人間からロボットへのデータ拡張sim2real2025/5/1
一人称視点の人間動画をロボット視点の映像に変換するデータ拡張パイプラインH2Rを提案し、人間とロボットの見た目のギャップを埋めることで、シミュレーションと実機の両方で下流タスクの成功率を向上させた。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- DAG-Plan: 双腕協調プランニングのための有向非巡回依存グラフ生成双腕マニピュレーション2024/6/1
自然言語指示をLLMで有向非巡回グラフ(DAG)に変換し、双腕ロボットの並列実行と適応的なタスク割り当てを実現するプランニング手法を提案した。