Shaoting Zhu
Tsinghua University
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WB-WAM:ヒューマノイド移動操作のための異種全身・手事前学習VLA2026/9/28
身体・ルート・巧みな手の動作を統合した行動空間で動画と行動を事前学習し、人間の動作データを活用してヒューマノイドの移動操作をデータ効率的に学習する手法を提案。
- 足音のこだま:ゲート付き記憶を用いた知覚型ヒューマノイドパルクール歩行2026/9/24
オンボード深度のみを使い、ゲート付き記憶と顕著性誘導の時間知覚で足場の少ない不連続地形を安定して走破するヒューマノイドパルクール手法を提案。
- TactileStep: 足裏触覚学習によるヒューマノイド歩行の接地制御歩行2026/9/24
足裏の圧力センサを歩行制御に統合し、接地フェーズに応じた報酬で着地衝撃と騒音を抑えつつ支持安定性を高める学習フレームワークを提案。
- G0.5: ロボットの推論と行動のための単一自己回帰ストリームVLA2026/8/1
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
- OMG: 汎用人型ロボット制御のための全モーダル動作生成全身制御/動作生成2026/6/1
多様な入力モダリティ(言語、音声、人間の参照動作)に基づいて全身動作を生成する拡散モデルを提案し、データキュレーションと階層的制御構造により汎用的な人型ロボット制御を実現した。
- 最適化としての生成的制御:適応的で堅牢なロボット制御のための時間無条件フローマッチングVLA2026/3/1
行動生成を軌道積分ではなく反復最適化として扱う時間無条件フレームワークGeCOを提案し、状態の難易度に応じて計算量を適応させ、OOD検出も可能にした。
- TTT-Parkour: 知覚型ロボットパルクールのための高速テスト時訓練歩行2026/2/1
RGB-Dで実地形を高精度に再構成し、その上で方策を高速微調整するreal-to-sim-to-real手法により、人型ロボットが未知の複雑地形を10分以内で走破できるようにした。
- 知覚を統合した全身パルクール制御全身制御2026/1/1
外界センシングを全身運動追跡に統合し、不整地でも跳び越えやダイブロールなどの動的な多接触動作を人型ロボットで実現する枠組みを提案した。
- 荒野をハイキング:ヒューマノイドのためのスケーラブルな知覚型パルクールフレームワーク歩行2026/1/1
生の深度画像と固有感覚から直接関節動作を生成する単段階強化学習により、ヒューマノイドが複雑な地形を最大2.5m/sで走破できる知覚型パルクールフレームワークを提案。
- MoE-Loco:複数タスク歩行のための専門家混合歩行2025/3/1
脚型ロボットの多様な地形・歩容に対応する単一ポリシーを、専門家混合(MoE)で勾配衝突を抑えつつ学習させる手法を提案し、実機でも検証した。
- RoboEngine: セマンティックロボットセグメンテーションと背景生成によるプラグアンドプレイなロボットデータ拡張データ拡張2025/3/1
ロボットのセグメンテーションと背景生成を組み合わせ、数行のコードで物理・タスクを考慮した視覚データ拡張を可能にするツールキットを提案。単一シーンのデモから6つの新規シーンへの汎化を実現し、性能を200%以上向上させた。
- VR-Robo:実環境からシミュレーションを経て実環境へ戻す、視覚的ロボットナビゲーションと歩行のためのフレームワークsim2real2025/2/1
多視点画像から3Dガウススプラッティングでフォトリアルなデジタルツイン環境を構築し、強化学習で視覚的目標追跡を学習させることで、RGBのみのsim-to-real転移を実現した。
- 堅牢なロボット歩行: 小さな罠を越える俊敏な移動の学習歩行2024/9/1
固有感覚入力のみを用いた二段階学習フレームワークにより、四足ロボットが小さな障害物を安定して通過できるようにした研究。
- SARO: 視覚言語モデルによる3D地形を横断する空間認識ロボットシステム歩行2024/7/1
視覚言語モデルを高レベル推論に用い、タスク分解と閉ループ実行、強化学習による低レベル制御を組み合わせて、四足ロボットが3D地形を横断して目標地点に到達できるシステムを構築した。