Zongqing Lu
Peking University
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PLAT: 特権潜在遷移学習によるヒューマノイド制御のためのスパース時間指定キーフレーム動作追従ヒューマノイド制御2026/9/22
スパースなキーフレームと到達時刻のみから全身動作を生成するヒューマノイド制御フレームワークPLATを提案し、シミュレーションとUnitree G1実機で有効性を示した。
- 身体性知能のための世界モデル:もっともらしさから制御可能性、そして行動可能性へ世界モデル2026/9/15
身体性知能における世界モデルを、もっともらしさ・制御可能性・行動可能性の3段階の能力レベルで整理し、操作・ナビゲーション・歩行・自動運転などの研究を横断的に調査したサーベイ。
- 器用なロボット操作のための人間中心の転移可能な触覚事前学習触覚/操作2026/7/1
人間の触覚データを大規模に収集し、ロボット操作のための触覚事前学習手法を提案した論文。
- EgoTactile: 一人称視点ビデオから日常物体の把持圧力を学習する触覚推定2026/6/8
一人称視点ビデオと全手の圧力データを組み合わせたベンチマークを構築し、拡散モデルを用いて視覚情報から把持圧力を推定する手法を提案した。
- EgoPressDiff: 自己中心視点のUV領域手圧力推定のためのマルチモーダルビデオ拡散触覚推定/拡散モデル2026/6/5
自己中心視点の映像から手の表面圧力を推定する新しいビデオ拡散フレームワークを提案。手のポーズと3Dメッシュ頂点、深度情報を組み合わせて圧力場を生成し、従来手法より精度を大幅に向上させた。
- RealDexUMI: 器用なロボット学習のためのウェアラブル汎用操作インターフェーステレオペレーション/器用操作2026/6/1
手先の細かい操作を保ちつつ実機展開可能なデモ収集を実現するため、共有の器用なエンドエフェクタと掌側同型テレオペ用手袋を備えたウェアラブル操作インターフェースを提案し、8つの実ロボットタスクで平均成功率88.75%を達成した。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- Being-H0.7: 自己中心視点ビデオからの潜在世界行動モデルVLA2026/5/1
将来のフレーム生成をせずに、潜在空間での未来推論をVLAポリシーに組み込む新しいモデルを提案。訓練時のみ未来情報を使う二重分岐設計により、推論時は現在の観察のみで将来を考慮した行動決定を実現し、シミュレーションと実世界タスクで高性能を達成した。
- X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデルVLA2026/5/1
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
- 視覚言語行動モデルにおける具現化推論の幻想を暴くVLA2026/4/1
標準ベンチマークの成功率と真の具現化推論能力の乖離を検証するため、因果介入と運動学的分離を用いた診断ベンチマークBeTTERを導入し、最先端VLAモデルが動的シナリオで重大な失敗を起こすことを実証した。
- 後続遷移の再重み付けによる保守的オフラインロボット方策学習オフライン強化学習2026/3/1
ロボットのオフライン事後学習で、各サンプルの行動後の結果に基づいて学習への影響度を再重み付けする手法PTRを提案。不均一なデータセットでの保守的な適応を改善する。
- Joint-Aligned Latent Action: 実世界データからのスケーラブルなVLA事前学習に向けてVLA2026/2/1
人間の操作動画から逆動力学と実行動に整合する潜在行動を学習し、大規模なVLA事前学習を可能にするフレームワークJALAを提案。
- 事前学習と高速適応による汎用人型全身制御全身制御2026/2/1
人型ロボットの全身制御を、事前学習したポリシーに軽量な残差ポリシーを高速適応させることで、未知の動作にも安定して追従できるフレームワークFASTを提案した。
- 視覚-言語-行動モデルのスケーリング再考:アラインメント・混合・正則化VLA2026/2/1
VLAモデルのスケーリングを体系的に検証し、エンドエフェクタ相対の行動表現が異なる身体間の転移に重要である一方、異種ロボットデータの単純な混合は負の転移を招くことを示した研究。
- Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現VLA2026/1/1
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
- SmoothSync: 量子化音声からのビート同期ジェスチャー生成のためのデュアルストリーム拡散トランスフォーマージェスチャー生成2026/1/1
量子化音声トークンとデュアルストリーム拡散トランスフォーマーを用いて、音声に同期した滑らかな全身ジェスチャーを生成する手法を提案。ジッター抑制損失と確率的音声量子化により、揺れや足滑りを抑えつつ多様なサンプリングを実現した。
- 人間動画からの視覚-物理アライメントによる空間認識VLA事前学習VLA2025/12/1
人間の動画から3D視覚・動作アノテーションを抽出し、2D視覚と3D空間推論を事前学習で結びつけるVLAモデルを提案。下流のロボットタスクで2D視覚と3D動作の対応が改善し、汎化性能が向上した。
- 実演編集強化学習による汎用巧みな機能把持マニピュレーション2025/12/1
把持スタイルとアフォーダンスを条件として分解し、単一の実演を編集する強化学習で多様な物体の機能把持を学習、シミュレーションから実世界への転移とVLMによる指示追従を実現した。
- UniTacHand:人間からロボットハンドへの触覚スキル転移のための統合時空間触覚表現触覚2025/12/1
触覚グローブで収集した人間の操作データを、MANOハンドモデルの2D表面上でロボットハンドの触覚情報と統合し、コントラスト学習で潜在空間を揃えることで、ゼロショットでの触覚ベース方策転移を実現した研究。
- VLAモデルの信頼性指標としての輸送不一致VLA2025/12/1
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
- SENTINEL: ヒューマノイド全身制御のための完全エンドツーエンド言語行動モデルVLA2025/11/1
言語指示と固有感覚入力から低レベル行動を直接生成するエンドツーエンドモデルを構築し、シミュレーションと実機でヒューマノイドの全身制御を実現した。
- DemoHLM: 単一のデモンストレーションから汎化可能なヒューマノイド移動操作へ移動操作2025/10/1
シミュレーション上の1回のデモンストレーションから、実機ヒューマノイドの移動を伴う操作タスクを汎化可能に学習する階層型フレームワークを提案し、Unitree G1で10タスクのsim-to-real移行を実証した。
- 固有感覚を考慮した双腕ヒューマノイドロボットの身体性計画に向けてVLA2025/10/1
双腕ヒューマノイド向けの新シミュレータDualTHORを構築し、固有感覚情報を組み込んだProprio-MLLMを提案。既存MLLMより計画性能が平均19.75%向上した。
- DemoGrasp: 単一のデモンストレーションからの万能な器用把持マニピュレーション2025/9/1
1つの把持デモ軌道を編集し、単一ステップMDPとしてRLで最適化することで、多様な物体・手・実世界に汎化する万能な器用把持方策を学習した。
- Being-H0: 大規模人間動画からの視覚-言語-行動事前学習VLA2025/7/1
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
- DualTHOR: 偶発的失敗を考慮した計画のための双腕ヒューマノイドシミュレーションプラットフォームsim2real2025/6/1
家庭環境で双腕ヒューマノイドロボットが協調作業するための物理シミュレータを構築し、低レベル実行時の偶発的失敗も再現することで、視覚言語モデルのロバスト性を評価できるようにした。
- 専門家から汎用家へ:ヒューマノイドロボットの汎用全身制御に向けて全身制御2025/6/1
動作をクラスタリングして専門家ポリシーを訓練し、実機データでsim-to-real適応を行った後、単一の汎用コントローラに蒸留することで、ヒューマノイドロボットの多様な全身動作を実現するフレームワークBumbleBeeを提案。
- 物理フィードバックによる強化学習:大型モーションモデルをヒューマノイド制御に整合させるヒューマノイド制御2025/6/1
テキストから生成した人間の動きを物理シミュレータで評価し、強化学習で微調整することで、ヒューマノイドロボットで実行可能な動作を生成するフレームワークを提案。
- JAEGER: 二層構造のヒューマノイド全身制御器全身制御2025/5/1
上半身と下半身を別々の制御器に分け、粗い速度追従と細かい関節角追従の両方を可能にしたヒューマノイド全身制御を、人間モーションの再ターゲティングとカリキュラム学習で訓練した研究。
- 部分観測下におけるガイド付き方策最適化強化学習2025/5/1
特権情報を活用するガイダーと学習者を共訓練し、模倣学習を通じて部分観測環境での強化学習を改善するフレームワークを提案。
- Being-0: 視覚言語モデルとモジュール型スキルを統合したヒューマノイドロボットエージェントVLA2025/3/1
基盤モデルによる高レベルな指示理解・計画と、モジュール型スキルライブラリによる歩行・マニピュレーションを、軽量VLMのConnectorで橋渡しする階層型エージェントを提案し、実機ヒューマノイドで長期的タスクを実現した。
- ResDex: 混合エキスパートと残差学習による汎用器用把持マニピュレーション2024/10/1
物体ごとに学習した幾何非依存のベース方策を混合エキスパートで組み合わせ、残差行動を学習することで、多様な物体への汎用器用把持を効率的に実現した。
- 強化学習による異なるロボットハンド間で汎用な巧みな把持マニピュレーション2024/10/1
人間の手の固有把持(eigengrasp)に基づく共通行動空間と、指先・手のひらの位置のみに簡略化した観察空間を用いて、単一の視覚ベース方策で複数のロボットハンドを制御する強化学習手法を提案した。
- 人間のデモンストレーションから多様な両手巧み操作スキルを学習するマニピュレーション2024/10/1
人間の両手操作データセットからタスクを自動構築し、教師-生徒学習で多様な両手巧み操作スキルを視覚ベース方策として学習するフレームワークBiDexHDを提案した。
- Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning2022/6/1