Jianye Hao
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- T3S: タスク固有特徴セレクタとスケジューラによるマルチタスク強化学習の改善マルチタスク強化学習2026/8/31
マルチタスク強化学習におけるタスク間干渉を解決するため、ハイパーネットワークでタスク固有のソフトマスクを生成する特徴セレクタと、タスクの進捗と学習速度に基づいて学習タスクを選択するスケジューラを提案した。ロボット操作タスクで既存手法より優れた性能を示した。
- WarpSAC: 探索と活用の再考によるスケーラブルなオフ方策強化学習の頂点を目指して強化学習2026/8/25
データ量に応じて安定化手法を適応させるオフ方策RLアルゴリズムWarpSACを提案し、CPU/GPU並列環境で既存手法を大幅に上回る性能を達成した。
- RoboPIN: ピン留めチェーン・オブ・ソートによる接地された身体化推論身体化推論/VLM2026/6/14
身体化推論の各ステップを視覚的証拠に固定する「ピン留めチェーン・オブ・ソート」を提案し、エンティティ追跡の一貫性を保つデータセットとモデルを構築した。
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- ForceFlow: 接触駆動フローマッチングによる感覚と行動の学習マニピュレーション2026/5/1
接触を伴う操作タスクのための力覚対応リアクティブフレームワークを提案。非対称マルチモーダル融合と視覚から力へのハンドオーバー機構により、力と運動の深い結合を実現し、実世界6タスクで成功率を37%向上させた。
- 非定常性で失われるランクと勾配:強化学習における可塑性損失を緩和するサンプル重み減衰強化学習2026/4/2
強化学習の可塑性損失をネットワーク最適化の理論的観点から分析し、勾配減衰を補正する軽量な手法「サンプル重み減衰」を提案した。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーションVLA2026/2/1
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
- 一点ではなく面で捉える:ロボットタスクの空間グラウンディングのための適応的アフォーダンスヒートマップによる不確実性の表現VLA2025/10/1
空間的な目標を離散的な点ではなく連続的なアフォーダンスヒートマップとして表現し、不確実性を捉えることで、実世界のマニピュレーション成功率82%と最大50倍の高速化を実現したフレームワークRoboMAPを提案。
- OmniEVA: タスク適応型3Dグラウンディングと身体性考慮推論による汎用エンボディドプランナーVLA2025/9/1
タスクに応じて3D情報の融合を切り替えるゲート付き機構と、ロボットの身体制約を推論に組み込む枠組みにより、実機で実行可能な計画を立てるエンボディドAIプランナーを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- MUVLA: 地図理解による物体ナビゲーションの探索学習VLA2025/9/1
セマンティックマップを活用して履歴情報を構造化し、報酬誘導型のリターンモデリングで探索行動を学習する物体ナビゲーション用VLAモデルを提案。
- Embodied-R1: 汎用ロボット操作のための強化学習による身体性推論VLA2025/8/1
「ポインティング」を身体性に依存しない中間表現として用い、3Bの視覚言語モデルを強化学習ファインチューニングで訓練することで、未知の環境や実機タスクへのゼロショット汎化を実現した研究。
- AutoLayout: 低速・高速協調推論による閉ループレイアウト合成シーン生成/レイアウト合成2025/7/1
低速な推論と高速な生成を組み合わせた二重システムと自己検証ループにより、物理的に整合し意味的にも妥当な物体配置レイアウトを自動生成する手法を提案。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- EmbodiedMAE: ロボットマニピュレーションのための統合3Dマルチモーダル表現マニピュレーション2025/5/1
RGB・深度・点群を統合的に学習するマルチモーダルMAEを提案し、DROID-3Dデータセットで訓練することで、シミュレーションと実機の操作タスクにおいて既存の視覚基盤モデルを上回る性能を達成した。
- 見ることから行うことへ:ロボットマニピュレーションのための推論と意思決定の橋渡しマニピュレーション2025/5/1
空間関係推論で中間表現を生成する視覚言語モデルFSDを提案し、ロボット操作のゼロショット性能を大幅に向上させた。
- 条件付けが鍵:拡散ポリシーの学習は思ったより速いVLA2025/5/1
条件拡散ポリシー学習で生じる「損失崩壊」を特定し、条件に依存したソース分布を用いるCocosを提案。少ない学習ステップとパラメータで大規模事前学習VLAに匹敵する性能を実現した。
- 実演1回で計画ドメインを自動生成:LLMによる長期ロボット計画の高信頼化タスク・モーション計画2025/5/1
1回の実演軌道からLLMと物理シミュレーションを用いて記号述語と行動を自動生成し、運動計画と統合して長期タスク計画を実行可能にするフレームワークPDDLLMを提案。
- 少数ショット視覚言語行動インクリメンタル方策学習VLA2025/4/1
少数の実演から新しい操作タスクを継続的に学習するため、タスク固有プロンプトとタスク関係グラフによる進化戦略を組み合わせたTOPICを提案した論文。
- AhaRobot:身体性AIのための低コストオープンソース双腕移動マニピュレータマニピュレーション2025/3/1
低コストで完全オープンソースの双腕移動マニピュレータを開発し、遠隔操作インターフェースと制御スタックを最適化することで、家庭内タスクの模倣学習を可能にした。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- 3D-AffordanceLLM:大規模言語モデルを活用した3D世界におけるオープンボキャブラリ・アフォーダンス検出3Dアフォーダンス検出2025/2/1
大規模言語モデルを3Dアフォーダンス知覚に導入し、自然言語の指示からアフォーダンス領域を推論・セグメンテーションするフレームワークを提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- 3D-MoE:Rectified Flowによる姿勢拡散を備えた3D視覚・空間推論向けMixture-of-ExpertsマルチモーダルLLMVLA2025/1/1
既存の密活性化LLMをMixture-of-Experts化し、Rectified Flow拡散ヘッド(Pose-DiT)を組み合わせることで、3D質問応答と身体性タスク計画を少ない活性パラメータで高精度に実行するフレームワークを提案した。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。
- CleanDiffuser: 意思決定のための拡散モデル向け使いやすいモジュール式ライブラリ拡散モデル意思決定2024/6/1
意思決定アルゴリズムに特化した初の拡散モデルライブラリCleanDiffuserを提案し、モジュール式で柔軟な実装と広範な評価を通じてその信頼性と設計上の知見を示した。
- ROS-LLM:タスクフィードバックと構造化推論を備えた身体性AIのためのROSフレームワークVLA2024/6/1
ROSと大規模言語モデルを統合し、非専門家が自然言語でロボットをプログラミングできるフレームワークを提案。行動モードや模倣学習、フィードバックによる反省機能を備え、多様なタスクで有効性を検証した。
- iVideoGPT:インタラクティブな動画生成モデルによるスケーラブルな世界モデル世界モデル2024/5/1
視覚・行動・報酬をトークン列に統合した自己回帰型Transformerで、次トークン予測によりエージェントが想像環境内で対話的に行動できる世界モデルを構築し、大規模な操作軌跡で事前学習した。
- 身体性AIのための視覚-言語-行動モデルに関するサーベイVLA2024/5/1
身体性AI向けの視覚-言語-行動(VLA)モデルについて、構成要素・制御ポリシー・タスクプランナーの3系統に分類し、データセットやベンチマークも含めて初めて体系的にまとめたサーベイ。
- Uni-RLHF:多様な人間フィードバックを用いた強化学習のための汎用プラットフォームとベンチマークスイートRLHF2024/2/1
多様な人間フィードバックを扱うRLHFのための注釈プラットフォーム、大規模クラウドソーシングデータセット、モジュール式オフラインRLHFベースラインを提供する統合システムを構築し、30以上のタスクで1500万ステップを超えるデータを収集して評価した。
- Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models2024/2/1
- ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles2023/6/1
- Transformer in Transformer as Backbone for Deep Reinforcement Learning2022/12/1
- RITA: Boost Driving Simulators with Realistic Interactive Traffic Flow2022/11/1
- EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model2022/10/1
- SEIHAI: A Sample-efficient Hierarchical AI for the MineRL Competition2021/11/1
- Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning2020/11/1
- Triple-GAIL: A Multi-Modal Imitation Learning Framework with Generative Adversarial Nets2020/5/1