Yu-Gang Jiang
Fudan University
収録論文 48本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LIBERO-Agent:汎用エージェントによる実機マニピュレーションの評価ベンチマークマニピュレーション2026/9/30
汎用AIエージェントがロボット操作タスクを直接実行できるかを評価する200タスクの対話型ベンチマークLIBERO-Agentを提案し、知覚は得意だが長期的・難しい操作では信頼性が大きく低下することを示した。
- 探索・実行・進化:身体性エージェントのためのスキル獲得と再利用ループVLA2026/9/29
視覚と言語に触覚を組み合わせ、スキルライブラリを進化的に更新しながら再利用する枠組みRoboSkillを提案し、ロボットタスクの成功率向上と実行時間短縮を実現した。
- LIBERO-VPro:ロボット基盤モデルの閉ループ視覚ロバスト性ベンチマークVLA2026/9/21
実行中の視覚情報を意図的に乱すことで、ロボット基盤モデルの閉ループ視覚ロバスト性を体系的に評価するベンチマークLIBERO-VProを提案し、VLAとWAMのロバスト性プロファイルの違いを明らかにした。
- 非同期リプレイ固定方策改善による安定かつ効率的な実世界オンラインVLA事後学習VLA2026/9/19
ロールアウトと学習を並行して行い、リプレイされた行動に基づいて価値関数と方策を更新することで、実世界のVLAモデルを短時間で安定的にオンライン事後学習する手法を提案。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- 大規模離散方策:確率的反復スコアリングによる明示的行動モデリングの進展行動生成2026/9/7
行動方策を離散的な候補選択としてモデル化し、確率的な反復スコアリングで表現力を高める新しいフレームワークを提案。自動運転やロボット操作で連続生成モデルに匹敵する性能を示した。
- StructRL: フローベースVLAのための構造化アクション空間探索VLA/強化学習2026/8/15
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
- ETA: 身体性タスクのための新しいエージェントパラダイムエージェントアーキテクチャ2026/8/4
ロボットのChatGPT的瞬間を目指し、プランナー・インターフェース・ワールドのループで構成される新しい身体性タスクエージェント(ETA)を提案し、オープンソース実装OpenETAを公開した。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- 探索してセグメント化:パノラマ参照セグメンテーションのための能動的知覚能動的知覚2026/7/2
エージェントが360度環境を能動的に探索し、ユーザーの指示に従って対象物体をセグメンテーションする新しいタスク「能動的パノラマ参照セグメンテーション」を提案し、空間記憶を持つVLMベースのエージェントPanoSeekerを開発した。
- EgoRecovery: 人間の回復デモンストレーションから失敗回復能力を獲得するロボット学習2026/7/1
ロボットの失敗回復行動を学習するために、人間の自己中心視点の回復デモを活用し、ロボットデータと共有する意図空間を介して少数のロボットデモで実行可能な行動に結びつける共学習フレームワークを提案した。
- SegDiff: セグメント化軌道拡散による一貫性と適応性を備えたロボット操作マニピュレーション2026/7/1
模倣学習において、連続予測とキーポーズ予測の利点を統合し、キーポーズ間の軌道を拡散モデルで予測する閉ループ視覚運動ポリシーを提案。動的環境への適応性と制御安定性を向上させた。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- UniDexTok: 実データからの統合器用手トークナイザ器用手/表現学習2026/6/9
人間とロボットの手の状態を共通の22自由度セマンティックインターフェースにマッピングし、再ターゲティング不要で異種の器用手を統一表現するトークナイザを提案。誤差をセンチメートルからサブミリメートルに大幅削減した。
- ActiveMimic: 能動的知覚を備えた自己中心視点ビデオ事前学習VLA2026/6/4
自己中心視点の人間ビデオから能動的知覚(カメラ動作)を活用してロボット操作を事前学習するフレームワークを提案し、ロボットデータ事前学習と同等の性能を実現した。
- EvoMemNav: ゼロショット具現化ナビゲーションのための自己進化型高精細メモリナビゲーション2026/6/2
観測を細粒度で保持する視覚意味メモリグラフを構築し、予算制約付き粗密探索とサブタスク後のリフレクションによるメモリ更新で、ゼロショットの具現化ナビゲーション性能を向上させた。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- 動きから触覚を見る:触覚運動相関を用いた統一モダリティ認識視触覚ポリシーマニピュレーション2026/6/1
接触を伴う操作において、触覚センサの画像から過渡的運動と累積運動の相関を利用して細かい接触状態を識別する新しい触覚表現を提案し、視覚と触覚の効果的な融合を実現するポリシーを開発した。
- ThinkingVLA: ロボット操作のための視覚と言語の推論を交互に行う手法VLA2026/6/1
ロボット操作タスクにおいて、視覚と言語の推論を交互に行う統一アーキテクチャを提案し、長期的な操作タスクでの性能を向上させた。
- 二つの橋、一つの道:身体化軌跡結合データによるVLMから汎用VLAへの変換VLA2026/6/1
視覚言語モデル(VLM)をロボット制御ポリシー(VLA)に変換する際のギャップを、ロボットの軌跡に基づく中間データ(ETCデータ)と3段階の訓練手法で段階的に橋渡しし、汎用性を高める手法を提案した論文。
- 孤立したスキルから日常の物理的自律性へ:オムニモーダル具現化エージェントの前進VLA/自律エージェント2026/6/1
サイバー空間と物理空間を統合した行動空間、階層的記憶、非同期の視覚的割り込み検証を備えたフレームワークOmniActを提案し、実世界の長期タスクで性能とトークン効率を向上させた。
- Bench2Drive-Robust:展開時の摂動下でのクローズドループ自動運転のベンチマーク自動運転2026/5/1
実環境展開で生じるシステムレベルの摂動(カメラストリーム障害、自己位置推定誤差、計算遅延)がクローズドループのエンドツーエンド自動運転性能に与える影響を評価する、初のデバイス中心のロバストネスベンチマークを提案した。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- 身体性AIにおける安全性:リスク、攻撃、防御のサーベイ安全性2026/5/1
身体性AIの安全性に関する研究を、知覚から計画、行動、相互作用までのパイプライン全体にわたって体系的にレビューし、攻撃と防御の多層的な分類法を提案した論文。
- VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送VLA/汎化2026/5/1
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニングVLA2026/5/1
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
- HazardArena: 視覚言語行動モデルにおける意味的安全性の評価VLA/安全性評価2026/4/1
視覚言語行動モデル(VLA)の安全性を評価するベンチマークを構築し、安全/危険の双子シナリオで意味的文脈による不安全行動を検出。訓練不要のSafety Option Layerで不安全行動を低減する手法も提案。
- AssemLM: ロボット組立のための空間推論マルチモーダル大規模言語モデルマニピュレーション2026/4/1
組立マニュアル、点群、テキスト指示を統合し、6D組立姿勢を予測する空間推論マルチモーダル大規模言語モデルを提案。専用の点群エンコーダと大規模ベンチマークAssemBenchを導入し、実ロボット評価で最先端性能を達成した。
- OCRA: 3Dと触覚の事前知識を用いた物体中心学習による人間からロボットへの行動転移模倣学習/行動転移2026/3/1
人間のデモ動画からロボットの操作行動を学習する物体中心フレームワークOCRAを提案。3D点群と触覚情報を統合し、拡散ポリシーでロバストな操作を実現する。
- RC-NF: ロボット条件付き正規化フローによるロボット操作のリアルタイム異常検知異常検知2026/3/1
VLAモデルによるロボット操作中に、ロボットと物体の状態がタスクに沿っているかを監視し、異常をリアルタイム検知するモデルRC-NFを提案。正規化フローを用いて教師なし学習し、異常スコアを確率密度から算出する。
- EEGベースの視覚・運動イメージハイブリッド制御によるロボット把持と配置BCI/ロボット制御2026/3/1
脳波(EEG)による視覚イメージと運動イメージを組み合わせ、ロボットの把持対象と配置位置を意図駆動で制御する枠組みを提案・実装した。
- FRoM-W1: 言語指示による汎用人型全身制御フレームワークVLA2026/1/1
自然言語から人型ロボットの全身動作を生成・実行する2段階フレームワークを提案し、Unitree H1/G1で動作追従精度の向上を実証した。
- シュレーディンガーのナビゲーター:ゼロショット物体ナビゲーションのための未来集合の想像ナビゲーション2025/12/1
軌道条件付き3D世界モデルで複数の未来を想像し、不確実性を考慮してゼロショット物体ナビゲーションを行う手法を提案。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- TP-MDDN: タスク優先度付きマルチ要求駆動ナビゲーションと自律的意思決定ナビゲーション2025/11/1
複数の要求とタスク優先度を考慮した長期的ナビゲーションの新ベンチマークTP-MDDNを提案し、指示分解・目標選択・タスク監視を行う自律意思決定システムAWMSystemで解決する。
- カメラ座標系でロボット動作を統一するクロスエンボディメント学習2025/11/1
カメラ外部パラメータを用いて異なるロボットの動作をカメラ座標系で統一し、訓練不要でカメラ外部パラメータを推定するCalibAllを提案。16データセットで約97Kエピソードを校正し、クロスエンボディメント事前学習で最先端性能を達成。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- DropVLA: 視覚言語行動モデルに対する行動レベルバックドア攻撃VLA2025/10/1
VLAモデルの微調整時に視覚トリガーを混ぜ、攻撃者が指定したタイミングで特定の行動(例:グリッパを開く)を実行させる行動レベルバックドア攻撃を提案し、実機でも検証した。
- 身体性AI:LLMから世界モデルへ身体性AI2025/9/1
大規模言語モデル(LLM)と世界モデル(WM)が身体性AIをどのように推進するかを、基礎から最新動向まで包括的にサーベイした論文。
- Ask-to-Clarify: マルチターン対話による指示の曖昧性解消VLA2025/9/1
VLAモデルに対話による曖昧性解消と視覚運動制御を統合したフレームワークを提案し、実世界11タスクで有効性を示した。
- 連続アクションチャンクのためのActor-Critic:スパース報酬下での長期的ロボットマニピュレーションのための強化学習フレームワークマニピュレーション2025/8/1
スパース報酬の長期的ロボット操作タスクにおいて、連続アクションチャンクを安定かつデータ効率的に学習する強化学習フレームワークAC3を提案。ActorとCriticの安定化機構により、少数のデモンストレーションで高い成功率を達成。
- HumanoidGen: LLM推論による双腕巧みな操作のためのデータ生成マニピュレーション2025/7/1
LLM推論と原子操作を活用し、双腕・巧みな手を持つヒューマノイドロボットの操作タスクと実演データを自動生成するフレームワークを提案。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
- 一度だけ推定:ロボット把持のための統合・ワンステージ・リアルタイムカテゴリレベル関節物体6D姿勢推定6D姿勢推定2025/6/1
関節物体のカテゴリレベル6D姿勢推定を、インスタンス分割とNPCS表現を同時に出力する単一ステージのネットワークで実現し、200Hzのリアルタイム動作を可能にした研究。
- Human2Robot: 人間とロボットのペア動画からロボット動作を学習模倣学習2025/2/1
人間とロボットの同期動画ペアを条件付き動画生成問題として扱い、人間の動画からロボットの動画を生成して動作を学習する枠組みを提案。新規データセットH&Rも構築し、未知のタスクへのワンショット汎化を実現した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマークVLA2024/12/1
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。