Yang Gao
Nanjing University
収録論文 101本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- スキル空間シューティングによる自律ロボットの政策改善政策改善2026/9/29
基盤モデルを活用して再利用可能なスキルを探索し、失敗を修正する政策改善手法を提案。実世界実験で自律的な政策改善とスキル共有による新タスクへの効率的な適応を実証した。
- 行動識別型ワールドモデルによる反事実モデル予測制御モデルベース制御/ワールドモデル2026/9/24
計画時に候補行動を区別できるよう、逆動力学と行動復元正則化を組み込んだワールドモデルAD-WMを提案し、MPCの成功率と実機ゼロショット転移を改善した。
- EgoTac: 自己中心視覚からの実環境触覚予測触覚2026/8/15
自己中心視覚映像から触覚情報を予測するモデルEgoTacを提案し、570万以上の画像-触覚ペアで学習して高精度な触覚予測を実現した。
- レガシーデータはいつ役立ち始めるのか?クロス構成ロボット学習における創発的転移ロボット学習2026/7/1
ロボットのハードウェア更新時に、旧構成のデモデータが新構成の学習に有効となる条件を、実機実験と理論で明らかにした論文。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- OpenHLM:全身ヒューマノイド移動操作の実証的レシピVLA/全身制御2026/6/1
ヒューマノイドの全身協調動作を実現するため、言語と画像から全自由度を直接制御するVLAモデルの構築方法を体系的に研究し、実用的なレシピを提案した。
- 人間の動作スタイルを移植するヒューマノイド全身制御のための生体模倣手法全身制御/スタイル転送2026/6/1
短い人間の動作スタイル例から、目標の動作内容を保ちつつスタイルを移植した全身参照動作を生成し、物理実行可能な制御ポリシーでヒューマノイドに実行させる枠組みを提案した。
- He3-Seeker: 月面ヘリウム3分布マッピングのためのロボット情報計画探査ロボット/情報計画2026/6/1
月面のヘリウム3資源を高精度にマッピングするため、能動的ロボット探査手法He3-Seekerを提案。多点掘削・サンプリング・その場分析に基づき、ロボット情報計画(RIP)で自律航法と能動センシングを導く。シミュレーションで高速かつ高忠実なマッピングを実証した。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- Wh0: 生成的世界モデルによるスケーラブルな自己中心視点の人間手操作データ生成VLA/データ生成2026/6/1
生成ビデオ世界モデルを用いて、ロボット学習に使える自己中心視点の人間手操作ビデオデータを大量生成し、実ロボットデータと組み合わせて器用な操作VLAモデルの性能を大幅に向上させる手法を提案した。
- VLA評価のためのシミュレーションと実世界の相関を改善する実践的レシピVLA評価/sim2real2026/6/1
シミュレーションと実世界の評価結果の相関を体系的に分析し、VLAポリシーの評価や改善にシミュレーションを効果的に活用するための指針を提供する研究。
- クリティカル区間MSE:ロボット操作ポリシーの信頼できるオフライン検証に向けてロボット操作/評価指標2026/6/1
ロボット操作ポリシーのオフライン検証指標として、タスクの重要区間に限定して誤差を計算するCI-MSEを提案し、実世界性能との相関が従来のMSEより高いことを示した。
- アンカー付きエピポーラガイダンスによるドリフト耐性ナビゲーションワールドモデルナビゲーションワールドモデル2026/5/1
逐次ロールアウトによるノイズ蓄積と幾何学的ドリフトを防ぐため、疎な未来アンカーを予測し、その間のフレームを生成する新しいワールドモデルを提案。双方向エピポーラ幾何でアンカーを拘束し、長期的な視覚品質と幾何的一貫性を向上させた。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- UniDex: 人間の一人称視点ビデオからの汎用器用ハンド制御のためのロボット基盤スイート器用操作2026/3/1
人間の一人称視点ビデオからロボット実行可能な軌道を生成し、統一された行動空間と3D VLAポリシーを用いて、複数の器用ハンドへの汎用制御を実現する基盤スイートを提案した。
- V-Dreamer: ビデオ生成事前知識によるロボットシミュレーションと軌道合成の自動化シミュレーション/データ生成2026/3/1
自然言語の指示から、シミュレーション可能な3D環境と実行可能なロボット軌道を自動生成するフレームワークを提案。ビデオ生成モデルを動作の事前知識として活用し、シミュレーションから実世界への転移を実現した。
- ST-VLA: 汎用ロボット操作のための4D認識時空間理解の実現VLA/操作2026/3/1
ロボット操作のための階層型VLAフレームワークST-VLAを提案し、3D-4D表現で知覚と行動を橋渡し、大規模データセットST-Humanで訓練した。RLBenchと実世界で成功率を大幅に向上させた。
- RoTri-Diff: 空間的なロボット-物体三者間相互作用に基づく両腕操作のための拡散モデル両腕操作/拡散モデル/模倣学習2026/3/1
両腕と操作対象物の間の相対的な6D姿勢を符号化した三者間相互作用表現を導入し、階層的拡散過程で軌道生成する模倣学習フレームワークを提案。シミュレーションと実機で高い性能を実証した。
- AdaClearGrasp: 密集環境でのロバストなゼロショット器用把持のための適応的クリアリング学習マニピュレーション2026/3/1
密集環境での器用な把持を実現するため、視覚言語モデルを用いて直接把持するか周囲をクリアするかを適応的に決定する閉ループ意思決定・実行フレームワークを提案した。
- MoMaStage: スキル状態グラフによる計画と閉ループ実行を統合した長期的屋内移動操作移動操作2026/3/1
屋内移動操作ロボット向けに、明示的なシーン地図を使わず、階層スキルライブラリとトポロジー認識スキル状態グラフでVLMの計画を制約し、閉ループ実行で堅牢性を高めるフレームワークを提案した。
- OPRIDE: データセット内探索によるオフライン選好ベース強化学習選好ベース強化学習2026/2/19
オフライン選好ベース強化学習において、クエリ効率を高めるための探索戦略と割引スケジューリングを組み合わせた手法を提案し、少ないクエリで高性能を達成した。
- アクションチャンキングフローポリシーのためのネイティブ継続学習VLA2026/2/1
フローベースVLAポリシーのアクションチャンク境界の不連続を訓練時に滑らかにするLegatoを提案し、実機マニピュレーションでRTCを上回る性能を示した。
- INHerit-SG: 増分階層型セマンティックシーングラフとRAG型検索シーングラフ2026/2/1
ロボットナビゲーション向けに、3D環境を非同期の二重ストリームで階層的なセマンティックシーングラフとして構築し、LLMとトポロジーを組み合わせた検索で複雑な embodied クエリに応答するシステムを提案。
- ヒューマノイド操作インターフェース:ロボット不要の実演による全身操作全身操作2026/2/1
ポータブルな装着型デバイスで人間の全身動作を計測し、階層的な学習パイプラインを通じてヒューマノイドの多様な全身操作スキルを実環境で獲得するフレームワークを提案。
- 後知恵オンライン模倣によるフローから方策への変換模倣学習2025/12/1
高レベルプランナが生成した2D点フローを、オンライン試行錯誤と後知恵目標再ラベリングで目標条件付き模倣方策に接地し、操作タスクの性能を2倍以上に改善する手法を提案。
- ManiLong-Shot: 長期的操作のためのインタラクション認識ワンショット模倣学習模倣学習2025/12/1
物理的インタラクションイベントに基づいて長期的タスクをプリミティブに分解し、VLMやルールベースの推論でワンショット模倣学習を実現するフレームワークを提案。
- 指し示す場所を意図せよ:視覚的根拠に基づく指示ポリシーVLA2025/12/1
言語指示にバウンディングボックスなどの視覚的手がかりを追加することで、混雑環境や未知物体でも対象を正確に特定できるVLAポリシー「Point-VLA」を提案し、自動データ注釈パイプラインで効率的に学習した。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。
- RoboHiMan: 長期的マニピュレーションにおける構成的一般化のための階層的評価パラダイムマニピュレーション2025/10/1
長期的なマニピュレーションタスクにおけるスキル構成の一般化を評価するため、多様な摂動下での原子タスクと構成タスクのベンチマークHiMan-Benchと3つの評価パラダイムを提案し、代表的なモデル・アーキテクチャの能力ギャップを明らかにした。
- 空間的に固定された触覚認識による堅牢な巧みな操作触覚2025/10/1
触覚信号を手の運動学的座標系に固定して扱うことで、物体モデルや姿勢推定なしにサブミリ精度の巧みな操作を可能にする方策フレームワークSaTAを提案した。
- RAP: 3Dラスタライゼーションで強化するエンドツーエンド計画自動運転/エンドツーエンド計画2025/10/1
フォトリアルな描画の代わりに注釈付きプリミティブの軽量ラスタライズで走行データを拡張し、特徴空間アライメントで実環境に転移する計画手法を提案。4つの主要ベンチマークで最高性能を達成。
- SEA: 不確実領域の能動的探索のための意味地図予測能動的探索2025/10/1
観測から地図の欠損領域を反復予測し、予測と実地図の差分を強化学習で探索に活かすことで、限られた時間で高精度な意味地図を構築する手法を提案。
- 視覚運動ポリシーに固有感覚状態は必要か?VLA2025/9/1
固有感覚入力を排除し視覚のみで動作を予測するState-free Policyを提案し、空間汎化性能が大幅に向上することを示した。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- シミュレーションと実世界の最良を活かす:シミュレーションでの制御学習と実世界での知覚による分離型視覚運動マニピュレーションsim2real2025/9/1
制御方策をシミュレーションで学習し、知覚のみを実環境で適応させる分離フレームワークを提案。10〜20回の実演で高いデータ効率と分布外汎化を実現した。
- TimeRewarder:受動的動画からフレーム間時間距離で密報酬を学習強化学習/報酬設計2025/9/1
フレーム間の時間距離をモデル化し、ロボット実演や人間動画からタスク進捗を推定して強化学習の密報酬を生成する手法を提案。
- MotionTrans: 人間のVRデータでロボットマニピュレーション方策の動作レベル学習を実現マニピュレーション2025/9/1
VRで収集した人間の動作データを変換し、ロボットデータと重み付き共訓練することで、13タスクの動作をエンドツーエンド方策へ直接転移。9タスクはゼロショットで成功し、事前学習・微調整性能も40%向上。
- 触覚VLA:視覚-言語-行動モデルの物理知識を触覚汎化へ解き放つVLA2025/7/1
視覚・言語・行動モデルに触覚センシングを融合し、接触を伴うタスクで力制御と触覚フィードバックに基づく適応的な行動を可能にするフレームワークを提案。
- 身体感覚のずれを克服する模倣学習のドメイン適応模倣学習2025/6/1
模倣学習において訓練時と実環境での固有感覚(proprioception)の分布ずれが性能を低下させる問題を特定し、Wasserstein距離に基づくノイズ付加で分布を整合させる手法を提案した。
- 事前強化学習:限られた試行回数での目標条件付き動的マニピュレーションマニピュレーション2025/5/1
少数の実演から条件付き拡散モデルで運動マニフォールドを学習し、低次元条件空間でのフィードバック最適化により、10回程度の試行で新しい動的マニピュレーション目標を達成するフレームワークを提案。
- OneTwoVLA:適応的推論を備えた統合視覚言語行動モデルVLA2025/5/1
行動と推論を単一モデルで統合し、必要な時だけ明示的に推論する適応的切替機構を導入したVLAモデル。長期的タスク計画やエラー回復、人間との対話、視覚的接地を実現。
- KineDex: 触覚情報を取り入れた視覚運動ポリシーを運動感覚教示で学習する巧みな操作マニピュレーション2025/5/1
人間の手の動きを直接ロボットハンドに転送する運動感覚教示で触覚付きの実演データを収集し、触覚を統合した視覚運動ポリシーと力制御により接触の多い巧みな操作を実現した。
- EasyInsert: データ効率が高く汎化可能な挿入ポリシーマニピュレーション2025/5/1
人間の直感に基づき挿入をデルタポーズ回帰問題として定式化し、最小限の人手で収集したデータからエンドツーエンドの視覚ポリシーを学習。未知物体や乱雑環境でも高いゼロショット汎化性能を実現した。
- FACET: インピーダンス参照追従による脚式ロボットの力適応制御脚式ロボット制御2025/5/1
仮想質量-バネ-ダンパ系を模倣する強化学習方策を訓練し、外力に応じて柔軟に適応する脚式ロボットの制御を実現した。
- SEPT: 標準地図を活用した自動運転のためのシーン知覚とトポロジー推論の強化自動運転知覚2025/5/1
高精細地図に頼らず、標準地図を事前知識としてBEV特徴と融合し、シーン知覚とトポロジー推論を高精度化するフレームワークを提案。
- DeCo: 長期的3Dマニピュレーションにおけるゼロショット汎化のためのタスク分解とスキル合成マニピュレーション2025/5/1
模倣学習のデモを把持物体の相互作用に基づいて原子タスクに分解し、VLMで指示を解析してスキルを動的に組み合わせることで、未見の長期的3D操作タスクへのゼロショット汎化を実現するフレームワーク。
- HuB: 極限ヒューマノイドバランスの学習ヒューマノイド制御2025/5/1
ヒューマノイドロボットが片足立ちや高蹴りなどの極限的なバランス課題を強化学習で獲得するための、参照動作修正・バランス認識方策学習・sim-to-realロバスト訓練を統合したフレームワークを提案。
- RoboEngine: セマンティックロボットセグメンテーションと背景生成によるプラグアンドプレイなロボットデータ拡張データ拡張2025/3/1
ロボットのセグメンテーションと背景生成を組み合わせ、数行のコードで物理・タスクを考慮した視覚データ拡張を可能にするツールキットを提案。単一シーンのデモから6つの新規シーンへの汎化を実現し、性能を200%以上向上させた。
- FP3: ロボットマニピュレーションのための3D基盤ポリシーマニピュレーション2025/3/1
点群入力を用いた大規模3D基盤ポリシーモデルFP3を提案し、80回のデモで新規タスクを90%以上の成功率で学習できることを実機で示した。
- 単眼視による人物位置推定と軌道予測の統合フレームワーク人物軌道予測2025/3/1
単眼カメラ映像のみから、Transformerを用いて人物の位置推定と将来の軌道予測を同時に行う手法を提案し、雑音の多い実環境でも頑健に動作することを示した。
- 効率的強化学習のための因果情報優先順位付け強化学習2025/2/14
強化学習において、状態・行動・報酬間の因果関係を因子分解MDPで推論し、因果情報を優先することでサンプル効率を向上させる手法CIPを提案した。
- Video2Policy: インターネット動画を活用したシミュレーションでのマニピュレーションタスクのスケーリングsim2real2025/2/1
インターネット上の人間行動動画からシミュレーションタスクを再構築し、LLM生成報酬による強化学習で汎用方策を訓練、実機転移も実現したフレームワーク。
- シミュレート困難な目的関数の微調整による四足歩行:総消費電力削減の事例研究sim2real2025/2/1
実世界データでバッテリー消費電力などのシミュレート困難な目的をモデル化し、シミュレーションに組み込んで歩行ポリシーを微調整することで、四足歩行の総消費電力を24〜28%削減した。
- SKIL: 意味的キーポイント模倣学習による汎化性とデータ効率に優れたマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルで意味的キーポイントを自動抽出し、少ないデモ数で複雑なロボット操作を模倣学習できるフレームワークを提案。
- RoboHorizon: 長期的ロボット操作のためのLLM支援マルチビューワールドモデルマニピュレーション2025/1/1
LLMで密な報酬を生成し、マルチビューMAEでキーフレームを検出するワールドモデルを構築し、長期的なロボット操作タスクの成功率を向上させた研究。
- SOLAMI:3D自律キャラクターとの没入型インタラクションのための社会的視覚-言語-行動モデリングVLA2024/11/29
3Dキャラクターが人間と社会的に交流できるよう、視覚・言語・行動を統合した初のエンドツーエンドVLAフレームワークを提案し、合成データセットとVRインターフェースを開発した。
- 自己教師あり単眼4Dシーン再構成による一人称視点動画の理解4D再構成2024/11/1
一人称視点動画からカメラ内部パラメータ・カメラ姿勢・動画深度を自己教師あり学習で推定し、高密度な4Dシーン再構成を高速に行うモデルEgoMono4Dを提案した。
- Multi-Transmotion: 人間の動作予測のための事前学習モデル動作予測2024/11/1
複数のデータセットを統合し、軌跡と3D姿勢の両方を扱うクロスモダリティ事前学習モデルを提案。様々な下流タスクで競争力のある性能を示した。
- ロボットマニピュレーションの模倣学習におけるデータスケーリング則マニピュレーション2024/10/1
模倣学習において環境・物体・デモ数の増加が汎化性能に与える影響を大規模実験で調査し、環境と物体の多様性が重要であることを示した。
- GravMAD: 接地された空間価値マップによる汎用3Dマニピュレーションのための行動拡散マニピュレーション2024/9/1
言語指示をサブゴールに分解し、基盤モデルと拡散方策を組み合わせて未知の3D操作タスクへの汎化を実現した手法。
- 局所性を活用したロボットマニピュレーションのサンプル効率向上マニピュレーション2024/6/1
ロボットの動作は対象物とその周辺環境に強く影響されるという「動作局所性」の帰納バイアスを導入し、模倣学習のサンプル効率を高めるフレームワークSGRv2を提案。シミュレーションと実環境で少ないデモンストレーションから高い成功率を達成した。
- スパース失敗ガイダンスとロボット連鎖思考による操作スキルの学習マニピュレーション2024/5/1
VLMを用いてタスクをサブタスクに分解し、より細かい報酬ガイダンスと自己模倣学習でロボットの操作スキルを効率的に学習させる手法を提案した。
- EfficientZero V2:限られたデータで離散・連続制御をマスターする強化学習2024/3/1
限られたデータで効率的に学習できる強化学習フレームワークEfficientZero V2を提案し、連続・離散行動や視覚・低次元入力など多様なタスクで既存手法を上回る性能を示した。
- CoPa: 基盤モデルと部位の空間制約による汎用ロボットマニピュレーションマニピュレーション2024/3/1
基盤モデルの常識知識を活用し、タスク指向の把持部位選択とタスクに応じた空間制約から6自由度エンドエフェクタ姿勢を生成する、追加学習不要の汎用マニピュレーション手法。
- Transformerは物体間の空間関係を捉えられるか空間関係認識2024/3/1
物体間の空間関係を認識するベンチマークを提案し、Transformerの長距離注意を活用したRelatiViTが既存手法を大きく上回ることを示した。
- SpaceOctopus: タコに着想を得た多腕宇宙ロボットの運動計画フレームワーク宇宙ロボット/運動計画2024/3/1
タコの腕の分散制御に着想を得て、多腕宇宙ロボットのための多階層分散型運動計画フレームワークを開発し、マルチエージェント強化学習と統合することで、ベース姿勢調整や外乱・腕の故障に対する堅牢性を実現した。
- MQE: マルチエージェント四足歩行環境で相互作用の可能性を解き放つ群制御2024/3/1
複数の四足ロボットが協調・競争するタスクを学習・評価するための新しいマルチエージェント強化学習環境MQEを提案し、最先端アルゴリズムをベンチマークした。
- Angle Robustness Unmanned Aerial Vehicle Navigation in GNSS-Denied Scenarios2024/2/1
- General Flow as Foundation Affordance for Scalable Robot Learning2024/1/1
- Any-point Trajectory Modeling for Policy Learning2024/1/1
- Social-Transmotion: Promptable Human Trajectory Prediction2023/12/1
- Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization2023/11/1
- Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning2023/11/1
- JRDB-Traj: A Dataset and Benchmark for Trajectory Forecasting in Crowds2023/11/1
- Imitation Learning from Observation with Automatic Discount Scheduling2023/10/1
- Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own2023/10/1
- DexCatch: Learning to Catch Arbitrary Objects with Dexterous Hands2023/10/1
- CasIL: Cognizing and Imitating Skills via a Dual Cognition-Action Architecture2023/9/1
- Policy Contrastive Imitation Learning2023/7/1
- A Universal Semantic-Geometric Representation for Robotic Manipulation2023/6/1
- Programmatically Grounded, Compositionally Generalizable Robotic Manipulation2023/4/1
- For Pre-Trained Vision Models in Motor Control, Not All Policy Learning Methods are Created Equal2023/4/1
- Decision Transformer under Random Frame Dropping2023/3/1
- Efficient Exploration Using Extra Safety Budget in Constrained Policy Optimization2023/2/1
- A Policy Optimization Method Towards Optimal-time Stability2023/1/1
- Planning for Sample Efficient Imitation Learning2022/10/18
- The Software Stack That Won the Formula Student Driverless Competition2022/10/1
- USEEK: Unsupervised SE(3)-Equivariant 3D Keypoints for Generalizable Manipulation2022/9/1
- Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming2022/6/1
- Mastering Atari Games with Limited Data2021/11/1
- Keyframe-Focused Visual Imitation Learning2021/6/1
- Deep Learning Traversability Estimator for Mobile Robots in Unstructured Environments2021/5/1
- Conv1D Energy-Aware Path Planner for Mobile Robots in Unstructured Environments2021/4/1
- NDT-Transformer: Large-Scale 3D Point Cloud Localisation using the Normal Distribution Transform Representation2021/3/1
- Fighting Copycat Agents in Behavioral Cloning from Observation Histories2020/10/1
- Deep Learning for Spacecraft Pose Estimation from Photorealistic Rendering2019/7/1
- Risk Averse Robust Adversarial Reinforcement Learning2019/4/1
- Fast Cylinder and Plane Extraction from Depth Cameras for Visual Odometry2018/3/1
- SPLODE: Semi-Probabilistic Point and Line Odometry with Depth Estimation from RGB-D Camera Motion2017/8/1
- Probabilistic RGB-D Odometry based on Points, Lines and Planes Under Depth Uncertainty2017/6/1
- Deep Learning for Tactile Understanding From Visual and Haptic Data2015/11/1