Yong-Lu Li
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboICL: GPT-6 Astraによる身体性を備えたインコンテキスト学習VLA2026/9/28
ロボット制御のためのインコンテキスト学習フレームワークRoboICLを提案し、GPT-6 Astraのゼロショット性能を大幅に向上させた。
- 人口規模にスケーラブルなマルチエージェント世界モデリング世界モデル2026/8/9
エージェント数に依存しない共有世界状態と統一レンダリングインターフェースを導入し、推論時にエージェント数を任意に拡張できるマルチエージェント世界モデルKhoraを提案した。
- 疲労を考慮したキャラクター制御キャラクターアニメーション2026/8/1
物理シミュレーションで人間らしい動きを再現するため、疲労を有限なエネルギー源の代理として導入し、疲労状態に応じた一般的な動作模倣ポリシーを獲得した。
- HAT-4D: 人間とエージェントの協調による単眼ビデオからの4D複数物体インタラクション復元4D再構成2026/6/26
単眼ビデオから複数物体の3D形状・時間変化・物理的相互作用を復元するエージェントフレームワークを提案し、人間のフィードバックを統合して深度曖昧性や遮蔽問題を解決する。
- ロボット操作における関節部品知覚の再考知覚/操作2026/6/6
関節部品の幾何学的構造を抽象化した「GPS」表現を提案し、VRデバイスで1分間の注釈で高品質なデータを収集、単一RGB-D画像から汎用的なGPSモデルを学習して操作に応用した。
- ATHENA: ロボットデータキュレーションのための高速マルチタスク異種影響関数データキュレーション2026/6/1
大規模VLAモデルの模倣学習において、各デモの影響を高速に計算する影響関数フレームワークATHENAを提案し、50%のデータで全データ学習と同等以上の性能を達成した。
- AetheRock: 力誘導型視覚触覚学習のための腕装着型ロボット教示システム触覚/ロボット学習2026/6/1
腕に装着する触覚・力覚センサ付きデバイスと、力と視覚で触覚学習を誘導するフレームワークを提案し、接触を伴う操作タスクのデータ収集と学習効率を向上させた。
- UniviewVLA:世界モデリングを備えた統合マルチビュー視覚言語行動モデルVLA/操作2026/6/1
標準的な2つのカメラ観測のみから、世界モデルを用いてマルチビューの未来シーンを生成し、遮蔽された情報を補完して行動予測を改善するVLAモデルを提案。推論高速化のためのトークン圧縮と、動的な視点選択手法も導入。
- ChronoFlow-Policy: 視覚運動ポリシー学習における過去・現在・未来の相互作用フローの統合VLA2026/6/1
物体とグリッパーの3Dキーポイントを用いて過去・現在・未来の相互作用ダイナミクスを統一的に表現するChronoFlowを導入し、これを拡散ベースの視覚運動ポリシーと共学習させることで、長期的・非マルコフ的操作タスクでの性能を向上させた。
- EgoGuide: 効率的なロボット不要のデモ収集と学習のための自己中心視点ガイド模倣学習/データ収集2026/6/1
手首と頭部の自己中心視点を同期記録し、オンラインの視覚・幾何学的品質ガイドを提供するデモ収集インターフェースを提案。さらに、視点変動に頑健なゲート付き自己中心残差ポリシーを導入し、データ効率と遮蔽耐性を向上させた。
- Wh0: 生成的世界モデルによるスケーラブルな自己中心視点の人間手操作データ生成VLA/データ生成2026/6/1
生成ビデオ世界モデルを用いて、ロボット学習に使える自己中心視点の人間手操作ビデオデータを大量生成し、実ロボットデータと組み合わせて器用な操作VLAモデルの性能を大幅に向上させる手法を提案した。
- LIDEA: 暗黙的特徴蒸留と明示的幾何学的整合による人間からロボットへの模倣学習模倣学習2026/4/1
人間のデモ動画を利用してロボットの模倣学習を効率化するため、2D特徴蒸留と3D幾何学的整合を組み合わせたフレームワークLIDEAを提案した。
- OmniXtreme:高ダイナミックヒューマノイド制御における汎用性の壁を突破ヒューマノイド制御2026/2/1
多様なモーションの学習と実機向けの物理的調整を分離したフレームワークを提案し、ヒューマノイドが多様で高難度な動きを実機で高精度に追従できるようにした。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- グレートマーチ100:身体性AIエージェント評価のための100の詳細指向タスクVLA評価ベンチマーク2026/1/1
ロボット学習の評価に向けて、多様な相互作用とロングテール行動を網羅する100の詳細設計タスク「GM-100」を提案し、複数のVLAモデルの性能差を明確に評価できることを示した。
- 視覚シンボルによるマニピュレーション失敗の診断・修正・学習VLA2025/12/1
視覚シンボルを用いてロボットマニピュレーションの失敗を診断し、テキストと視覚の両方で修正ガイダンスを提供するフレームワークViFailbackを提案し、大規模データセットとベンチマークを構築した。
- IPR-1: 対話型物理推論器VLA2025/11/19
1000以上の多様なゲームで物理法則と因果関係を学習し、世界モデルの予測とVLMの推論を統合して未知のゲームにもゼロショットで対応するエージェントを提案。
- 効率的な視覚運動学習のためのL1サンプルフロー模倣学習2025/11/1
フローマッチングの多峰性を保ちつつ、L1回帰の効率性を活かすため、2ステップでサンプリングするL1 Flowを提案し、模倣学習ベンチマークで有効性を示した。
- RoboHiMan: 長期的マニピュレーションにおける構成的一般化のための階層的評価パラダイムマニピュレーション2025/10/1
長期的なマニピュレーションタスクにおけるスキル構成の一般化を評価するため、多様な摂動下での原子タスクと構成タスクのベンチマークHiMan-Benchと3つの評価パラダイムを提案し、代表的なモデル・アーキテクチャの能力ギャップを明らかにした。
- exUMI: 拡張可能なロボット教示システムと行動認識型タスク非依存触覚表現触覚2025/9/1
触覚データ収集デバイスexUMIと、行動を考慮した時間的触覚予測による表現学習TPPを提案し、接触を伴うマニピュレーションの模倣学習性能を向上させた研究。
- SpecPrune-VLA: 行動認識型自己投機的プルーニングによる視覚言語行動モデルの高速化VLA2025/9/1
VLAモデルの推論を高速化するため、時空間的一貫性を利用して視覚トークンを行動レベルと層レベルで動的に枝刈りする学習不要の手法を提案し、成功率を維持しつつ最大1.7倍の高速化を実現した。
- SIME: モーダルレベル探索による方策の自己改善模倣学習/自己改善2025/5/1
ロボットが人間のデータから初期学習した後、環境との相互作用を通じて自己改善するために、モーダルレベルの探索とデータ選択を組み合わせた手法を提案し、シミュレーションと実機で有効性を示した。
- Dense Policy:双方向自己回帰による行動学習マニピュレーション2025/3/1
軽量なエンコーダのみのアーキテクチャで行動系列を粗から細へと対数的な推論時間で展開する、双方向自己回帰型のロボットマニピュレーション方策を提案。
- 行動の前に動作を:物体運動をマニピュレーション条件として拡散する手法マニピュレーション2024/11/1
観測から物体の将来の姿勢系列を予測し、それを条件としてロボットの行動系列を拡散生成するプラグアンドプレイ型モジュールMBAを提案し、模擬・実環境で既存方策の性能を大幅に向上させた。
- ImDy: 模倣観測からの人間逆動力学逆動力学2024/10/1
人間の動作模倣アルゴリズムと物理シミュレータを組み合わせて大規模な逆動力学データセットImDyを構築し、関節トルクと床反力を同時推定するデータ駆動型ソルバを学習した研究。
- 人間とエージェントの共同学習による効率的なロボットマニピュレーションスキル獲得マニピュレーション2024/7/1
人間と学習型アシストエージェントがロボットの制御を共有し、データ収集とロボットの訓練を同時に行うことで、効率的にマニピュレーションスキルを獲得するシステムを提案した。
- HumanVLA:視覚言語指示による物理ヒューマノイドの物体再配置VLA2024/6/1
視覚と言語の指示に従って物理ヒューマノイドが物体を再配置するためのVLAモデルを、教師方策の蒸留により構築し、新データセットで有効性を示した。