Gen Li
Nanyang Technological University
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LIBERO-MAX:世界が変化したときロボット政策は適応するか?VLA2026/9/29
タスク実行中に環境変化が起きた際のロボット政策の頑健性を評価する8,000ペアのベンチマークLIBERO-MAXを提案し、14のVLA政策が11.0〜25.7ポイントの成功率低下を示すことを明らかにした。
- mmHRI: ミリ波レーダによるプライバシー保護型ヒューマンロボットインタラクションHRI2026/9/28
ミリ波レーダで人の動作と3D姿勢を推定し、それをテキスト指示に変換してVLAポリシーを制御する、プライバシー保護型のロボットマニピュレーション枠組みを提案した。
- 高速計画と忠実な行動:階層型視覚言語行動モデルにおける計画・実行ギャップの解消VLA2026/9/25
階層型VLAの計画器と実行器の不一致を分析し、ブロック自己回帰デコーディングと正規化ゴール変調で計画遅延を8.7倍削減しつつ計画の活用を改善した。
- HarnessPAI:物理AIのための進化するハーネスVLA2026/9/24
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
- A4A: 人間のデモからの行動指向4Dアフォーダンスのクロスエンボディ転移操作学習/クロスエンボディ転移2026/9/5
人間のデモから行動指向の4Dアフォーダンス(相互作用点の将来軌跡)を学習し、ロボットポリシーの事前学習に利用することで、多様なVLAポリシーの操作性能を向上させる手法を提案した。
- ADAPT: 俊敏な拡散行動事前分布による堅牢で操縦可能なオンライン文章駆動ヒューマノイド制御ヒューマノイド制御2026/9/1
テキスト条件付きのヒューマノイド全身制御をエンドツーエンドで行うフレームワークを提案。拡散ベースの行動事前分布と残差強化学習を組み合わせ、言語コマンドに応じた多様な動作を直接実行しつつ、長期的な堅牢性とスムーズな切り替えを実現する。
- 物理フィルタリングがロボット学習の汎化を促進するロボット学習/汎化2026/8/24
この論文は、物理フィルタリングによるフィードバック機構(PhyFilter)を提案し、限られた訓練データでもロボットが動的環境の不確実性に対して効果的に汎化できることを示した。
- 統一条件・行動モデリングによる高精度ワンステップ行動生成マニピュレーション2026/8/17
条件と行動を共有トークン空間で統一的にモデリングするUCA-Flowを提案し、推論速度を大幅に向上させつつ成功率を9.3ポイント改善した。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデルヒューマノイド2026/8/1
言語指示と視覚・状態入力から、移動と操作を同時に行う全身行動を直接予測する世界行動モデルを提案し、実機で11種類の家庭タスクを達成した。
- GIVE: 視覚言語行動モデルにおける人間のジェスチャーの接地VLA/ジェスチャー理解2026/6/1
人間のジェスチャーを視覚・意味の2経路でVLAモデルに統合し、曖昧な指示でも物体接地と操作意図の推定を改善する手法を提案。実世界実験で成功率を大幅に向上させた。
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- ActiveVital: ホームヘルスケアロボットのための幾何学を考慮した身体装着型バイタルサイン計測ヘルスケアロボティクス2026/6/1
家庭用ロボットが非接触で呼吸数と心拍数を正確に計測できるよう、ミリ波レーダーの観測角度を視覚情報で能動的に調整するフレームワークを提案した。
- ADAPT: 解析的擾乱認識型ポリシートレーニングによる人型ロコモーション歩行2026/6/1
外力による擾乱を物理モデルに基づく観測器で推定し、その情報をポリシーに直接入力することで、人型ロボットの外乱に対する頑健性と速度追従精度を向上させるフレームワークを提案した。
- MARSポリシー:必要な時だけマルチモーダルに模倣学習2026/5/1
ロボット操作の模倣学習において、タスクの全フェーズで多様性が必要とは限らないことに着目し、必要な時だけ確率的生成を適応的に行い、単一モードのフェーズでは決定的学習に切り替えるMARSポリシーを提案した。シミュレーションと実機で成功率向上と推論遅延削減を実証した。
- Gaze2Act: 視線条件付き視覚言語行動ポリシーによる対話的ロボット操作VLA2026/5/1
人間の視線を意図信号として活用し、ロボット操作の精度を高める新しいVLAフレームワークを提案した論文。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- FLASH: スパースサンプリングによる効率的な視覚運動ポリシーVLA2026/5/1
拡散モデルやフローマッチングの反復処理による遅延を解消するため、ルジャンドル多項式で軌道を表現し、履歴係数から生成を開始することで単一推論で長い行動範囲を実現する高速な視覚運動ポリシーを提案した。
- フィードバックワールドモデルによる拡散ポリシーの精密なガイダンスロボット操作2026/5/1
実行時の観測を利用して予測誤差をオンライン補正するフィードバックワールドモデルを提案し、分布シフト下での予測精度とポリシー性能を向上させた。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- CompassAD: 機能が競合する物体における意図駆動型3Dアフォーダンス接地3Dアフォーダンス接地2026/4/1
複数の物体が同じ機能を持つ場合に、自然言語の意図に基づいて正しい物体の3Dアフォーダンス領域を特定する新しいタスクを提案し、ベンチマークと手法を構築した。
- RoboForge: 物理最適化されたテキスト誘導型ヒューマノイド全身歩行歩行2026/3/1
テキストから生成した人間らしい動作をヒューマノイドロボットで物理的に実行可能にするため、物理的妥当性を最適化する双方向結合フレームワークを提案した。
- Action-to-Actionフローマッチング:固有感覚履歴を起点とした高速ロボット方策VLA2026/2/1
ランダムノイズではなく過去の固有感覚行動を起点にフローマッチングで行動生成する方策を提案し、1ステップ推論と高い汎化性能を実現した。
- 実行履歴に着目した拡散ポリシーによる長期的ロボット操作における多峰性行動の曖昧性解消マニピュレーション2026/2/1
ロボットの実行履歴を視覚空間に投影して拡散ポリシーの条件に加えることで、長期タスクで観測が似ていても行動が異なる曖昧さを解消し、背景の乱れにも頑健にした手法を提案。
- PALM: アフォーダンス推論と進捗認識による長期的ロボットマニピュレーションのためのポリシー学習VLA2026/1/1
視覚言語行動モデルにアフォーダンス推論とサブタスク進捗予測を組み込み、長期的な多段階ロボット操作の成功率と汎化性能を大幅に向上させた研究。
- Evo-1: 意味的整合性を保つ軽量Vision-Language-ActionモデルVLA2025/11/1
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
- Mask2IV: マスク軌跡によるインタラクション中心の動画生成動画生成2025/10/1
人間やロボットが物体と相互作用する動画を、アクターと物体の軌跡を予測してから生成する2段階フレームワークで高品質に生成する手法。
- Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデルVLA2025/7/1
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。
- 深度と意味プロンプトを活用したリソース効率の良いアフォーダンス推定アフォーダンス推定2025/3/1
RGB画像に深度画像をプロンプトとして組み込み、テキスト特徴で注意を誘導する軽量なアフォーダンス推定フレームワークを提案し、公開データセットで精度向上とパラメータ削減を実現した。
- F3T:ロボットのための3D力と温度を数学的に分離できるソフト触覚ユニット触覚2024/9/1
多層構造のソフトセンサで、法線圧力・全方向の接線力・温度を物理的および数学的に分離して計測できる触覚ユニットを開発した。
- 一人称視点動画から精密なアフォーダンスを学習しロボット操作に応用アフォーダンス2024/8/1
一人称視点動画から人手ラベルなしで精密なアフォーダンス注釈を生成し、幾何情報と視覚基盤モデルで汎化性能を高め、道具把持やロボットから人への受け渡しなどの操作を実現するシステムを提案した。
- 抽象的な指示に従い複雑な動的タスクを遂行するロボットフレームワークVLA2024/6/1
LLMと知識ベース、力・視覚フィードバックを統合し、「温かい飲み物を作って」のような抽象指示を解釈して、コーヒー抽出や皿盛り付けなどの長期的タスクを不確実な環境で実行する枠組みを提案。
- TRTM: Template-based Reconstruction and Target-oriented Manipulation of Crumpled Cloths2023/8/1
- Learning Topological Motion Primitives for Knot Planning2020/9/1