Li Zhao
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 単調な進捗を超えて:ロボット模倣のためのリトライ監視価値学習模倣学習2026/6/1
不完全なデモからリトライイベントを疎な監視として用い、誤りに敏感な価値関数を学習し、下流の行動クローニングの重み付けに活用するフレームワークを提案。実ロボット操作タスクで効果を実証。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- VLA-GSE: 一般・専門エキスパートによるVLAのパラメータ効率的ファインチューニングの強化VLA/パラメータ効率的ファインチューニング2026/5/1
VLAモデルのロボット制御への適応を改善するため、凍結バックボーンのスペクトル分解に基づき、一般エキスパートと専門エキスパートを導入したパラメータ効率的ファインチューニング手法を提案した。
- UniSteer: 人間のガイダンスを活用したVLA適応のための統合ノイズステアリングVLA/強化学習/人間介入2026/5/1
拡散型VLAモデルの実世界適応を効率化するため、人間の修正行動をノイズ空間の強化学習に統合するフレームワークUniSteerを提案。実機実験で成功率を平均66分で20%から90%に向上させた。
- WarmPrior: 時間的先験情報によるフローマッチングポリシーの直線化ロボット制御/生成モデル2026/5/1
ロボット操作タスクにおいて、ガウス分布の代わりに最近の行動履歴から構築した時間的先験分布を生成ポリシーのソース分布として用いることで、成功率が向上することを示した論文。
- 何を無視し、何に反応するか:VLAモデルの視覚的に頑健なRLファインチューニングVLA/RLファインチューニング2026/5/1
VLAモデルのRLファインチューニングにおいて、視覚変化がタスクに無関係か挙動変更を要するかを区別する補助目的を追加し、視覚的頑健性を向上させるPAIR-VLAを提案した。
- 身体化AIのための加法的合成潜在行動の学習VLA2026/4/3
視覚遷移から潜在行動を学習する際に、物理運動の加法的・合成的構造を強制するモデルAC-LAMを提案し、下流のポリシー学習の性能を向上させた。
- MVP-LAM: 視点間再構成による行動中心の潜在行動学習VLA2026/2/1
複数視点の動画を用いて、ある視点の潜在行動が別視点の未来を説明するように学習させ、真の行動と強く相関する行動中心の潜在行動を獲得する手法を提案。VLA事前学習に用いることで下流のマニピュレーション性能を向上させた。
- 発見・学習・強化:多様なRL生成軌道による視覚-言語-行動事前学習のスケーリングVLA2025/11/1
強化学習で多様な行動パターンを発見し、VLAモデルの事前学習用データを自動生成するフレームワークDLRを提案。標準RLより多様で高成功率の軌道を生成し、下流タスク性能とデータスケーリングを改善する。
- VLAはVLMからいかに効果的に継承するのか?VLA2025/11/1
絵文字を使った卓上操作タスクでVLAがVLMの事前知識を継承する条件を診断し、パラメータ効率微調整やVLM凍結などの手法を比較した。
- 共進化する潜在行動ワールドモデルワールドモデル2025/10/30
潜在行動モデルとワールドモデルをウォームアップ段階を介して初めて同時学習させ、相互に進化させる新手法CoLA-Worldを提案した。
- 作業区間の予防安全に向けたマルチセンサフュージョンによるインフラセンサ活用型車両データ生成マルチセンサフュージョン2025/9/1
路側カメラとLiDARを統合し、カルマンフィルタによる遅延融合で車両軌跡を高精度に推定する枠組みを構築し、作業区間での実証実験で有効性を示した。
- 人間のデモを超えて:VLA学習用データを生成する拡散ベース強化学習VLA2025/9/1
拡散モデルを用いた強化学習で高品質・低分散な軌道を生成し、人間のデモなしでVLAモデルを学習させる手法を提案。LIBEROベンチマークで人間データやガウスRLより高い成功率を達成。
- デジタルツイン環境における作業帯安全のための履歴予測注意機構に基づく軌道予測軌道予測2025/8/1
デジタルツインと協調シミュレーションを用いて、履歴予測注意機構により車両軌道を予測し、高速道路作業帯での予防的安全警告を生成するシステムを提案した。
- PIG-Nav: 事前学習済み画像ゴールナビゲーションモデルのための重要知見ナビゲーション2025/7/1
視覚ベースのロボットナビゲーションのための事前学習戦略を検討し、早期融合ネットワーク構造と補助タスクの導入、ゲーム動画データセットの効率的なラベリング手法を提案することで、ゼロショットおよびファインチューニング性能を大幅に向上させた。
- villa-X:Vision-Language-Actionモデルにおける潜在行動モデリングの強化VLA2025/7/1
VLA事前学習に潜在行動(2フレーム間の動きの抽象表現)を組み込み、その学習方法と統合方法を改善したViLLAフレームワークvilla-Xを提案。未見の身体でもゼロショットで潜在行動計画を生成でき、シミュレーションと実機のグリッパー・多指ハンド操作で高性能を示した。
- IGOR: 身体性AI基盤モデルのための画像ゴール表現による原子的制御単位VLA2024/11/1
画像間の変化を潜在行動に圧縮し、人間と多様なロボットに共通する意味的に一貫した行動空間を学習することで、知識転移や言語との整合、ロボット制御を可能にする基盤モデルを提案した。
- TD3 with Reverse KL Regularizer for Offline Reinforcement Learning from Mixed Datasets2022/12/5