Qi Lv
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- エルミート曲線による視覚言語行動モデルの軌道事前分布VLA2026/8/1
VLAモデルのアクションチャンクをエルミート曲線でパラメータ化し、滑らかさと連続性を明示的に強制する3つの変種を提案。正則化として用いるのが最も効果的で、実ロボットタスクで成功率を大幅に向上させた。
- RoboSpatialチャレンジ技術報告:選択的推論活性化と参照フレーム曖昧性解消による身体化空間推論空間推論2026/6/30
CVPR 2026のRoboSpatialチャレンジで1位を獲得した、ロボットの空間推論を強化する推論時プロンプト手法を提案した論文。
- 具現化AIのための効率的視覚ポインティング:エージェント駆動データ合成、クロスブロック注意、反復補正視覚ポインティング2026/6/29
言語指示からピクセル座標を推定する視覚ポインティングの精度向上を目指し、データ合成とモデル改良を組み合わせてPointArena 2026で77.2%の精度を達成した。
- ActionMap: ボクセル行動ヒートマップによるロボットポリシー学習VLA/行動表現2026/6/5
既存のVLAモデルの行動デコーダを、行動空間上のボクセルヒートマップを予測するヘッドに置き換えることで、学習効率と性能を向上させる手法を提案した論文。
- 多様性の罠を回避するアンカー中心適応によるロボット操作マニピュレーション2026/5/1
ロボット操作におけるVLAモデルの実機適応で、多様なデモ収集が逆効果になる「多様性の罠」を特定し、アンカー中心適応(ACA)という2段階フレームワークを提案。実機実験で成功率を向上させた。
- LARY: 汎用視覚-行動対応のための潜在行動表現ベンチマークVLA2026/4/1
人間の行動ビデオから学習した潜在行動表現の能力を評価する統一ベンチマークを構築し、汎用視覚基盤モデルが専門の潜在行動モデルより優れ、潜在空間が物理行動空間とより良く整合することを示した。
- 皮質ポリシー:ロボット操作のための二重ストリームビュートランスフォーマーマニピュレーション2026/3/1
静的視点と動的視点の二つのストリームを統合するビュートランスフォーマーを提案し、3D空間理解と動的適応を向上させてロボット操作の性能を大幅に改善した。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- 少数ショット視覚言語行動インクリメンタル方策学習VLA2025/4/1
少数の実演から新しい操作タスクを継続的に学習するため、タスク固有プロンプトとタスク関係グラフによる進化戦略を組み合わせたTOPICを提案した論文。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- 3D-AffordanceLLM:大規模言語モデルを活用した3D世界におけるオープンボキャブラリ・アフォーダンス検出3Dアフォーダンス検出2025/2/1
大規模言語モデルを3Dアフォーダンス知覚に導入し、自然言語の指示からアフォーダンス領域を推論・セグメンテーションするフレームワークを提案。
- EPD: 長期記憶抽出・文脈認識計画・反復的意思決定によるエゴセントリックタスク計画タスク計画2024/7/1
ICML 2024のEgoPlanチャレンジに向け、長期記憶抽出・文脈認識計画・反復的意思決定の3段階からなるタスク計画フレームワークEPDを提案し、エゴセントリックな計画精度53.85%を達成した。
- RoboMP²: マルチモーダル大規模言語モデルによるロボットのマルチモーダル知覚・計画フレームワークマニピュレーション2024/4/1
マルチモーダル大規模言語モデルを活用し、目標条件付き知覚器と検索拡張計画器を組み合わせてロボットマニピュレーションの汎化性能を高めるフレームワークを提案。