Liqiang Nie
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- インラインメモリと再利用可能スキルの融合:視覚-言語-行動モデルのためのメモリ中心フレームワークVLA2026/9/30
VLAモデルに学習可能なメモリトークンを挿入し、クエリ-スキルメモリバンクでスキルを外部化することで、パラメータ更新を抑えつつ新タスクへの適応と破滅的忘却の緩和を実現した。
- NavHarness: エージェント型視覚言語ナビゲーションのための適応的ゴール設定VLA2026/9/30
視覚言語ナビゲーションにおいて、ゴール設定・検証・記憶圧縮・視覚運動実行の4エージェントで構成されるフレームワークを提案し、長期的タスクでの一貫性と推論効率を改善した。
- UniMPA:行動接地型遷移モデリングによる統合記憶・予測・行動モデルVLA2026/9/10
視覚言語行動モデルの遷移実現性ギャップを、記憶・予測・行動を統合した行動接地型インターフェースで解決する手法を提案。
- 空中物体ゴールナビゲーションのための二層意味空間信念マッピングナビゲーション2026/9/8
UAVが未知の屋外環境で目標物体を探すObjectNavのため、VLMの一時的な観測を永続的な空間ガイダンスに変換する二層の信念マップフレームワークを提案し、ベンチマークで最高性能を達成した。
- どこからどのようにへ:自己中心視点ビデオからの連続4Dインタラクション予測動作予測2026/9/8
自己中心視点ビデオから将来の3Dインタラクション位置と全身動作を連続的に予測する手法を提案し、大規模データセットと評価指標も導入した。
- SpaceEra++: ビデオにおける3次元空間推論のための統合フレームワーク空間推論2026/7/2
本論文は、ビデオから3次元空間推論を行うための統合フレームワークSpaceEra++を提案する。フレーム選択戦略と空間整合手法を導入し、空間理解の精度を向上させた。
- RoboSpatialチャレンジ技術報告:選択的推論活性化と参照フレーム曖昧性解消による身体化空間推論空間推論2026/6/30
CVPR 2026のRoboSpatialチャレンジで1位を獲得した、ロボットの空間推論を強化する推論時プロンプト手法を提案した論文。
- 具現化AIのための効率的視覚ポインティング:エージェント駆動データ合成、クロスブロック注意、反復補正視覚ポインティング2026/6/29
言語指示からピクセル座標を推定する視覚ポインティングの精度向上を目指し、データ合成とモデル改良を組み合わせてPointArena 2026で77.2%の精度を達成した。
- 再利用可能なスキルによる新タスク学習:身体化継続学習のためのスキル構成エキスパート継続学習/操作2026/6/14
ロボットが継続的に新しい操作タスクを学びつつ、過去の行動を保持するためのフレームワークSCEを提案。デモを再利用可能なスキルに分解し、スキル構成と遷移を専門化したエキスパートで新タスクを学習する。
- ウェイポイントを超えて:視覚言語ナビゲーションのための軌跡中心のウェイポイントパラダイムナビゲーション2026/6/1
連続環境での視覚言語ナビゲーションにおいて、孤立したウェイポイントではなく実行可能な軌跡に基づく新しいウェイポイント予測手法を提案し、計画と制御の一貫性を向上させた。
- 次世代医療に向けて:知覚・意思決定・行動のための医療具現化AIのサーベイ具現化AI/医療2026/6/1
医療分野における具現化AI(身体を持つAI)の研究を、知覚・意思決定・行動の統合システムとして体系的に整理したサーベイ論文。応用事例やデータセット、実臨床での課題と今後の研究方向をまとめている。
- OmniEgo-R^2: CVPR 2026 EgoCrossチャレンジのためのルーティング推論フレームワークVLA2026/5/23
手術、産業、エクストリームスポーツ、動物視点など複数領域の自己中心視点動画推論を扱うEgoCrossチャレンジで、時間的証拠の正規化や領域非依存の能力ルーティング等を備えた統合推論パイプラインOmniEgo-R^2を提案し、2位を獲得した。
- 抽象から具体へ:視覚言語行動モデルのための行動表現学習VLA2026/5/21
VLAモデルの分布シフト下での性能低下に対し、長期的な行動表現を学習するBehaviorVLAを提案。因果Mambaベースのエンコーダと位相条件付きデコーダで、シミュレーションと実世界で高い成功率とデータ効率を達成。
- ConsisVLA-4D:ロボット操作のための効率的な3D知覚と4D推論における時空間一貫性の向上VLA2026/5/1
本論文は、ロボット操作のための視覚言語行動モデルにおいて、3D知覚と4D推論の時空間一貫性を向上させる統一フレームワークConsisVLA-4Dを提案する。
- EnergyAction: エネルギーに基づくモデルによる片腕から両腕への動作合成両腕操作/エネルギーに基づくモデル/ポリシー転移2026/3/1
本論文では、片腕操作ポリシーをエネルギーに基づくモデルとして表現し、その合成特性を利用して両腕操作タスクへ転移するフレームワークを提案する。時間的・空間的な協調メカニズムと適応的ノイズ除去戦略を導入し、高品質な両腕動作を効率的に生成する。
- 皮質ポリシー:ロボット操作のための二重ストリームビュートランスフォーマーマニピュレーション2026/3/1
静的視点と動的視点の二つのストリームを統合するビュートランスフォーマーを提案し、3D空間理解と動的適応を向上させてロボット操作の性能を大幅に改善した。
- グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーションVLA2026/2/1
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
- SemanticVLA: 効率的なロボット操作のための意味論的整合スパース化と強化VLA2025/11/1
視覚言語行動モデルの知覚冗長性と指示-視覚の浅い整合を解決するため、意味論に基づく視覚プルーニングと階層的融合、行動結合を導入し、LIBEROでOpenVLAを21.1%上回る性能と効率を実現した。
- IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論VLA2025/10/1
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
- CogVLA: 指示駆動型ルーティングとスパース化による認知整合型視覚-言語-行動モデルVLA2025/8/1
人間のマルチモーダル協調に着想を得て、指示に応じて視覚トークンを選択・圧縮し、行動意図に基づき不要トークンを刈り込む3段階のVLAアーキテクチャを提案。学習コストと推論遅延を大幅に削減しつつ、LIBEROベンチマークで97.4%の成功率を達成した。
- DAgger拡散ナビゲーション:視覚言語ナビゲーションのためのDAgger強化拡散ポリシーVLA2025/8/1
視覚言語ナビゲーション(VLN-CE)において、従来の2段階計画を単一の条件付き拡散ポリシーに統合し、DAggerによるオンライン学習で複合誤差を抑えたエンドツーエンド手法を提案。
- ロボットマニピュレーションのための大規模VLMベース視覚-言語-行動モデル:サーベイVLA2025/8/1
大規模視覚言語モデルを基盤とした視覚-言語-行動(VLA)モデルによるロボットマニピュレーション研究を、アーキテクチャの分類や関連分野との統合、今後の方向性を含めて初めて体系的にレビューしたサーベイ論文。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- 3D-AffordanceLLM:大規模言語モデルを活用した3D世界におけるオープンボキャブラリ・アフォーダンス検出3Dアフォーダンス検出2025/2/1
大規模言語モデルを3Dアフォーダンス知覚に導入し、自然言語の指示からアフォーダンス領域を推論・セグメンテーションするフレームワークを提案。
- EPD: 長期記憶抽出・文脈認識計画・反復的意思決定によるエゴセントリックタスク計画タスク計画2024/7/1
ICML 2024のEgoPlanチャレンジに向け、長期記憶抽出・文脈認識計画・反復的意思決定の3段階からなるタスク計画フレームワークEPDを提案し、エゴセントリックな計画精度53.85%を達成した。
- RoboMP²: マルチモーダル大規模言語モデルによるロボットのマルチモーダル知覚・計画フレームワークマニピュレーション2024/4/1
マルチモーダル大規模言語モデルを活用し、目標条件付き知覚器と検索拡張計画器を組み合わせてロボットマニピュレーションの汎化性能を高めるフレームワークを提案。