Kai Liu
Chongqing University
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DualWAM: 非同期グローバル計画と局所修正のためのデュアルシステム世界行動モデルVLA2026/9/21
グローバル計画と手首視点による局所修正を非同期に分離し、高頻度な閉ループ制御を可能にした世界行動モデル。FrankaとGalbotでのゼロショット操作で成功率を平均4.5ポイント向上させ、16.6倍の高速化を実現。
- GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリングVLA2026/8/16
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
- EvoHIL: 自己進化型報酬とフローマッチングによるポリシー最適化を用いた堅牢な人間参加型強化学習強化学習2026/8/1
人間参加型強化学習において、報酬モデル・行動生成・視覚ドメインの3つの限界を同時に適応させる統一フレームワークEvoHILを提案し、照明変化下の6つの操作タスクで性能を向上させた。
- WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦するVLA2026/7/1
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
- 大規模基盤モデルにおける音声視覚知能マルチモーダル2026/5/5
音声と視覚の統合的理解・生成・対話を大規模基盤モデルの観点から体系的に整理した初のサーベイ論文。
- 照明変化に頑健な人間参加型ロボット強化学習強化学習2026/5/1
照明変化による視覚分布のずれで性能が落ちる問題に対し、追加の実ロボット操作なしで、画像の再照明と忘却防止機構を組み合わせたオフライン微調整フレームワークRoHILを提案した。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- 身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイVLA2025/8/1
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
- EdgeVO: An Efficient and Accurate Edge-based Visual Odometry2023/2/1
- VPH+ and MPC Combined Collision Avoidance for Unmanned Ground Vehicle in Unknown Environment2018/5/1
- A GPS Pseudorange Based Cooperative Vehicular Distance Measurement Technique2012/7/1