Rui Shao
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ATI-VLA: 行動中心の予測型視覚-言語-行動モデルVLA2026/10/1
予測観測と行動の表現を共有コードブックで揃え、予測潜在を行動生成に適応的に注入することで、操作タスクの性能と収束速度を向上させたVLAモデル。
- インラインメモリと再利用可能スキルの融合:視覚-言語-行動モデルのためのメモリ中心フレームワークVLA2026/9/30
VLAモデルに学習可能なメモリトークンを挿入し、クエリ-スキルメモリバンクでスキルを外部化することで、パラメータ更新を抑えつつ新タスクへの適応と破滅的忘却の緩和を実現した。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- UniMPA:行動接地型遷移モデリングによる統合記憶・予測・行動モデルVLA2026/9/10
視覚言語行動モデルの遷移実現性ギャップを、記憶・予測・行動を統合した行動接地型インターフェースで解決する手法を提案。
- 抽象から具体へ:視覚言語行動モデルのための行動表現学習VLA2026/5/21
VLAモデルの分布シフト下での性能低下に対し、長期的な行動表現を学習するBehaviorVLAを提案。因果Mambaベースのエンコーダと位相条件付きデコーダで、シミュレーションと実世界で高い成功率とデータ効率を達成。
- ConsisVLA-4D:ロボット操作のための効率的な3D知覚と4D推論における時空間一貫性の向上VLA2026/5/1
本論文は、ロボット操作のための視覚言語行動モデルにおいて、3D知覚と4D推論の時空間一貫性を向上させる統一フレームワークConsisVLA-4Dを提案する。
- 適応的視覚トークンキャッシュによるVision-Language-Actionモデルの高速化学習VLA2026/2/1
VLAモデルの推論を、再利用する視覚トークンを動的に選ぶ学習可能なポリシーとして最適化し、精度を保ちながら最大1.76倍の高速化を実現した。
- 一度注入すれば生き残る:下流ファインチューニングを耐え抜くVLAモデルへのバックドア攻撃VLAセキュリティ2026/2/1
VLAモデルのファインチューニングで消えにくいモジュールにバックドアを注入し、ユーザー側の追加学習後も攻撃が持続する手法INFUSEを提案した。
- グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーションVLA2026/2/1
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
- H-GAR: 目標駆動型の観測・行動洗練による階層的インタラクションフレームワークマニピュレーション2025/11/1
目標観測と粗い行動スケッチを起点に、観測と行動を相互に洗練させる階層的フレームワークを提案し、ロボットマニピュレーションの精度を向上させた。
- SemanticVLA: 効率的なロボット操作のための意味論的整合スパース化と強化VLA2025/11/1
視覚言語行動モデルの知覚冗長性と指示-視覚の浅い整合を解決するため、意味論に基づく視覚プルーニングと階層的融合、行動結合を導入し、LIBEROでOpenVLAを21.1%上回る性能と効率を実現した。
- ロボットマニピュレーションのための大規模VLMベース視覚-言語-行動モデル:サーベイVLA2025/8/1
大規模視覚言語モデルを基盤とした視覚-言語-行動(VLA)モデルによるロボットマニピュレーション研究を、アーキテクチャの分類や関連分野との統合、今後の方向性を含めて初めて体系的にレビューしたサーベイ論文。
- CogVLA: 指示駆動型ルーティングとスパース化による認知整合型視覚-言語-行動モデルVLA2025/8/1
人間のマルチモーダル協調に着想を得て、指示に応じて視覚トークンを選択・圧縮し、行動意図に基づき不要トークンを刈り込む3段階のVLAアーキテクチャを提案。学習コストと推論遅延を大幅に削減しつつ、LIBEROベンチマークで97.4%の成功率を達成した。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- マルチモーダル大規模言語モデルによるUAV群知能化:効率的で自律的な空中システムに向けて群制御2025/6/1
マルチモーダル大規模言語モデル(MLLM)をUAV群に統合し、森林火災消火を事例に、人間との対話・群タスク計画・火災評価・タスク実行の枠組みを検討したサーベイ兼ケーススタディ。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- RoboMP²: マルチモーダル大規模言語モデルによるロボットのマルチモーダル知覚・計画フレームワークマニピュレーション2024/4/1
マルチモーダル大規模言語モデルを活用し、目標条件付き知覚器と検索拡張計画器を組み合わせてロボットマニピュレーションの汎化性能を高めるフレームワークを提案。