論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/21 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/社会的知能AI
信念なき行動:視覚言語モデルにおける心の理論の協調的社会行動への変換の測定
心の理論の推論と社会的行動のギャップを測るベンチマークMOSAICを導入し、VLMがToM制約下で一貫した行動を生成できないことを示した。
原題: Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models / Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf
日本語で読む → - 論文VLA/操作AI
ForeTime-VLA: 世界行動モデルからの因果的未来トークン蒸留によるコンベアベルト操作
コンベア上の移動物体を操作するため、将来の接触イベントを予測するVLAポリシーを提案。凍結した世界行動モデルから未来情報を蒸留し、推論時のコストを抑えつつ把持成功率を大幅に向上させた。
原題: ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation / Siyuan Ma, Yutian Zhang, Boshi Zhang 他
日本語で読む → - 論文VLAロボティクス
Logic-VLA: 時間論理条件付き視覚言語行動モデル
自然言語指示に加えて、推論時に与えられる信号時相論理(STL)仕様を満たすように行動を調整するVLAモデルを提案。STLエンコーダと2段階のポリシー適応により、形式要件の充足率を大幅に向上させつつ、通常のタスク成功率をほぼ維持する。
原題: Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model / Celina Shiyu Wang, Yiqi Zhao, Junjie Ye 他
日本語で読む → - 論文VLAAI
汎用身体性知能に向けて:大規模言語モデル、知識ベース、推論能力を統合した次世代AIエージェントの構築
大規模言語モデル、知識ベース、推論能力を統合し、物理環境で行動する汎用身体性知能エージェントの実現に向けた概念フレームワークと課題を整理したサーベイ論文。
原題: Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents / Fujiang Yuan, Xia Huang, Lusheng Wang 他
日本語で読む → - 論文VLA/強化学習AI
EXIMO: VLMによるVLAポリシー探索のガイド
VLAポリシーの効率的なファインチューニング手法EXIMOを提案。VLMをプランナーとして使い、長期的なタスクを分解してデータ収集し、模倣学習とオフポリシーRLで最適化する。
原題: EXIMO: VLM Guided Exploration of VLA Policies / Bhavya Sukhija, Oliver Groth, Mohit Shridhar 他
日本語で読む → - 論文VLA/安全性AI
SafeBranch: 身体化エージェントのための分岐ペア安全性アライメント
身体化エージェントの安全性を高めるため、安全違反を起こした軌道を巻き戻して安全な代替行動とペアにし、その分岐ペアで学習するフレームワークを提案。タスク成功率を保ちつつ安全性を大幅に向上させた。
原題: SafeBranch: Branch-Pair Safety Alignment for Embodied Agents / Hyunse Lee, Jiwoo Jeong, Haneul Lee 他
日本語で読む → - 論文VLA/継続学習ロボティクス
OrthoSkillVLA: 勾配情報に基づくスキル部分空間適応による継続的スキル学習
事前学習済みのVLAモデルを複数のスキルに順次適応させる際に生じる破滅的忘却を防ぐため、VLMとActionHeadに別々の部分空間制約を課し、出力層には軽量なMoEデコーダを導入するパラメータ効率的な継続学習フレームワークを提案した。
原題: OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation / Jiaqi Wang, Zhou Fang, Qiongfeng Shi 他
日本語で読む → - 論文VLA/操作ロボティクス
自己実演生成制御によるVLAのファインチューニング:多タスク操作のための手法
新しいロボットにVLAモデルを展開する際の性能低下を防ぐため、ゼロショットVLAから生成したオンラインインタラクションロールアウトを追加学習データとして用いる自己教師ありファインチューニング手法を提案。
原題: Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation / Prachi Garg, Steve Xing, Prahit Yaugand 他
日本語で読む → - 論文VLAロボティクス
RoboEdit: 人間の操作動画をスケーラブルなロボット経験へ変換する
人間の操作動画を、ロボットの学習に使えるアクション整合性のある物理的に妥当なロボット動画へ変換するビデオ編集スイートを提案。大規模データセットと編集エンジンを構築し、実世界の操作タスクで有効性を実証した。
原題: RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience / Yaowei Guo, Zeng Tao, Yuxin Jiang 他
日本語で読む → - 論文VLA機械学習
役割条件付きサブトークンルーティングによる効率的な視覚言語行動ポリシー
視覚言語行動モデルの推論コスト削減のため、保持トークンの値表現を役割に応じて圧縮する新しい手法RoleSubを提案。トークン削減と組み合わせ、LIBEROベンチマークで高い性能を達成。
原題: Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies / Wei Jiang, Wei Wang
日本語で読む → - 論文VLAロボティクス
タスクプロトタイプ誘導フローマッチングによる視覚言語ロボット操作の少数ショット汎化
少数の実演からタスクの位相レベルのプロトタイプを抽出し、フローマッチングの初期分布と速度場を誘導することで、視覚言語ロボット操作を新しい手順に少数ショットで適応させる手法を提案。
原題: Task-Prototype Guided Flow Matching for Few-Shot Generalization in Vision-Language Robot Manipulation / Yizhao Wang, Guantao Zhang, Jingbo Wang
日本語で読む → - 論文VLA/テスト時拡張ロボティクス
検索前に再利用せよ:具現化マルチモーダルポリシーのテスト時拡張における余裕と相補性の診断
凍結された視覚-言語-行動(VLA)ポリシーをテスト時に改善する際、追加サンプリングと外部デモ検索のどちらが有効かを、回復可能な余裕と検索相補性という2つの指標で診断し、選択器が性能を向上させることを示した。
原題: Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies / Yuhwan Jeong, Kuk-Jin Yoon
日本語で読む → - 論文VLA/ベンチマーク/安全性ロボティクス
LIBERO-VIFO: 視覚言語行動モデルにおける視覚的手がかり追従の能力と安全性のベンチマーク
VLAモデルが視覚的手がかりを正しく追従できるか、また許可されていない手がかりを無視できるかを評価するベンチマークLIBERO-VIFOを提案し、7つのVLAモデルの評価を通じて、言語指示なしでも視覚的手がかりに従ってタスクを実行するリスクを明らかにした。
原題: LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models / Zhengyan Qian, Rui Yan, Alex Jinpeng Wang 他
日本語で読む → - 論文VLA画像認識
もし、ならば、そうでなければ:視覚言語ナビゲーションにおける条件分岐の診断
視覚言語ナビゲーションエージェントの条件分岐能力を診断するためのベンチマークCondVLNを導入し、分岐条件をシーングラフに基づいて生成し、エージェントの失敗原因を分析した。
原題: If, Then, Otherwise: Diagnosing Conditional Branching in Vision-Language Navigation / Seoyoung Lee, Neel P. Bhatt, Pranay Samineni 他
日本語で読む → - 論文VLAロボティクス
Prism-GRPO: 同一結果グループの分割による高速なVLAポリシー最適化
GRPOの強化学習において、成功/失敗が同一のグループを品質スコアで分割し、学習信号を回復することでロールアウト効率を向上させる手法を提案した。
原題: Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups / Zeyun Deng, Yuzhe Lu, Yawei Wang 他
日本語で読む → - 論文自動運転/VLAロボティクス
Geo-VLA: 地図セマンティクスの内在化による幾何認識型視覚言語行動計画
複雑な運転環境でのVLAモデルの計画性能を向上させるため、幾何学的な地図情報を学習時に内在化するプラグアンドプレイ型フレームワークGeo-VLAを提案した。推論時にはHD地図を不要とし、NAVSIM v1で単眼カメラVLAプランナーとして最高性能を達成した。
原題: Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics / Ran Chen, Jiaxing Ren, Zhikun Zhang 他
日本語で読む → - 論文VLA/安全保証ロボティクス
異種ロボットのための校正済み予測安全:行動条件付きJEPAフレームワークとモデルベース安全シールド
視覚言語行動ポリシーに実行時保証を追加するため、行動条件付きJEPA世界モデルで候補行動のタスク進捗と物理リスクを予測し、モデルベース安全シールドでフィルタリングするパイプラインを提案した。
原題: Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields / Kaiming Zhong, Tianhua Liu, Yue Wang
日本語で読む → - 論文VLA/ヒューマノイドロボティクス
EATR-Stereo: 身体性を考慮したステレオ証拠のルーティングによるヒューマノイド視覚言語行動制御
頭部搭載ステレオカメラを持つヒューマノイドのVLA制御において、主視点のトークンを保持しつつ補助視点の情報を身体状態に応じて選択的に統合するフレームワークを提案し、実機で高い成功率を達成した。
原題: EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control / Songwei Wu, Rui Zhao, Fan Yang 他
日本語で読む → - 論文VLAAI
HaReCAP: 習慣的行動に基づく再帰的大規模言語モデルエージェントの接地
長期的な身体性タスクにおいて、LLMエージェントの葉ノードでの行動接地の冗長性を減らすため、成功軌跡から頻出の葉決定を抽出してオフラインでルール化し、実行時に安全な場合のみLLM呼び出しをスキップするHaReCAPを提案した。
原題: HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents / Shen Liu, Zhenguo Xu, Shaopu Wang 他
日本語で読む → - 論文VLAロボティクス
NebulaVLA: ロボット操作のためのガイドアクションを備えた二周波数視覚言語行動モデル
高レベルの意味推論と低レベルのアクション制御を分離した非同期二周波数アーキテクチャを提案し、異種ロボット間のギャップを埋める統一表現と滑らかな動作を実現するガイドアクションアルゴリズムを導入した。
原題: NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation / Cong Zhao, Shuai Tian, Xu Zhang 他
日本語で読む → - 論文ヒューマノイド/VLA/強化学習ロボティクス
HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
原題: HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL / Langzhe Gu, Chengkai Hou, Meng Li 他
日本語で読む → - 論文VLA/プランニングロボティクス
ニューロシンボリック具現化エージェント
視覚言語モデルとシンボリックプランニングを組み合わせ、家庭内の長期的タスクを実行可能な計画として生成するエージェントを提案。探索と制約付き計画により、実行可能性を保証しつつ高い成功率を達成。
原題: Neurosymbolic Embodied Agents / Mohammad Albinhassan, Yuming Feng, Alessandra Russo 他
日本語で読む → - 論文VLAロボティクス
τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデル
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
原題: $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation / Xiaowei Cai, Yunuo Cai, Bingao Chen 他
日本語で読む → - 論文VLA/操作ロボティクス
SparkVLA: 長期的操作のための適応アクションチャンクを備えた停止認識型階層VLA
階層型VLAシステムにおけるサブタスクの停止タイミングとアクションチャンク長の相互依存関係を単一のランキング問題として定式化し、統一候補セットから最適解を選択する新しい手法を提案した。
原題: SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation / Xunyao Lei, Renjun Wu, Tianlin Huo 他
日本語で読む → - 論文VLAロボティクス
教えて育てる:汎用ロボット学習のためのエージェント中心アーキテクチャ
この論文は、少数のデモから再利用可能なスキルブロックを学習し、新しいシーンでそれらを組み合わせてタスクを実行するエージェント中心のアーキテクチャ(TGL)を提案し、再学習の負担を軽減する。
原題: Teach and Grow: An Agent-Centered Architecture for General Robot Learning / Chang Nie, Zhe Liu, Hesheng Wang
日本語で読む → - 論文VLA画像認識
GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論
マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。
原題: GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning / Zesheng Yang, Lingling Zhang, Xinyu Zhang 他
日本語で読む → - 論文VLA/セキュリティcs.CR
ビットフリップ攻撃による視覚言語行動モデルの脆弱性:行動デコードアーキテクチャが攻撃耐性を左右する
量子化された視覚言語行動(VLA)モデルに対する初のビットフリップ攻撃を提案し、少数のフリップで閉ループ成功率を0%にできることを示した。攻撃に必要なフリップ数は行動ヘッドの種類に依存し、直接回帰やトークンポリシーでは1〜5回、フローマッチングでは100〜300回必要である。
原題: Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability / Yudong Gao, Linghan Chen, Wenhan Wu 他
日本語で読む → - 論文VLA画像認識
AlloEgo-VLM: 視覚言語モデルにおける全中心・自己中心参照枠の曖昧性解消
視覚言語モデルが空間関係を記述する際に参照枠(全中心的・自己中心的)の曖昧さを解消するためのデータセットとフレームワークを構築し、ロボットの物体探索タスクでの実用性を検証した。
原題: AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models / Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
ViTaR: 基盤VLA操作のための視触覚残差適応
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
原題: ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation / Yi Wang, Renjun Wu, Jinyan Liu 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
投機的推論と検証による効率的なVLA推論のためのアルゴリズム・アーキテクチャ協調設計
ロボット環境の能動/非能動状態に応じて投機的予測と選択的検証を切り替えることで、VLAモデルの推論効率と行動長を改善する協調設計フレームワークを提案した。
原題: Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification / Chunyu Qi, Zhuoran Song, Jian Weng 他
日本語で読む →