論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA機械学習
シンプルな手法で十分:VLAモデルは強化学習による自然な継続学習者である
大規模事前学習済みVLAモデルの継続強化学習を体系的に検証し、LoRAを用いた単純な逐次ファインチューニングが破滅的忘却をほとんど起こさず、複雑な継続学習手法を上回ることを示した。
原題: Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning / Jiaheng Hu, Jay Shim, Chen Tang 他
日本語で読む → - 論文触覚/VLAロボティクス
TacMamba: 高速反射と低速VLA推論を橋渡しする触覚履歴圧縮アダプタ
触覚データの高周波処理と視覚ポリシーの低周波処理のギャップを埋めるため、Mambaベースの触覚履歴圧縮器を導入し、VLAモデルにプラグイン可能な高速触覚融合を実現した。
原題: TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning / Zhenan Wang, Yanzhe Wang, Meixuan Ren 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルのための触覚モダリティ融合
視覚言語行動モデルに触覚信号を軽量に統合するTacFiLMを提案し、接触を伴う挿入・引き出しタスクで成功率や力の安定性を改善した。
原題: Tactile Modality Fusion for Vision-Language-Action Models / Charlotte Morissette, Amin Abyaneh, Wei-Di Chang 他
日本語で読む → - 論文VLA/拡散モデル/ファインチューニングロボティクス
Fast-dVLA: 離散拡散VLAを実時間性能へ高速化
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
原題: Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance / Wenxuan Song, Jiayi Chen, Shuai Chen 他
日本語で読む → - 論文VLA/解釈可能性ロボティクス
スパースオートエンコーダがVLAモデルの解釈可能で操作可能な特徴を明らかにする
VLAモデルの隠れ層にスパースオートエンコーダを適用し、動作プリミティブや意味概念に対応する解釈可能な特徴を発見。特徴の増幅・除去による操作実験で、汎化と制御可能性を実証した。
原題: Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models / Aiden Swann, Lachlain McGranahan, Hugo Buurmeijer 他
日本語で読む → - 論文VLAロボティクス
ThermoAct: ロボットの知覚と意思決定のための熱認識ビジョン言語行動モデル
熱情報を統合した新しいVLAフレームワークを提案し、ロボットが物理的特性を認識して環境の安全性を確保できるようにした。実世界のタスクで有効性を検証した。
原題: ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making / Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi 他
日本語で読む → - 論文VLAロボティクス
RoboStream: 視覚言語モデルに時空間推論と記憶を統合したロボット操作フレームワーク
視覚言語モデルに時空間融合トークンと因果時空間グラフを導入し、長期ロボット操作における幾何学的定位と行動による状態変化の記憶を訓練なしで実現する。
原題: RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics / Yuzhi Huang, Jie Wu, Weijue Bu 他
日本語で読む → - 論文VLA画像認識
PVI: 視覚言語行動モデルのためのプラグイン型視覚注入
事前学習済みの視覚言語モデルと行動エキスパートを組み合わせたVLAアーキテクチャに対し、軽量でエンコーダ非依存のモジュールを追加し、時間的視覚特徴を注入することで性能を向上させる手法を提案した。
原題: PVI: Plug-in Visual Injection for Vision-Language-Action Models / Zezhou Zhang, Songxin Zhang, Xiao Xiong 他
日本語で読む → - 論文VLAロボティクス
AnyCamVLA: 視点ロバストな視覚言語行動モデルのためのゼロショットカメラ適応
カメラ視点の変化に弱いVLAモデルに対し、追加データや微調整なしで、テスト時の観測を訓練時のカメラ設定に合わせて仮想的に変換するゼロショット適応フレームワークを提案した。
原題: AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models / Hyeongjun Heo, Seungyeon Woo, Sang Min Kim 他
日本語で読む → - 論文双腕操作/VLAロボティクス
SkillVLA: スキル再利用による双腕操作の組合せ多様性への挑戦
双腕操作におけるVLAモデルが、左右の腕のスキルを組み合わせて再利用できるようにするフレームワークを提案し、成功率を大幅に向上させた。
原題: SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse / Xuanran Zhai, Zekai Huang, Longyan Wu 他
日本語で読む → - 論文自動運転/VLAロボティクス
StyleVLA: 運転スタイルを考慮した視覚言語行動モデルによる自動運転
運転スタイル(スポーティ、快適など)に応じた多様で物理的に実現可能な軌道を生成する、物理情報を組み込んだVLAフレームワークを提案した。
原題: StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving / Yuan Gao, Dengyuan Hua, Mattia Piccinini 他
日本語で読む → - 論文VLAロボティクス
KineVLA: 運動学を考慮した視覚言語行動モデルと二段階行動分解
言語指示に運動学的属性(方向、軌道、姿勢、相対変位など)を細かく組み込んだ新しいVLAタスクを提案し、目標の不変性と運動学的可変性を分離する二段階行動表現と推論トークンを持つKineVLAフレームワークを導入した。シミュレーションと実機で精度・制御性・汎化性が向上することを示した。
原題: KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition / Gaoge Han, Zhengqing Gao, Ziwen Li 他
日本語で読む → - 論文VLAロボティクス
NS-VLA:神経記号型視覚言語行動モデル
視覚・言語特徴から記号的にプリミティブを抽出し、オンライン強化学習で行動系列を生成する神経記号型VLAフレームワークを提案。少データ・摂動環境で高精度かつゼロショット汎化を示す。
原題: NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models / Ziyue Zhu, Shangyang Wu, Shuai Zhao 他
日本語で読む → - 論文VLAロボティクス
一歩ずつ報酬を与えよう:連続環境における視覚言語ナビゲーションのためのステップ認識型対照アライメント
連続環境での視覚言語ナビゲーションにおいて、失敗軌跡から有効な接頭辞と逸脱点を特定するステップ単位の監査と、状況に応じたグループ構築により、密な報酬信号を抽出して学習を安定化させるSACAを提案し、最先端性能を達成した。
原題: Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments / Haoyuan Li, Rui Liu, Hehe Fan 他
日本語で読む → - 論文VLAロボティクス
MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデル
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
原題: MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation / Yang Liu, Pengxiang Ding, Tengyue Jiang 他
日本語で読む → - 論文VLAロボティクス
生成3D世界によるロボットVLAのSim-to-Real強化学習のスケーリング
生成3Dモデルと言語駆動シーン設計で多様なシミュレーション環境を自動生成し、VLAモデルの強化学習をスケールさせて実世界への転移性能を大幅に向上させた。
原題: Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds / Andrew Choi, Xinjie Wang, Zhizhong Su 他
日本語で読む → - 論文自動運転/VLAロボティクス
Uni-World VLA: 自動運転のための世界モデリングと計画の交互実行
自動運転向けに、将来フレーム予測と軌道計画を交互に行う統合VLAモデルを提案し、閉ループな意思決定を実現した。
原題: Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving / Qiqi Liu, Huan Xu, Jingyu Li 他
日本語で読む → - 論文VLA/エッジAIcs.PF
VLAモデルの特性解析:エッジAIアーキテクチャにおける行動生成ボトルネックの特定
エッジハードウェア上でVLAモデルの性能を評価し、メモリ帯域がボトルネックとなる行動生成フェーズを特定。将来の大規模モデルへの拡張に必要なハードウェア要件を予測した。
原題: Characterizing VLA Models: Identifying the Action Generation Bottleneck for Edge AI Architectures / Manoj Vishwanathan, Suvinay Subramanian, Anand Raghunathan
日本語で読む → - 論文VLA機械学習
推論効率から身体効率へ:Vision-Language-Actionモデルの効率指標の再検討
VLAモデルの効率をパラメータ数やFLOPsではなく、タスク完了時間や軌道の滑らかさなど実機での身体的行動で評価すべきだと示し、従来の効率化手法が実機性能を必ずしも向上させないことを実験的に明らかにした。
原題: From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models / Zhuofan Li, Hongkun Yang, Zhenyang Chen 他
日本語で読む → - 論文VLAロボティクス
FutureVLA: 視覚言語行動モデルのための統合視覚運動予測
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
原題: FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model / Xiaoxu Xu, Hao Li, Jinhui Ye 他
日本語で読む → - 論文VLA画像認識
段階的視覚言語学習による物理的接地を備えた具現化タスク計画
具現化タスク計画のための3段階学習フレームワークSVLLを提案し、空間接地と時間推論を分離してから、専門家軌道へのバイアスを注入するBias-DPOでアライメントを行うことで、物理的に不可能な行動を抑制する。
原題: SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning / Yuyuan Yang, Junkun Hong, Hongrong Wang 他
日本語で読む → - 論文VLAロボティクス
思考の改変が行動を変える:VLAロボット操作におけるChain-of-Thoughtの脆弱性の探究
VLAモデルが生成する推論トレースを人為的に破壊すると、物体名の置換のみが成功率を大きく低下させ、行動デコーダが推論の質ではなく実体参照の整合性に依存していることを示した。
原題: Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation / Tuan Duong Trinh, Naveed Akhtar, Basim Azam
日本語で読む → - 論文VLA/セキュリティロボティクス
SABER: 視覚言語行動モデルに対するステルスなエージェント型ブラックボックス攻撃フレームワーク
VLAモデルへの指示文の小さな改変でロボットの行動を劣化させる攻撃を自動生成するフレームワークを提案し、LIBEROベンチマークで成功率低下などの効果を実証した。
原題: SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models / Xiyang Wu, Guangyao Shi, Qingzi Wang 他
日本語で読む → - 論文VLA画像認識
Pri4R: 特権的4D表現で視覚言語行動モデルに世界の動力学を学習させる
訓練時のみ特権的な4D情報を使い、3D点追跡を予測する軽量ヘッドをVLAに追加して世界の動力学を暗黙的に学習させ、推論時は元のアーキテクチャのまま高性能な操作を実現した研究。
原題: Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation / Jisoo Kim, Jungbin Cho, Sanghyeok Chu 他
日本語で読む → - 論文VLA/強化学習ロボティクス
π-StepNFT: フローベースVLAのオンライン強化学習における広い空間には細かいステップが必要
フローベースの視覚言語行動モデルに対する新しい強化学習フレームワークを提案し、尤度計算や価値ネットワークを不要にして、単一の順伝播でステップごとのガイダンスを提供する。
原題: $\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs / Siting Wang, Xiaofeng Wang, Zheng Zhu 他
日本語で読む → - 論文VLAロボティクス
HMR-1: 視覚言語モデルを用いた階層型マッサージロボットによる身体性ヘルスケア
マッサージ用のマルチモーダルデータセットMedMassage-12Kを構築し、視覚言語モデルでツボを認識する高レベルモジュールと軌道計画を行う低レベル制御モジュールからなる階層型マッサージロボットを提案した論文。
原題: HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare / Rongtao Xu, Mingming Yu, Xiaofeng Han 他
日本語で読む → - 論文VLAロボティクス
SPAN-Nav: 多様な視覚言語ナビゲーションのための汎用空間認識
RGB動画から占有予測で空間事前知識を学習し、単一トークンで空間手がかりを行動推論に注入する視覚言語ナビゲーション基盤モデルを提案。
原題: SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation / Jiahang Liu, Tianyu Xu, Jiawei Chen 他
日本語で読む → - 論文VLA/行動生成/推論高速化ロボティクス
ProbeFlow: 学習不要の適応型フローマッチングによる視覚言語行動モデルの高速化
VLAモデルの行動生成に用いるフローマッチングの推論遅延を、軌道の複雑さに応じて積分ステップ数を動的に調整する学習不要のフレームワークで削減し、実機でも安定した高速動作を実現した。
原題: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models / Zhou Fang, Jiaqi Wang, Yi Zhou 他
日本語で読む → - 論文VLAロボティクス
VP-VLA: 視覚プロンプトをインターフェースとする視覚言語行動モデル
VLAモデルのブラックボックス的な制御を改善するため、高次推論と低次実行を分離し、視覚プロンプト(十字線やバウンディングボックス)を介して指示を伝える二重システムフレームワークを提案した。
原題: VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models / Zixuan Wang, Yuxin Chen, Yuqi Liu 他
日本語で読む → - 論文自動運転/VLA画像認識
DynVLA: 自動運転における行動推論のための世界ダイナミクス学習
自動運転向けVLAモデルDynVLAを提案し、行動生成前に世界のダイナミクスを予測する新しいCoTパラダイムを導入した。
原題: DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving / Shuyao Shang, Bing Zhan, Yunfei Yan 他
日本語で読む →