論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚言語行動モデルのための触覚モダリティ融合
視覚言語行動モデルに触覚信号を軽量に統合するTacFiLMを提案し、接触を伴う挿入・引き出しタスクで成功率や力の安定性を改善した。
原題: Tactile Modality Fusion for Vision-Language-Action Models / Charlotte Morissette, Amin Abyaneh, Wei-Di Chang 他
日本語で読む → - 論文VLA画像認識
TAG: 物体中心推論のためのターゲット非依存ガイダンスによるVLAポリシーの安定化
VLAポリシーが散らかった環境で誤った物体や位置を掴む問題を、物体を消した観察との差分を利用した推論時ガイダンスで改善する手法を提案。
原題: TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models / Jiaying Zhou, Zhihao Zhan, Ruifeng Zhai 他
日本語で読む → - 論文VLAロボティクス
AnyCamVLA: 視点ロバストな視覚言語行動モデルのためのゼロショットカメラ適応
カメラ視点の変化に弱いVLAモデルに対し、追加データや微調整なしで、テスト時の観測を訓練時のカメラ設定に合わせて仮想的に変換するゼロショット適応フレームワークを提案した。
原題: AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models / Hyeongjun Heo, Seungyeon Woo, Sang Min Kim 他
日本語で読む → - 論文VLA画像認識
行動・思考・棄権:VLAモデルのための複雑度適応型推論
視覚言語行動モデルの推論を状態の複雑さに応じて「即実行・熟考・停止」に動的に振り分ける適応フレームワークを提案し、計算効率と異常検知性能を両立させた。
原題: Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models / Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci
日本語で読む → - 論文VLA機械学習
推論効率から身体効率へ:Vision-Language-Actionモデルの効率指標の再検討
VLAモデルの効率をパラメータ数やFLOPsではなく、タスク完了時間や軌道の滑らかさなど実機での身体的行動で評価すべきだと示し、従来の効率化手法が実機性能を必ずしも向上させないことを実験的に明らかにした。
原題: From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models / Zhuofan Li, Hongkun Yang, Zhenyang Chen 他
日本語で読む → - 論文VLAロボティクス
思考の改変が行動を変える:VLAロボット操作におけるChain-of-Thoughtの脆弱性の探究
VLAモデルが生成する推論トレースを人為的に破壊すると、物体名の置換のみが成功率を大きく低下させ、行動デコーダが推論の質ではなく実体参照の整合性に依存していることを示した。
原題: Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation / Tuan Duong Trinh, Naveed Akhtar, Basim Azam
日本語で読む → - 論文VLA/巧緻操作/触覚ロボティクス
RL強化テレオペレーションと巧みな専門家混合VLAによる人間らしい操作の実現
高自由度の両手巧緻操作を可能にするため、RLで訓練した原子スキルによるデータ収集支援と、触覚・力覚を統合したVLAアーキテクチャを提案し、接触を伴う複雑タスクで成功率を2倍に向上させた。
原題: Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA / Tutian Tang, Xingyu Ji, Wanli Xing 他
日本語で読む → - 論文VLA画像認識
VLA-Thinker: 画像思考による視覚言語行動モデルの性能向上
視覚入力を動的に再参照できる思考フレームワークを導入し、2段階学習でロボット操作性能を大幅に向上させた。
原題: VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning / Chaoyang Wang, Wenrui Bao, Sicheng Gao 他
日本語で読む → - 論文VLA/マニピュレーションロボティクス
DAM-VLA: 動的行動モデルに基づくロボット操作のための視覚言語行動フレームワーク
VLMの推論と拡散ベースの行動モデルを統合し、タスクに応じて腕の移動とグリッパー操作を動的に切り替えるVLAフレームワークを提案。シミュレーションと実環境で高い成功率を達成した。
原題: DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation / Xiongfeng Peng, Jiaqian Yu, Dingzhe Li 他
日本語で読む → - 論文VLA/UAVナビゲーション画像認識
AerialVLA: 最小限のエンドツーエンド制御によるUAVナビゲーションのための視覚言語行動モデル
UAVナビゲーションのための視覚言語行動モデルを提案し、生の視覚情報と言語指示を直接連続的な物理制御信号にマッピングする。オラクルガイダンスや外部物体検出器に依存せず、ファジーな方向指示と統合制御空間により、未見環境での汎化性能を大幅に向上させた。
原題: AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control / Peng Xu, Zhengnan Deng, Jiayan Deng 他
日本語で読む → - 論文VLA/能動的知覚/操作ロボティクス
SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
原題: SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics / Mengzhen Liu, Enshen Zhou, Cheng Chi 他
日本語で読む → - 論文VLA/制御ロボティクス
時間離散・時間連続の速度フィードフォワードによる視覚言語行動モデルの動的追従の実現
視覚言語行動モデルに速度フィードフォワード項を統合する2つの手法を提案し、接触を伴うタスクでの追従性能と成功率を改善した。
原題: Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward / Johannes Hechtl, Philipp Schmitt, Georg von Wichert 他
日本語で読む → - 論文VLA/操作ロボティクス
AtomVLA: 予測的潜在世界モデルによるロボット操作のためのスケーラブルなポストトレーニング
VLAモデルの長期的なタスク実行における指示の粒度不足による誤差蓄積を解決するため、大規模言語モデルでタスクを細分化し、予測的世界モデルで潜在空間内のサブタスク達成度を評価する新しいフレームワークを提案した。
原題: AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models / Xiaoquan Sun, Zetian Xu, Chen Cao 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
TacVLA: 接触認識型触覚融合による堅牢な視覚言語行動操作
視覚と言語に依存するVLAモデルに触覚を統合し、接触検出時のみ触覚トークンを活性化するゲーティング機構を導入して、細かい操作や視覚遮蔽下での性能を向上させた。
原題: TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation / Kaidi Zhang, Heng Zhang, Zhengtong Xu 他
日本語で読む → - 論文VLA/エッジ・クラウド協調推論cs.DC
RAPID: 多様なVLAモデルのための冗長性認識・互換性最適なエッジ・クラウド分割推論
VLAモデルの推論コスト削減のため、冗長性を考慮し互換性を最適化したエッジ・クラウド分割推論フレームワークRAPIDを提案し、最大1.73倍の高速化を実現した。
原題: RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models / Zihao Zheng, Sicheng Tian, Hangyu Cao 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
HeiSD: 運動学的認識を備えた身体化視覚言語行動モデルのためのハイブリッド投機的復号
VLAモデルの推論を高速化するため、ドラフタベースと検索ベースの投機的復号を統合したハイブリッド手法HeiSDを提案し、検証スキップ機構と運動学に基づく融合指標により高速化と成功率を両立した。
原題: HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness / Zihao Zheng, Zhihao Mao, Sicheng Tian 他
日本語で読む → - 論文VLAロボティクス
VLN-Cache: 視覚・意味ダイナミクスを考慮したVLNモデルのトークンキャッシング
VLNタスクで大規模視覚言語モデルの推論コストを削減するため、視点移動によるトークン位置ずれとタスク進行に伴う意味的変化を考慮したトークンキャッシング手法を提案した。
原題: VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness / Zihao Zheng, Zhihao Mao, Xingyue Zhou 他
日本語で読む → - 論文VLA/操作/継続学習ロボティクス
AtomicVLA: ロボットにおける原子スキル学習の可能性を解き放つ
長期的・多段階のロボット操作タスクを扱うため、タスク計画・原子スキル抽象化・細粒度アクションを統合的に生成するフレームワークAtomicVLAを提案。スキル誘導型Mixture-of-Expertsによりスケーラブルな原子スキルライブラリを構築し、継続学習も可能にした。
原題: AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots / Likui Zhang, Tao Tang, Zhihao Zhan 他
日本語で読む → - 論文VLAロボティクス
不確実性を臨界の瞬間へ:VLAモデルのための信頼できる不確実性定量化
VLAモデルのロールアウト成否予測において、最大値ベースのスライディングウィンドウと運動安定性重み付け、自由度適応キャリブレーションを組み合わせ、短時間の危険な不確実性スパイクを捉える手法を提案。
原題: Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model / Yanchuan Tang, Taowen Wang, Yuefei Chen 他
日本語で読む → - 論文VLAロボティクス
SOLE-R1: ビデオ言語推論を唯一の報酬とするオンボット強化学習
ビデオと言語目標からタスク進捗を推論するモデルSOLE-R1を開発し、これを唯一の報酬としてロボットが未見の操作タスクをゼロショットで強化学習できるようにした。
原題: SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning / Philip Schroeder, Thomas Weng, Karl Schmeckpeper 他
日本語で読む → - 論文VLA/量子化機械学習
DyQ-VLA: 身体化視覚言語行動モデルのための時間動的認識量子化
VLAモデルの推論コストを削減するため、時間的な感度に応じてビット幅を動的に切り替える量子化フレームワークDyQ-VLAを提案した。
原題: DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models / Zihao Zheng, Hangyu Cao, Sicheng Tian 他
日本語で読む → - 論文VLA/行動生成/推論高速化ロボティクス
ProbeFlow: 学習不要の適応型フローマッチングによる視覚言語行動モデルの高速化
VLAモデルの行動生成に用いるフローマッチングの推論遅延を、軌道の複雑さに応じて積分ステップ数を動的に調整する学習不要のフレームワークで削減し、実機でも安定した高速動作を実現した。
原題: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models / Zhou Fang, Jiaqi Wang, Yi Zhou 他
日本語で読む → - 論文VLAロボティクス
平均流に基づく一段階視覚言語行動モデル
フローマッチング型VLAの遅延問題を解決するため、ノイズ起因の問題を解消し一段階の行動生成を可能にする平均流ベースの手法を提案。実機実験で既存手法より大幅に高速な生成を実現した。
原題: Mean-Flow based One-Step Vision-Language-Action / Yang Chen, Xiaoguang Ma, Bin Zhao
日本語で読む → - 論文VLAロボティクス
フローからワンステップへ:暗黙的最大尤度推定に基づく分布蒸留によるリアルタイムマルチモーダル軌道ポリシー
条件付きフローマッチングの専門家を暗黙的最大尤度推定で単一ステップの生徒モデルに蒸留し、多様な動作モードを保ちながらリアルタイムな閉ループ制御を可能にした。
原題: From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation / Ju Dong, Liding Zhang, Lei Zhang 他
日本語で読む → - 論文VLAロボティクス
SG-VLA: 移動操作のための空間基盤型視覚言語行動モデルの学習
移動操作ロボットのための視覚言語行動モデルを、補助タスクの共学習とマルチモーダル入力強化により空間理解を強化するフレームワークを提案し、家庭内再配置タスクで性能を向上させた。
原題: SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation / Ruisen Tu, Arth Shukla, Sohyun Yoo 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
KERV: 身体化VLAモデルのための運動学的修正投機的復号
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
原題: KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models / Zihao Zheng, Zhihao Mao, Maoliang Li 他
日本語で読む → - 論文VLA/分解作業ロボティクス
SELF-VLA: 接触を伴う分解作業のためのスキル強化型エージェントVLAフレームワーク
廃電子製品の分解自動化を目的に、明示的な分解スキルを統合したエージェント型VLAフレームワークを提案し、接触を伴う分解タスクで既存のVLAモデルを上回る性能を示した。
原題: SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly / Chang Liu, Sibo Tian, Xiao Liang 他
日本語で読む → - 論文VLA画像認識
Pri4R: 特権的4D表現で視覚言語行動モデルに世界の動力学を学習させる
訓練時のみ特権的な4D情報を使い、3D点追跡を予測する軽量ヘッドをVLAに追加して世界の動力学を暗黙的に学習させ、推論時は元のアーキテクチャのまま高性能な操作を実現した研究。
原題: Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation / Jisoo Kim, Jungbin Cho, Sanghyeok Chu 他
日本語で読む → - 論文VLAロボティクス
ProFocus: 視覚と言語によるナビゲーションにおける能動的知覚と焦点化推論
VLNエージェントの非効率な視覚処理と無差別な履歴利用を改善するため、LLMとVLMの協調による訓練不要のフレームワークProFocusを提案。能動的知覚で必要な視覚情報を特定し、BD-MCTSで高価値な経路点に焦点を当てた推論を行う。
原題: ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation / Wei Xue, Mingcheng Li, Xuecheng Wu 他
日本語で読む → - 論文VLAロボティクス
HMR-1: 視覚言語モデルを用いた階層型マッサージロボットによる身体性ヘルスケア
マッサージ用のマルチモーダルデータセットMedMassage-12Kを構築し、視覚言語モデルでツボを認識する高レベルモジュールと軌道計画を行う低レベル制御モジュールからなる階層型マッサージロボットを提案した論文。
原題: HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare / Rongtao Xu, Mingming Yu, Xiaofeng Han 他
日本語で読む →