論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/10 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
UniMPA:行動接地型遷移モデリングによる統合記憶・予測・行動モデル
視覚言語行動モデルの遷移実現性ギャップを、記憶・予測・行動を統合した行動接地型インターフェースで解決する手法を提案。
原題: UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling / Wei Li, Rui Shao, Jie He 他
日本語で読む → - 論文VLAロボティクス
ActSafeGuard:フローマッチング方策のための微分可能で訓練整合型の制約強制
フローマッチングベースの方策に微分可能な安全層を組み込み、学習段階から硬い物理制約を満たす行動を生成させる手法を提案。複数タスクで100%のステップ安全性を保ちつつ成功率も維持・向上させた。
原題: ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching Policies / Jianming Ma, Rongjun Jin, Xiaxi Si 他
日本語で読む → - 論文VLAロボティクス
2AM: 長期ホライズン操作における操縦可能な行動モデルのためのエージェント側記憶の基盤化
マルチモーダルエージェントにタスク記憶を集約し、単一のRGBベースVLAを実行者として、履歴を言語サブタスクと2Dヒントに変換して操縦する長期操作フレームワーク。LIBERO-Memで大幅な性能向上を達成。
原題: 2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation / Yutong Hu, Fengjiao Chen, Xuezhi Cao 他
日本語で読む → - 論文VLAcs.DC
ロボット工場向けの効率的なVision-Language-Action管理・提供システム
複数ロボット・複数モデルのVLA推論をマルチGPUエッジサーバでSLOを満たしながら提供する初の管理・提供システムRobionを提案。
原題: Efficient Vision-Language-Action Management and Serving for Robot Factories / Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri 他
日本語で読む → - 論文VLAロボティクス
ノイズ操作を超えて:生成ロボットポリシーのためのデュアル潜在空間強化学習
生成ロボットポリシーの強化学習において、初期ノイズだけでなく中間行動表現も制御する二重潜在空間フレームワークを提案し、オンライン適応を高速化した。
原題: Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy / Pengfei Zhang, Teng Sun, Xianchao Xiu
日本語で読む → - 論文VLA画像認識
GroundBench: VLMのアフォーダンス失敗を切り分ける因子分解・反事実ベンチマーク
操作プロンプトに含まれる「部位の名前」と「位置」の情報を段階的に分離し、視覚言語モデルがどこで失敗するかを診断するベンチマークを提案。名前だけ与えると精度が上がる一方、位置だけでは向上しないことを示した。
原題: GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures / Sarthak Sattigeri
日本語で読む → - 論文VLAロボティクス
AnchorVLN: 幾何学アンカー付き視覚言語グラウンディングによるオープンボキャブラリナビゲーション
VLMに意味推論を、幾何学計算に距離・方位などの計量推定を分担させるルールで、MCPサーバ経由のオープンボキャブラリ視覚言語ナビゲーションシステムを構築し、CMU VLNチャレンジ2026で有効性を示した。
原題: AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation / Long Giang Vu, Chengkai Yao, Yuxin Liu 他
日本語で読む → - 論文VLAeess.SP
6Gにおけるプライバシー保護型身体知能のためのモダリティ分離連合学習
VLAモデルの連合学習において、視覚・言語・行動の各モダリティ特性に応じて集約・プライバシー配分・通信圧縮を分離設計し、6G網でのロボット協調を効率化するフレームワークを提案。
原題: Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G / Zhuodong Liu, Xiangyu Li, Chunhong Yuan 他
日本語で読む → - 論文VLAAI
時間周波数幾何クロスアテンションによるチャンク型視覚言語行動モデルの改善
行動チャンクを学習可能なウェーブレット変換で時間周波数トークンに分解し、内積とウェッジ積を融合したクロスアテンションで位相間の直交的な関係を捉える、VLAポリシー向けの追加モジュールを提案。
原題: Time-Frequency Geometric Cross-Attention for Chunked Vision-Language-Action Models / Shengye Dong, Haochen Niu, Hao Liu 他
日本語で読む → - 論文VLAAI
証明付き認知:現実に基づく報酬による検証ギャップの解消
形式領域外の推論に対する検証不可能な報酬問題を「検証ギャップ」と定式化し、現実に接地した報酬(実行結果など)で検証器の健全性を保つ手法を理論・実験の両面から示した。
原題: Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward / Eshwar Reddy M, Sourav Karmakar
日本語で読む → - 論文VLAロボティクス
周波数条件付きフローマッチングによる視覚-言語-行動モデル
VLAモデルの行動生成をDCT周波数座標で行い、周波数ごとに条件付け・重み付けするFreqFMを提案。LIBERO等で性能向上と実機6タスクでの有効性を示した。
原題: Frequency-Conditioned Flow Matching for Vision-Language-Action Models / Haochen Niu, Shengye Dong, Hao Liu 他
日本語で読む → - 論文VLAロボティクス
CT-SAFR: 自律ロボットのための安全で解釈可能な連鎖推論 — 信頼できるAI駆動型ロボット意思決定のための多層検証フレームワーク
LLMの連鎖推論を用いたロボットの意思決定において、幻覚を94.2%検出し不安全な推論出力を87%削減する多層検証フレームワークを提案した。
原題: CT-SAFR: Safe and Interpretable Chain-of-Thought Reasoning for Autonomous Robots: A Multi-Layered Verification Framework for Trustworthy AI-Driven Robotic Decision Making / Cagri Temel
日本語で読む → - 論文VLAロボティクス
HuRo: 人間動画をロボット化してスケーラブルなVLA事前学習を実現
人間の動画をロボットの観測と行動軌跡に変換するパイプラインを構築し、約63万エピソードのデータセットでVLAポリシーを事前学習することで、実世界の操作タスクの成功率とOOD汎化性能を大幅に向上させた。
原題: HuRo: Robotizing Human Videos for Scalable VLA Pretraining / Jinho Jeong, Se June Joo, Jaehyun Kang 他
日本語で読む → - 論文VLAロボティクス
Show-Harness: VLMエージェントだけでロボットを操作
VLMが離散的な意味アクション単位を通じてロボットを直接制御できる「Embodied Harness」を提案し、GUIベースのデモ収集インターフェースGUMIも開発した。
原題: Show-Harness: Just a VLM Agent Can Play Robots / Yanzhe Chen, Zechen Bai, Zhijun Cao 他
日本語で読む → - 論文VLAAI
信念状態エンジン:部分観測下での原理的計画のためのLLM拡張
LLMの外側にベイズ信念を維持する推論モジュールを置き、生の履歴ではなく信念事後分布のみをLLMに渡すことで、POMDP上の健全なマルコフ方策として計画できるようにした研究。
原題: Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability / Arnab Chattopadhayay, Debdipta Halder
日本語で読む → - 論文VLA画像認識
ロバストな視覚言語エンコーダのための等方性埋め込み摂動
埋め込み空間に拡散的なランダム摂動を加えるAetherを提案し、視覚言語モデルのマルチモーダル整合性を損なわずに正則化性能を向上させた。
原題: Isotropic Embedding Perturbations for Robust Vision Language Encoders / Hyesong Choi, Daeun Kim, Song Park 他
日本語で読む → - 論文VLAロボティクス
ReactHuman: 身体性マルチモーダルLLMのための物理に基づく人間らしい反応的意思決定ベンチマーク
家庭内の突発的な物理的危険に対し、マルチモーダルLLMが人間のように即座に反応できるかを評価する、物理シミュレーションに基づく初のベンチマークを提案し、代表的モデルの反応的安全性が未解決であることを示した。
原題: ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs / Yizhan Li, Jianxin You, Mengyang Xiong 他
日本語で読む → - 論文VLAロボティクス
幻覚を考慮した世界モデルベース方策最適化による汎用ロボット方策
世界モデルが生成する長期ロールアウトの幻覚を検出して信頼度を推定し、そのスコアを強化学習に組み込むことで、VLA方策の事後学習を安定化・高性能化する手法を提案。
原題: HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy / Zengjue Chen, Peidong Liu, Jiawei Li 他
日本語で読む → - 論文VLAロボティクス
RoboDrop: 局所勾配適合性によるVLA事後学習データのキュレーション
VLAモデルの事後学習データに含まれる誤りを、学習中の局所勾配の適合性を指標に自動で検出・除去するデータキュレーション手法を提案。
原題: RoboDrop: Curating VLA Post-Training Data via Local Gradient Compatibility / Runze Xu, Yuanfan Xu, Cuijie Xu 他
日本語で読む → - 論文VLA画像認識
多様な海岸環境における視覚言語モデルの評価
ハワイの海岸で収集した1000枚以上の画像データセットを構築し、7つの視覚言語モデルを3つの実験で評価した。海岸特有の概念の認識が難しいが、その原因は環境よりもセグメンテーションと言語表現にあることを示した。
原題: Evaluation of Vision-Language Models Across Diverse Coastal Environments / Seth Knoop, Chad R. Samuelson, Gabriel R. Slade 他
日本語で読む → - 論文巧みな操作/VLA/触覚ロボティクス
DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル
接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。
原題: DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination / Yankai Fu, Ning Chen, Junkai Zhao 他
日本語で読む → - 論文VLA/操作画像認識
GIFT: 目標注入型ファインチューニングによる効率的な操作ポリシー適応
生成モデルで予測した目標画像を事前学習済みVLAモデルに軽量に組み込むファインチューニング手法GIFTを提案し、少数エポックで性能を大幅に向上させた。
原題: GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy Adaptation / Xiaoyuan Fang, Shuo Feng, Yuxuan Wang 他
日本語で読む → - 論文VLA/空間推論画像認識
文脈的観察者接地:視覚言語モデルにおける状況的空間推論の評価
ロボットなどの身体化タスクで、話者の視点に基づく空間関係の理解を評価するベンチマークPOVBenchを構築し、最新の視覚言語モデルが文脈から観察者の視点を推論して対象を特定できるかを検証した。
原題: Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models / Mimo Shirasaka, Haochen Zhang, Yonatan Bisk
日本語で読む → - 論文VLAロボティクス
ICI-VLA: 時空間的に整列したデモによる文脈内模倣を用いた視覚言語行動モデル
追加学習なしで、テスト時にデモを文脈として与えることで新しい操作タスクに適応できるVLAモデルの訓練・検索フレームワークを提案した。
原題: ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models / Songhua Yang, Ziyu Liu, Xuetao Li 他
日本語で読む → - 論文VLAロボティクス
ロボットポリシーにおける言語転移の測定:Cosmos3視覚言語行動ポリシーへのギリシャ語追加
英語中心のロボット基盤モデルにギリシャ語を追加する際、翻訳ではなく測定方法が重要であることを示し、誤った結論を導く指標を特定し、バイリンガル訓練が一貫した性能向上をもたらすことを明らかにした。
原題: Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy / Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos
日本語で読む → - 論文VLA/通信連携ロボティクス
ComVLA: 6G接続ロボティクスにおけるVLAモデルの通信認識型分割推論
言語指示に含まれる意味情報を利用して、VLAモデルの視覚トークン数を無線チャネル容量に適応させるフレームワークを提案し、計算量と遅延を削減しつつタスク成功率を維持した。
原題: ComVLA: Communication-Aware Split Inference for VLA Models in 6G-Connected Robotics / Boliang Liu, Wint Yi Poe, Jingyun Di 他
日本語で読む → - 論文VLAロボティクス
OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
原題: OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining / Yuran Wang, Siqiao Huang, Mingleyang Li 他
日本語で読む → - 論文VLAロボティクス
飛行を学ぶ:コンパクトなターゲット中心キューと強化学習による安定した視覚誘導UAVサーボ
RGB画像の代わりに軽量なターゲットセグメンテーションから得られる画像空間オフセットと相対深度、機体速度・重力投影を組み合わせた12次元観測でUAVの視覚サーボを強化学習し、カリキュラム学習で安定化と外乱頑健性を実現した。
原題: Learning to Fly: Stable Vision-Guided UAV Servoing with Compact Target-Centric Cues and Reinforcement Learning / Saurbh Singh Jamwal, Nived Chebrolu
日本語で読む → - 論文VLAロボティクス
身体性を持つSLMにおける幾何条件付け:0.8Bハイブリッドモデルでの訓練制御とロバスト性診断
0.8Bのハイブリッド言語モデルを操作タスクに適応させ、幾何学的入力の条件付けが性能に与える影響を評価した。訓練時の幾何学的整合性による明確な優位性は見られず、座標不変性と物理的配置の汎化のギャップを示した。
原題: Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model / Hao Li, Haofei Sun, Lin He
日本語で読む → - 論文VLA画像認識
MLLMは人間のように多義図形を報告するか?
マルチモーダル大規模言語モデル(MLLM)が、アヒルとウサギの多義図形のような二重安定画像に対して、人間と同様に一度に一つの解釈を報告するか、また視覚的手がかりや言語的バイアスで報告が変わるかを調べ、その内部計算機構を解析した。
原題: (How) Do MLLMs Report Bistable Images Like Humans? / Ryota Takatsuki, Tomoki Doi, Amane Watahiki 他
日本語で読む →