論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/11 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/セキュリティロボティクス
軌道レベルでのリダイレクション攻撃:視覚言語行動モデルに対する
視覚言語行動(VLA)モデルに対して、指示文をわずかに変更するだけで、意図したタスクに見せかけつつ最終的な物理的結果を攻撃者が指定した目標に変える「軌道レベル」の脆弱性を発見し、その攻撃を自動生成する手法を提案した。
原題: Trajectory-Level Redirection Attacks on Vision-Language-Action Models / Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda 他
日本語で読む → - 論文VLA画像認識
RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリング
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
原題: RepWAM: World Action Modeling with Representation Visual-Action Tokenizers / Junke Wang, Qihang Zhang, Shuai Yang 他
日本語で読む → - 論文VLA画像認識
予測を行動に変える:世界行動モデルにおける表現整合の再利用
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
原題: Making Foresight Actionable: Repurposing Representation Alignment in World Action Models / Lu Qiu, Yizhuo Li, Yi Chen 他
日本語で読む → - 論文VLA/操作機械学習
μVLA:VLAモデルにおける部分観測操作のためのリカレントメモリ
VLAモデルに小さな学習可能なメモリトークンを追加し、時間ステップ間で自己注意により更新することで、部分観測下での操作性能を向上させる手法を提案した。
原題: $μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models / Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky 他
日本語で読む → - 論文VLA/言語指示最適化ロボティクス
VLAに何を言うべきかを学ぶ:ほぼ無害なビジョン言語行動モデルの操縦
VLAモデルへの言語指示を自動で探索・改善し、性能向上を予測するヘッドを学習して、有害な介入を防ぎつつタスク成功率を高めるフレームワークを提案した。
原題: Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering / Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy
日本語で読む → - 論文VLA/プランニングロボティクス
DIRECT: 身体化プランナーにおけるテスト時計算の割り当てはいつ、どこで行うべきか?
VLMを高レベルプランナーとして使う際、テスト時計算を増やすと性能が上がるが、コストも増える。シーン文脈に基づいて計算をルーティングするDIRECTを提案し、成功率とコストのトレードオフを改善した。
原題: DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? / Jadelynn Dao, Milan Ganai, Yasmina Abukhadra 他
日本語で読む → - 論文触覚/VLA/sim2realロボティクス
TacCoRL: シミュレーションによる触覚フィードバックのVLAへの統合
視覚と言語と行動の事前知識を持つVLAモデルに触覚フィードバックを注入し、シミュレーションと実機の共学習と強化学習で接触を要するタスクの成功率を向上させるフレームワークを提案した。
原題: TacCoRL: Integrating Tactile Feedback into VLA via Simulation / Siyu Ma, Yuqi Liang, Chang Yu 他
日本語で読む → - 論文VLA画像認識
ワールドモデルの自己蒸留:汎用タスク解決のためのワールドモデル学習
事前学習済みビデオ生成モデルを、自己蒸留と強化学習を組み合わせて、タスク実行能力を持つワールドモデルへと変換する手法を提案。
原題: World Model Self-Distillation: Training World Models to Solve General Tasks / Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan 他
日本語で読む → - 論文VLAロボティクス
DAM-VLA: 非同期マルチモーダル視覚言語行動モデル
各モダリティをセンサー固有のレートで処理する非同期VLAモデルを提案し、接触の多い実世界操作タスクで成功率を大幅に向上させた。
原題: DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model / Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga 他
日本語で読む → - 論文VLAロボティクス
視覚-行動ロボットデータの再ラベリングによるタスク堅牢性向上
大規模視覚言語モデルを用いて既存のロボットデータセットを拡張し、追加データ収集なしで指示追従性能と汎化性を向上させるフレームワークTREADを提案した。
原題: Task Robustness via Re-Labelling Vision-Action Robot Data / Artur Kuramshin, Özgür Aslan, Cyrus Neary 他
日本語で読む → - 論文VLA/階層制御ロボティクス
ロボットポリシー編成における重要要素:階層型VLAエージェントの体系的研究
階層型VLAシステムの設計原則を体系的に研究し、プランナーとコントローラの選択や接続方法などが性能に与える影響を分析。導出した原則に基づくシステムが、フラットなVLAや素朴な階層構造より優れることをシミュレーションと実機で示した。
原題: What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents / Jiaheng Hu, Mohit Shridhar, Caden Lu 他
日本語で読む → - 論文VLA自然言語
APIを超えて:物理的な道具使用におけるMLLMの限界を探る
物理的な道具使用を評価する初のベンチマークPhysTool-Benchを導入し、13の主要なMLLMが実世界のシーンで道具の認識と使用計画に苦戦することを示した。
原題: Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use / Zhixin Ma, Yutong Zhou, Yongqi Li 他
日本語で読む → - 論文VLA画像認識
ScoutVLA:オープンワールド具現化質問応答のためのデュアルエキスパートVLAモデルによるUAV中心の能動知覚
UAVが環境を能動的に知覚して質問に答える空中具現化質問応答(EQA)において、証拠探索に必要な微細な視点調整を可能にするベンチマークFG-EQAと、ミツバチのダンスに着想を得たデュアルエキスパート型VLAモデルScoutVLAを提案した。
原題: ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering / Wenhao Lu, Zhengqiu Zhu, Xiaofeng Wang 他
日本語で読む → - 論文VLA/操作画像認識
LIBERO-Occ: 視点想像によるシーン起因の遮蔽下での視覚言語行動モデルの評価と改善
遮蔽がある操作環境でVLAモデルの性能が低下する問題を調べ、遮蔽評価ベンチマークLIBERO-Occを導入し、補完視点を想像して行動予測に活用する手法VIMを提案した。
原題: LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination / Taishan Li, Jiwen Zhang, Siyuan Wang 他
日本語で読む → - 論文VLA/推論高速化機械学習
C$^3$ache: クロス推論チャンクキャッシュによるワールドアクションモデルの高速化
ワールドアクションモデル(WAM)の推論を高速化するため、異なる推論チャンク間で残差をキャッシュして再利用する学習不要の手法C$^3$acheを提案し、最大2.5倍の高速化を達成した。
原題: C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache / Weisen Zhao, Lam Nguyen, Zhicong Lu 他
日本語で読む → - 論文VLAロボティクス
MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリング
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
原題: MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models / Hao Shi, Weiye Li, Bin Xie 他
日本語で読む → - 論文VLA画像認識
多様な経験によるスケーリング:視覚言語行動モデルのための手法
視覚言語行動モデルの実世界展開における課題を解決するため、意図分離アルゴリズムと類似サンプル誘導型強化学習を導入し、ロボットタスクとマルチモーダルベンチマークで優れた性能を達成した。
原題: Scaling by Diversified Experience for Vision-Language-Action Models / Leiyu Wang, Zhaofengnian Wang, Xueqi Li 他
日本語で読む → - 論文VLA/障害回復ロボティクス
ReCoVLA: VLMガイドによる報酬生成で視覚言語行動ポリシーの障害回復を実現
事前学習済みのVLAポリシーを凍結し、外部VLMで障害モードと回復段階を推定して報酬を構成することで、シミュレーションでの残差ポリシー訓練と実機へのゼロショット転送を行う障害回復フレームワークを提案した。
原題: ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies / Haodi Hu, Chung-Ta Huang, Jing Liu 他
日本語で読む → - 論文VLAロボティクス
iMaC: 動作と接触画像への変換による具現化ワールドモデル
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
原題: iMaC: Translating Actions into Motion and Contact Images for Embodied World Models / Zhenyu Wu, Xiuwei Xu, Yukun Zhou 他
日本語で読む → - 論文VLA/操作ロボティクス
GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
原題: GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation / Yuan Zhang, Shiqi Zhang, Yedong Shen 他
日本語で読む → - 論文VLA画像認識
FiberTune: 視覚言語行動モデルの微調整における行動ファイバー視覚残差の保持
VLAポリシーの行動教師あり微調整で生じる視覚表現の崩壊を防ぐため、行動予測方向を除いた視覚残差を教師モデルに整合させる訓練手法FiberTuneを提案し、シミュレーションと実機で性能向上を確認した。
原題: FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning / Haihao Lin, Xiangsheng Huang, Xiao Yang 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
SO-101における視覚言語行動モデルのベンチマーク:失敗と回復の分析
低コストロボットSO-101上でVLAモデルと模倣学習を標準化ベンチマークで評価し、失敗分類と回復能力を分析した論文。
原題: Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis / Yi Yu, Xinchuan Qiu
日本語で読む → - 論文VLA画像認識
実世界のストリーミング動画の活用
オフライン動画理解に優れる既存のVLMを、ストリーミング動画の対話・理解に適応させるためのデータセット、訓練手法、デプロイシステム、評価ベンチマークを提案した論文。
原題: Harnessing Streaming Video in the Wild / Dingyu Yao, Shuhuan Gu, Qingyi Si 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
vla.cpp: 視覚言語行動モデルのための統合推論ランタイム
ロボット上で動作する軽量なC++推論ランタイムを提案し、複数のVLAモデルを単一のランタイムで効率的に実行可能にした。
原題: vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models / Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen 他
日本語で読む → - 論文VLAロボティクス
Ego-Pi: 自己中心視点の人間・ロボットデータによるVLAファインチューニング
ロボット操作のデータ不足を解決するため、自己中心視点の人間データを活用してVLAモデルをファインチューニングし、ロボットが新しいタスクの意味を学習し、既存スキルを組み合わせて新行動を生み出せることを示した論文。
原題: Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data / Ji Woong Kim, Ke Wang, Zipeng Fu 他
日本語で読む → - 論文VLA/行動表現ロボティクス
ActionMap: ボクセル行動ヒートマップによるロボットポリシー学習
既存のVLAモデルの行動デコーダを、行動空間上のボクセルヒートマップを予測するヘッドに置き換えることで、学習効率と性能を向上させる手法を提案した論文。
原題: ActionMap: Robot Policy Learning via Voxel Action Heatmap / Pei Yang, Hai Ci, Yanzhe Chen 他
日本語で読む → - 論文VLA画像認識
TBD-VLA: 時間ブロック拡散を用いた視覚言語行動モデル
離散トークン型の視覚言語行動モデル(VLA)において、行動系列を時間ブロックに分割し、ブロック内ではマスク拡散、ブロック間では自己回帰生成を行うことで、時間的一貫性と推論速度を両立する新しいフレームワークを提案した。シミュレーションと実機操作タスクで既存手法を上回る性能を示した。
原題: TBD-VLA: Temporal Block Diffusion Vision Language Action Model / Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo
日本語で読む → - 論文VLA/メタ学習ロボティクス
重み空間メタ学習によるロボットポリシー適応
VLAモデルを新しいタスクに適応させる際、タスク固有のデモや微調整を不要にするため、言語指示と短いデモ動画からLoRAパラメータを直接生成するメタ学習フレームワークWIZARDを提案した。
原題: Robotic Policy Adaptation via Weight-Space Meta-Learning / Christian Bianchi, Siamak Yousefi, Alessio Sampieri 他
日本語で読む → - 論文VLAロボティクス
世界・言語・行動モデル:統一的世界モデリング、言語推論、行動合成
テキスト指示、画像、ロボット状態から、テキストのサブタスク、サブゴール画像、ロボット行動を同時予測する新しい基盤モデルWLAを提案。ARトランスフォーマーを用いて世界予測と言語推論を統合し、推論時には世界予測を無効化できる。
原題: World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis / Yi Yang, Zhihong Liu, Siqi Kou 他
日本語で読む → - 論文VLA画像認識
DRIFT: 視覚言語モデルの連続出力を解読するための残差フローアダプタ
DRIFTは、事前学習済みの視覚言語モデルを連続値出力タスクに適応させるフレームワークで、粗い予測を基にフローマッチングで残差を生成・改善します。視覚的グラウンディングやロボット制御で既存手法を上回る性能を示しました。
原題: DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models / Zhuoming Liu, Jinhong Lin, Kwan Man Cheng 他
日本語で読む →