論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
GeoAware-VLA: 幾何学認識を組み込んだ視覚-言語-行動モデル
凍結した幾何学視覚モデルを特徴抽出器として使い、軽量な投影層でポリシーに適応させることで、未見のカメラ視点への汎化性能を大幅に向上させたVLAモデル。
原題: GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model / Ali Abouzeid, Malak Mansour, Qinbo Sun 他
日本語で読む → - 論文VLAロボティクス
VLA-Reasoner: オンラインMCTSによる推論で視覚言語行動モデルを強化
VLAモデルにテスト時スケーリングを適用し、ワールドモデルとMCTSで将来状態を予測・探索することで長期的な操作タスクの性能を向上させるプラグイン手法を提案。
原題: VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search / Wenkai Guo, Guanxing Lu, Haoyuan Deng 他
日本語で読む → - 論文水中ロボット/VLAロボティクス
DREAM: ドメイン認識推論による効率的な自律型水中モニタリング
VLMを活用し、事前位置情報なしで牡蠣や沈没船などの対象を探索・監視する水中ロボットの自律フレームワークを提案し、従来手法より少ないステップで広範囲をカバーできることを示した。
原題: DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring / Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis 他
日本語で読む → - 論文VLAロボティクス
MimicDreamer: 人間とロボットのデモンストレーションを統合しスケーラブルなVLA学習を実現
人間の操作動画をロボット視点・動作に変換する映像拡散モデルと視点安定化・動作整合技術を組み合わせ、実機ロボットでの少数ショット実行を可能にするVLA学習フレームワークを提案。
原題: MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training / Haoyun Li, Ivan Zhang, Runqi Ouyang 他
日本語で読む → - 論文VLAロボティクス
非一様時間スケジューリングと密ジャンプ積分によるロボット政策のフローマッチング
フローマッチング政策の推論時における多段積分の性能劣化を分析し、訓練時の非一様時間スケジューリングと推論時の密ジャンプ積分を提案して最大23.7%の性能向上を達成した。
原題: Dense-Jump Flow Matching with Non-Uniform Time Scheduling for Robotic Policies: Mitigating Multi-Step Inference Degradation / Zidong Chen, Zihao Guo, Peng Wang 他
日本語で読む → - 論文VLA機械学習
会話的方位推論:マルチモーダル連鎖思考による自己中心から絶対中心へのナビゲーション
音声認識テキストとランドマーク座標を組み合わせたマルチモーダル連鎖思考(MCoT)を提案し、中国語の会話ナビゲーションにおいて自己中心的な発話から絶対方位を高精度に推論する。
原題: Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought / Yu Ti Huang
日本語で読む → - 論文VLAロボティクス
検証可能な報酬による実世界ロボット操作のための強化学習型身体性プランニング
VLMに検証可能な報酬で微調整を施し、自然言語指示から長期的操作計画を生成・検証するフレームワークREVERとモデルRoboFarseerを提案した。
原題: Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation / Zitong Bo, Yue Hu, Jinming Ma 他
日本語で読む → - 論文VLAロボティクス
SocialNav-SUB: ソーシャルロボットナビゲーションにおけるシーン理解のためのVLMベンチマーク
ソーシャルロボットナビゲーションの実世界シーン理解を評価するVQAデータセットとベンチマークを提案し、最先端VLMが人間やルールベース手法に及ばないことを示した。
原題: SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation / Michael J. Munje, Chen Tang, Shuijing Liu 他
日本語で読む → - 論文VLAロボティクス
自律走行のための離散拡散による反射型視覚言語行動モデル
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
原題: Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving / Pengxiang Li, Yinan Zheng, Yue Wang 他
日本語で読む → - 論文VLAAI
ANNIE: ロボットの安全性に注意せよ
視覚言語行動モデルを搭載した身体性AIロボットへの敵対的攻撃の安全性リスクを初めて体系的に研究し、ISO規格に基づく違反分類、評価ベンチマークANNIEBench、攻撃フレームワークANNIE-Attackを提案した。
原題: ANNIE: Be Careful of Your Robots / Yiyang Huang, Zixuan Wang, Zishen Wan 他
日本語で読む → - 論文VLAロボティクス
FPC-VLA:失敗予測と修正のためのスーパーバイザを備えた視覚-言語-行動フレームワーク
VLAモデルに失敗予測と修正を行うスーパーバイザを組み合わせ、シミュレーションと実機で成功率を向上させたデュアルモデルフレームワーク。
原題: FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction / Yifan Yang, Zhixiang Duan, Tianshi Xie 他
日本語で読む → - 論文VLAロボティクス
行動を言語として扱う:壊滅的忘却なしにVLMをVLAへ微調整する手法
ロボットの遠隔操作データを自然言語で表現することで、VLMの基盤能力を損なわずにLoRAのみでVLAへ微調整する手法を提案し、実世界実験でゼロショット汎化を実証した。
原題: Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting / Asher J. Hancock, Xindi Wu, Lihan Zha 他
日本語で読む → - 論文VLAロボティクス
観測を無駄にしない:VLAアクションチャンクのリアルタイム補正
VLAモデルのアクションチャンクを制御ステップごとに軽量ヘッドで補正し、遅延や長期的タスクでも反応性を回復させる手法を提案。
原題: Leave No Observation Behind: Real-time Correction for VLA Action Chunks / Kohei Sendai, Maxime Alvarez, Tatsuya Matsushima 他
日本語で読む → - 論文VLAロボティクス
IA-VLA: 意味的に複雑なタスクにおける視覚言語行動モデルのための入力拡張
大規模視覚言語モデルを前処理として使い、VLAの入力を拡張するフレームワークを提案。見た目が同じ物体を含む複雑な指示タスクで性能が向上することを示した。
原題: IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks / Eric Hannus, Miika Malin, Tran Nguyen Le 他
日本語で読む → - 論文VLAロボティクス
VLN-Zero:ゼロショット移動のための高速探索とキャッシュ活用型ニューロシンボリック視覚言語ナビゲーション
VLMでシーングラフを効率的に構築し、ニューロシンボリックな計画とキャッシュ実行を組み合わせることで、未知環境でのゼロショット視覚言語ナビゲーションを高速・高精度に実現した研究。
原題: VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation / Neel P. Bhatt, Yunhao Yang, Rohan Siva 他
日本語で読む → - 論文VLAロボティクス
推論時の想像:ロバストな視覚運動ポリシー推論のためのハンド内視点の合成
ロボットにハンド内カメラがない場合でも、拡散モデルを用いてエージェント視点からハンド内視点を想像することで、視覚運動ポリシーの性能低下を回復させる手法を提案。
原題: Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference / Haoran Ding, Anqing Duan, Zezhou Sun 他
日本語で読む → - 論文VLAロボティクス
RealMirror: 身体性AIのための包括的オープンソース視覚-言語-行動プラットフォーム
ヒューマノイドロボット向けのVLA研究を、実機なしでデータ収集・学習・推論まで行えるオープンソース基盤として構築し、ベンチマークとゼロショットSim2Real転移も実現した。
原題: RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI / Cong Tai, Zhaoyu Zheng, Haixu Long 他
日本語で読む → - 論文VLAロボティクス
SeqVLA: 完了検知機能を備えた視覚言語行動モデルによる長期的マニピュレーションの逐次タスク実行
π0を拡張し、サブタスクの完了を検知するヘッドを追加することで、長期的な逐次マニピュレーションを自律的に進行できるようにした研究。
原題: SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model / Ran Yang, Zijian An, Lifeng ZHou 他
日本語で読む → - 論文VLAロボティクス
記号計画と連続計画を同時に生成するハイブリッド拡散モデル
拡散モデルで連続的なロボット軌道を生成しつつ、高レベルの記号計画も同時に生成するハイブリッド手法を提案し、長期的タスクの意思決定を改善した。
原題: Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning / Sigmund Hennum Høeg, Aksel Vaaler, Chaoqi Liu 他
日本語で読む → - 論文VLAロボティクス
量子深層強化学習によるヒューマノイドロボットのナビゲーション
パラメータ化量子回路を用いた量子深層強化学習(QDRL)をヒューマノイドロボットのナビゲーションに適用し、従来のSACよりも少ないステップで高い報酬を達成できることを示した。
原題: Quantum deep reinforcement learning for humanoid robot navigation task / Romerik Lokossou, Birhanu Shimelis Girma, Ozan K. Tonguz 他
日本語で読む → - 論文VLAロボティクス
F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデル
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
原題: F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions / Qi Lv, Weijie Kong, Hao Li 他
日本語で読む → - 論文VLA画像認識
ロボティクスにおける臨床シーン理解のための軽量構造化マルチモーダル推論
軽量なVLMとエージェント層を組み合わせ、動画から構造化シーングラフを生成して臨床現場のロボット支援を可能にするフレームワークを提案。
原題: Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics / Saurav Jha, Stefan K. Ehrlich
日本語で読む → - 論文VLAロボティクス
Bi-VLA: 視覚言語融合による双方向制御ベースの模倣学習
双方向制御による模倣学習に視覚と言語指示を融合させ、単一モデルで複数タスクを実行できるようにしたフレームワークを提案し、実機実験で成功率の向上を示した。
原題: Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation / Masato Kobayashi, Thanpimon Buamanee
日本語で読む → - 論文VLAロボティクス
マルチアームロボット操作における方策推論のためのグラフ融合視覚-言語-行動
人間のRGB-D動画からタスクレベルの推論と実行を可能にするGF-VLAを提案し、シーングラフと言語条件付きトランスフォーマで二腕ロボットの動作を生成する。
原題: Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation / Shunlei Li, Longsen Gao, Jiuwen Cao 他
日本語で読む → - 論文VLAロボティクス
TrajBooster: 軌道中心学習によるヒューマノイド全身マニピュレーションの強化
車輪型ヒューマノイドの豊富なデータを活用し、エンドエフェクタ軌道を形態非依存のインターフェースとして二足歩行ヒューマノイドのVLAを効率的に学習させるフレームワークを提案。
原題: TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning / Jiacheng Liu, Pengxiang Ding, Qihang Zhou 他
日本語で読む → - 論文VLAロボティクス
Robot Control Stack:大規模ロボット学習のための軽量エコシステム
VLAや強化学習ポリシーの学習・実機実験を支援する、シミュレーションと実機を統一インターフェースで扱う軽量なロボット制御フレームワークを提案し、OctoやOpenVLAなどの性能を評価した。
原題: Robot Control Stack: A Lean Ecosystem for Robot Learning at Scale / Tobias Jülg, Pierre Krack, Seongjin Bien 他
日本語で読む → - 論文VLAロボティクス
トルク対応VLAモデルの設計空間の解明
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
原題: TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models / Zongzheng Zhang, Haobo Xu, Zhuo Yang 他
日本語で読む → - 論文VLAロボティクス
Ask-to-Clarify: マルチターン対話による指示の曖昧性解消
VLAモデルに対話による曖昧性解消と視覚運動制御を統合したフレームワークを提案し、実世界11タスクで有効性を示した。
原題: Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue / Xingyao Lin, Xinghao Zhu, Tianyi Lu 他
日本語で読む → - 論文VLAロボティクス
OmniVLA:ロボットナビゲーションのためのオムニモーダル視覚言語行動モデル
2D姿勢・自己中心画像・自然言語などの複数のゴール指定をランダムに融合して学習し、未知環境への汎化や新しい言語指示への追従を可能にしたナビゲーション用VLAモデルを提案。
原題: OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation / Noriaki Hirose, Catherine Glossop, Dhruv Shah 他
日本語で読む → - 論文VLA画像認識
LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディング
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
原題: LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models / Pranav Saxena, Avigyan Bhattacharya, Ji Zhang 他
日本語で読む →