論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
Plantbot:LLMモジュールエージェントネットワークによる植物とロボットの統合
植物の状態をLLMモジュール群が自然言語で解釈し、移動ロボットの行動に変換するハイブリッド生命体を提案。生物と人工物が自律的に協調する新たな人工生命モデルを示した。
原題: Plantbot: Integrating Plant and Robot through LLM Modular Agent Networks / Atsushi Masumori, Norihiro Maruyama, Itsuki Doi 他
日本語で読む → - 論文VLA画像認識
SpecPrune-VLA: 行動認識型自己投機的プルーニングによる視覚言語行動モデルの高速化
VLAモデルの推論を高速化するため、時空間的一貫性を利用して視覚トークンを行動レベルと層レベルで動的に枝刈りする学習不要の手法を提案し、成功率を維持しつつ最大1.7倍の高速化を実現した。
原題: SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning / Hanzhen Wang, Jiaming Xu, Yushun Xiang 他
日本語で読む → - 論文VLAロボティクス
AutoDrive-R²: 自動運転VLAモデルの推論と自己反省能力を強化
自動運転向けVLAモデルに思考連鎖と強化学習を導入し、推論と自己反省を促すことで軌道計画の精度と解釈性を向上させた研究。
原題: AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving / Zhenlong Yuan, Chengxuan Qian, Jing Tang 他
日本語で読む → - 論文VLAAI
Robix: ロボットの対話・推論・計画を統合する統一モデル
視覚言語モデル1つでロボットの高レベル推論・タスク計画・自然言語対話を担い、低レベル制御への指令生成と人間との対話を統合的に実現するモデルを提案。
原題: Robix: A Unified Model for Robot Interaction, Reasoning and Planning / Huang Fang, Mengxi Zhang, Heng Dong 他
日本語で読む → - 論文VLAロボティクス
DepthVision: GANベースのLiDAR-to-RGB合成で堅牢な視覚言語モデルを実現する自動運転フレームワーク
LiDARの点群から条件付きGANでRGB風画像を合成し、既存の視覚言語モデルにそのまま入力できるようにすることで、暗所やブレなどの劣化時でも自動運転のシーン理解を向上させる手法を提案。
原題: DepthVision: Enabling Robust Vision-Language Models with GAN-Based LiDAR-to-RGB Synthesis for Autonomous Driving / Sven Kirchner, Nils Purschke, Ross Greer 他
日本語で読む → - 論文VLAロボティクス
VLMを身体性空間へと点火する:WALL-OSSによる具現化基盤モデル
大規模マルチモーダル事前学習を活用し、身体性を理解した視覚言語理解・言語と行動の連携・ロバストなマニピュレーションを統合したエンドツーエンドの具現化基盤モデルWALL-OSSを提案。
原題: Igniting VLMs toward the Embodied Space / Andy Zhai, Brae Liu, Bruno Fang 他
日本語で読む → - 論文VLAロボティクス
CLAW: 重量を考慮したロボット把持のための視覚-言語-行動フレームワーク
重量計の数値をCLIPで監視して閾値に応じた指示を生成し、VLAポリシーと組み合わせて重量を考慮した把持を実現するフレームワークを提案。
原題: CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping / Zijian An, Ran Yang, Yiming Feng 他
日本語で読む → - 論文VLAロボティクス
AdaNav: 不確実性に基づく適応的推論による視覚言語ナビゲーション
視覚言語ナビゲーションにおいて、不確実性に応じて推論を動的に発動する軽量プラグインを提案し、少ない学習データで大幅な性能向上を実現した。
原題: AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation / Xin Ding, Jianyu Wei, Yifan Yang 他
日本語で読む → - 論文VLAロボティクス
DynaMIC: 動的マルチモーダル・インコンテキスト学習によるロボットの反事実的指示への耐性
人間の誤解を招く指示(指示的反事実)を検出し、ロボットがタスク実行中にフィードバックを返すことで安全性を高めるフレームワークDynaMICを提案した。
原題: DynaMIC: Dynamic Multimodal In-Context Learning Enabled Embodied Robot Counterfactual Resistance Ability / Tianqiang Yan, Ziqiao Lin, Sicheng Wang 他
日本語で読む → - 論文VLAロボティクス
正規化フローによる双腕視覚運動ポリシー
双腕操作のための条件付き正規化フローベースの視覚運動ポリシーNF-Pを提案し、尤度計算を活かした推論時最適化で高成功率・低遅延を実現した。
原題: Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy / Jialong Li, Simon Kristoffersson Lind, Wenrui Xie 他
日本語で読む → - 論文VLA画像認識
LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディング
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
原題: LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models / Pranav Saxena, Avigyan Bhattacharya, Ji Zhang 他
日本語で読む → - 論文VLAロボティクス
物体の所有権理解に向けて:大規模言語モデルと確率生成モデルによる能動的質問生成
ロボットが所有権を効率的に学習するため、LLMの常識で共有物と所有物を分類し、情報利得を最大化する質問を能動的に生成するフレームワークActOwLを提案した。
原題: Toward Ownership Understanding of Objects: Active Question Generation with Large Language Model and Probabilistic Generative Model / Saki Hashimoto, Shoichi Hasegawa, Tomochika Ishikawa 他
日本語で読む → - 論文VLAロボティクス
OmniVLA:ロボットナビゲーションのためのオムニモーダル視覚言語行動モデル
2D姿勢・自己中心画像・自然言語などの複数のゴール指定をランダムに融合して学習し、未知環境への汎化や新しい言語指示への追従を可能にしたナビゲーション用VLAモデルを提案。
原題: OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation / Noriaki Hirose, Catherine Glossop, Dhruv Shah 他
日本語で読む → - 論文VLAロボティクス
Ask-to-Clarify: マルチターン対話による指示の曖昧性解消
VLAモデルに対話による曖昧性解消と視覚運動制御を統合したフレームワークを提案し、実世界11タスクで有効性を示した。
原題: Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue / Xingyao Lin, Xinghao Zhu, Tianyi Lu 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる自律移動ロボットの危険回避
視覚言語モデルと大規模言語モデルを組み合わせ、都市環境の異常や危険をリアルタイムで検知・報告し、可能な場合は自動で回避行動をとるシステムを提案した。
原題: Embodied Hazard Mitigation using Vision-Language Models for Autonomous Mobile Robots / Oluwadamilola Sotomi, Devika Kodi, Kiruthiga Chandra Shekar 他
日本語で読む → - 論文VLAロボティクス
Robot Control Stack:大規模ロボット学習のための軽量エコシステム
VLAや強化学習ポリシーの学習・実機実験を支援する、シミュレーションと実機を統一インターフェースで扱う軽量なロボット制御フレームワークを提案し、OctoやOpenVLAなどの性能を評価した。
原題: Robot Control Stack: A Lean Ecosystem for Robot Learning at Scale / Tobias Jülg, Pierre Krack, Seongjin Bien 他
日本語で読む → - 論文VLAAI
EMMA: 生成的視覚転送による実世界ロボットマニピュレーションの汎化
拡散Transformerでロボット操作動画を生成し、実データと混合してVLAポリシーを訓練することで、未知の視覚環境へのゼロショット汎化を実現した。
原題: EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer / Zhehao Dong, Xiaofeng Wang, Zheng Zhu 他
日本語で読む → - 論文VLAロボティクス
一人称視点動画から視覚-言語-行動モデルを構築する
一人称視点の動画から6DoF物体操作軌跡を抽出し、大規模なVLA事前学習データセットを構築。シミュレーションと実機で成功率が20%以上向上することを示した。
原題: Developing Vision-Language-Action Model from Egocentric Videos / Tomoya Yoshida, Shuhei Kurita, Taichi Nishimura 他
日本語で読む → - 論文VLAcs.NI
相乗的強化:無線通信と身体性知能の融合
無線通信と身体性知能が相互に強化し合う共進化の枠組みを、知覚・認知・実行ループの観点から整理し、今後の課題を提示した展望論文。
原題: Synergetic Empowerment: Wireless Communications Meets Embodied Intelligence / Hongtao Liang, Yihe Diao, YuHang Wu 他
日本語で読む → - 論文VLAロボティクス
PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
原題: PhysicalAgent: Towards General Cognitive Robotics with Foundation World Models / Artem Lykov, Jeffrin Sam, Hung Khang Nguyen 他
日本語で読む → - 論文VLAロボティクス
信号と分散のバランス:VLAフローモデルのための適応的オフラインRLポストトレーニング
フローマッチングベースのVLAモデルに対し、バイアスと分散のトレードオフを適応的に制御するオフラインRL微調整法ARFMを提案し、実世界タスクでの性能向上を実現した。
原題: Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models / Hongyin Zhang, Shiyuan Zhang, Junxi Jin 他
日本語で読む → - 論文VLAロボティクス
GestOS: 大規模言語モデルによる高度なハンドジェスチャー解釈で多様なロボットを操作
手のジェスチャーをLLMで意味解釈し、複数ロボットの能力に応じてタスクを動的に割り振る操作システムを提案した。
原題: GestOS: Advanced Hand Gesture Interpretation via Large Language Models to control Any Type of Robot / Artem Lykov, Oleg Kobzarev, Dzmitry Tsetserukou
日本語で読む → - 論文VLAロボティクス
LCMF: 具身ロボティクスVQAのための軽量クロスモダリティMambaformer
クロスアテンションとパラメータ共有状態空間モデルを組み合わせた軽量フレームワークLCMFを提案し、ロボット向けVQA・EQAタスクで高精度かつ低計算コストを実現した。
原題: LCMF: Lightweight Cross-Modality Mambaformer for Embodied Robotics VQA / Zeyi Kang, Liang He, Yanxin Zhang 他
日本語で読む → - 論文VLAロボティクス
ロボット制御に必要なのはピクセルモーション拡散である
高レベルな運動意図と低レベルなロボット動作をピクセルモーション表現で橋渡しする拡散モデルベースの統合フレームワークDAWNを提案し、CALVINやMetaWorldで高性能を示すとともに実機への転移も実証した。
原題: Pixel Motion Diffusion is What We Need for Robot Control / E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe 他
日本語で読む → - 論文VLAロボティクス
SocialNav-SUB: ソーシャルロボットナビゲーションにおけるシーン理解のためのVLMベンチマーク
ソーシャルロボットナビゲーションの実世界シーン理解を評価するVQAデータセットとベンチマークを提案し、最先端VLMが人間やルールベース手法に及ばないことを示した。
原題: SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation / Michael J. Munje, Chen Tang, Shuijing Liu 他
日本語で読む → - 論文VLAAI
タスクの生成的世界モデル:LLM駆動の階層的足場構築による身体性エージェント
ロボットサッカーのような長期的マルチエージェントタスクに対し、LLMをタスクの生成的世界モデルとして用い、階層的タスクネットワークで複雑な目標を分解する枠組みを提案した論文。
原題: Generative World Models of Tasks: LLM-Driven Hierarchical Scaffolding for Embodied Agents / Brennen Hill
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルを内部表現から解釈・制御する機構的解釈可能性フレームワーク
VLAモデルの内部活性をトークン埋め込み基底に射影し、速度や方向などの意味的方向を同定して、微調整なしにリアルタイムで行動を制御する手法を提案した。
原題: Mechanistic interpretability for steering vision-language-action models / Bear Häon, Kaylene Stocking, Ian Chuang 他
日本語で読む → - 論文VLAロボティクス
ActiveVLN: マルチターン強化学習による能動的探索を実現する視覚言語ナビゲーション
視覚言語ナビゲーションにおいて、少数の模倣学習で初期化した後、マルチターン強化学習とGRPOで能動的に探索し、効率的に性能を向上させるフレームワークを提案。
原題: ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation / Zekai Zhang, Weiye Zhu, Hewei Pan 他
日本語で読む → - 論文VLAロボティクス
FPC-VLA:失敗予測と修正のためのスーパーバイザを備えた視覚-言語-行動フレームワーク
VLAモデルに失敗予測と修正を行うスーパーバイザを組み合わせ、シミュレーションと実機で成功率を向上させたデュアルモデルフレームワーク。
原題: FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction / Yifan Yang, Zhixiang Duan, Tianshi Xie 他
日本語で読む → - 論文VLAロボティクス
見て、指して、飛ぶ:汎用無人航空ナビゲーションのための学習不要VLMフレームワーク
VLMを活用し、自由な言語指示を画像上の2Dウェイポイントに変換してドローンを閉ループ制御する、学習不要の航空視覚言語ナビゲーション手法を提案。
原題: See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation / Chih Yao Hu, Yang-Sen Lin, Yuna Lee 他
日本語で読む →