論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/1/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚言語モデルによる園芸ロボットのタスク計画
VLMが異種データを能動的に照会してロボットのタスク計画を導くモジュール式フレームワークを提案し、作物モニタリングのベンチマークで性能を評価した。
原題: Visual-Language-Guided Task Planning for Horticultural Robots / Jose Cuaran, Kendall Koe, Aditya Potnis 他
日本語で読む → - 論文VLAロボティクス
CLAP: 人間の動画から視覚-言語-行動モデルを学習するための対照的潜在行動事前学習
人間の動画からロボットの行動スキルを抽出し、視覚-言語-行動モデルを事前学習するフレームワークCLAPを提案。対照学習で人間の動画をロボットの行動語彙に整合させ、効率的なスキル転移を実現した。
原題: CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos / Chubin Zhang, Jianan Wang, Zifeng Gao 他
日本語で読む → - 論文VLAeess.AS
音声指示で操るVLA自動運転:EchoVLA
音声指示と感情を統合したVLAモデルEchoVLAを提案し、nuScenesに音声を付与してファインチューニング、L2誤差と衝突率を大幅に削減した。
原題: Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving / Ziang Guo, Feng Yang, Xuefeng Zhang 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルによるシミュレーション環境でのドローン multitask 操作の強化
微調整したCodeT5とAirSimを組み合わせ、自然言語コマンドからドローン操作用コードを自動生成してマルチタスクを実行する手法を提案。
原題: Large Language Models to Enhance Multi-task Drone Operations in Simulated Environments / Yizhan Feng, Hichem Snoussi, Jing Teng 他
日本語で読む → - 論文VLAロボティクス
PALM: アフォーダンス推論と進捗認識による長期的ロボットマニピュレーションのためのポリシー学習
視覚言語行動モデルにアフォーダンス推論とサブタスク進捗予測を組み込み、長期的な多段階ロボット操作の成功率と汎化性能を大幅に向上させた研究。
原題: PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation / Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo 他
日本語で読む → - 論文VLA画像認識
UAV映像理解のためのBLIP-2を用いたエッジ最適化マルチモーダル学習
BLIP-2にYOLO-WorldとYOLOv8-Segを組み合わせ、キーフレーム選定とプロンプト最適化により、UAVのエッジ機器でも動作する軽量なマルチモーダル映像理解プラットフォームを提案した。
原題: Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2 / Yizhan Feng, Hichem Snoussi, Jing Teng 他
日本語で読む → - 論文VLA画像認識
PEAfowl: 知覚強化型マルチビュー視覚-言語-行動モデルによる両腕マニピュレーション
両腕ロボット操作のためのVLAモデル。トークンごとの深度分布予測と微分可能な3Dリフティングで視点間の幾何学的整合性を高め、Perceiver型のテキスト認識読み出しで指示の接地を改善。訓練時のみの深度蒸留でノイズの多い深度を補い、RoboTwin 2.0で成功率を23ポイント向上させた。
原題: PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation / Qingyu Fan, Zhaoxiang Li, Yi Lu 他
日本語で読む → - 論文VLA自然言語
身体性AIデータセットにおける言語的多様性の限界
VLAモデルの訓練・評価に使われるデータセットの指示文を体系的に調査し、語彙の多様性や重複、構文の複雑さを分析した結果、多くのデータセットが反復的でテンプレート的な命令に依存していることを明らかにした。
原題: Limited Linguistic Diversity in Embodied AI Datasets / Selma Wanna, Agnes Luhtaru, Jonathan Salfity 他
日本語で読む → - 論文VLA画像認識
FantasyVLN: 視覚言語ナビゲーションのための統合マルチモーダル思考連鎖推論
視覚言語ナビゲーションにおいて、想像上の視覚トークンを潜在空間に圧縮して思考連鎖推論を行い、リアルタイム動作を実現する統合フレームワークを提案。
原題: FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation / Jing Zuo, Lingzhou Mu, Fan Jiang 他
日本語で読む → - 論文VLAロボティクス
DynamicVLA:動的物体操作のための視覚-言語-行動モデル
動的物体操作のためのVLAフレームワークを提案し、時系列推論と閉ループ適応を統合。合成・実世界データからなるDOMベンチマークも構築した。
原題: DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation / Haozhe Xie, Beichen Wen, Jiarui Zheng 他
日本語で読む → - 論文VLAロボティクス
SG-CADVLM: 事故報告から安全-criticalシナリオを生成する文脈認識デコーディング搭載視覚言語モデル
事故報告書から自動運転の安全検証用シナリオを生成するため、文脈認識デコーディングとマルチモーダル入力を組み合わせたVLMフレームワークを提案し、高リスクシナリオ生成率を大幅に向上させた。
原題: SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation / Hongyi Zhao, Shuo Wang, Qijie He 他
日本語で読む → - 論文VLAセキュリティcs.CR
SilentDrift: アクションチャンキングを悪用したVLAモデルへのステルスバックドア攻撃
VLAモデルのアクションチャンキングとデルタポーズ表現に潜む脆弱性を突き、Smootherstep関数とキーフレーム戦略で検知困難なバックドア攻撃を実現した研究。
原題: SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models / Bingxin Xu, Yuzhang Shang, Binghui Wang 他
日本語で読む → - 論文VLAロボティクス
V-VLAPS: 価値誘導型ビジョン・言語・行動モデルプランニング
VLAモデルの計画に軽量な価値ヘッドを追加し、モンテカルロ木探索を高価値な分岐へ誘導することで、長期タスクや分布シフト下での性能を改善する手法を提案。
原題: V-VLAPS: Value-Guided Planning for Vision-Language-Action Models / Ke Ren, Ali Salamatian, Kieran Pattison 他
日本語で読む → - 論文VLAロボティクス
Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
原題: Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization / Hao Luo, Ye Wang, Wanpeng Zhang 他
日本語で読む → - 論文VLAロボティクス
SOP:視覚-言語-行動モデルのためのスケーラブルなオンライン事後学習システム
ロボット群が実世界で収集した経験と人間の介入をクラウド上の学習器に非同期で送り、更新された方策を即座に受け取るオンライン分散事後学習システムを提案。布畳みや箱組立などのタスクで大規模VLAモデルの性能を数時間で大幅に向上させる。
原題: SOP: A Scalable Online Post-Training System for Vision-Language-Action Models / Mingjie Pan, Siyuan Feng, Qinglin Zhang 他
日本語で読む → - 論文VLAロボティクス
エッジ上の視覚言語モデルによるリアルタイムロボット知覚
ヒューマノイドロボットUnitree G1を題材に、WebRTCでマルチモーダルデータをエッジノードへ送り、VLMをエッジとクラウドで動かして精度と遅延を比較した。
原題: Vision-Language Models on the Edge for Real-Time Robotic Perception / Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi
日本語で読む → - 論文VLAロボティクス
脳に着想を得た身体性知能による流動的で高速な反射的ロボティクス制御
皮質・小脳・脊髄の構造を模したニューロモーフィックVLAを実機ロボットに初めて実装し、腕の振動抑制や20ms未満の安全反射、時間記憶を実現した。
原題: A Brain-inspired Embodied Intelligence for Fluid and Fast Reflexive Robotics Control / Weiyu Guo, He Zhang, Pengteng Li 他
日本語で読む → - 論文VLAロボティクス
TeNet: テキストからコンパクトなポリシーを合成するネットワーク
大規模言語モデルのテキスト埋め込みをハイパーネットワークに入力し、自然言語指示から直接コンパクトで実行可能なロボットポリシーを生成する手法を提案。実行時は低次元状態のみで高速制御を実現する。
原題: TeNet: Text-to-Network for Compact Policy Synthesis / Ariyan Bighashdel, Kevin Sebastian Luck
日本語で読む → - 論文VLAロボティクス
実用的なVLA基盤モデル
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
原題: A Pragmatic VLA Foundation Model / Wei Wu, Fan Lu, Yunnan Wang 他
日本語で読む → - 論文VLAロボティクス
異なる身体を持つロボット制御のための統一潜在空間の学習
人間と多様なヒューマノイドロボットの運動を統一する共有潜在空間を学習し、人間のデータのみで訓練した目標条件付き制御方策を複数のロボットに適応なしで展開できるフレームワークを提案した。
原題: Learning a Unified Latent Space for Cross-Embodiment Robot Control / Yashuai Yan, Dongheui Lee
日本語で読む → - 論文VLAロボティクス
HumanDiffusion: 捜索救助UAVのための人間条件付き目標を持つ視覚ベース拡散軌道プランナ
RGB画像から人間を検出し、拡散モデルで人間を考慮したナビゲーション軌道を生成する軽量プランナを提案し、救助UAVの実環境タスクで80%の成功率を示した。
原題: HumanDiffusion: A Vision-Based Diffusion Trajectory Planner with Human-Conditioned Goals for Search and Rescue UAV / Faryal Batool, Iana Zhura, Valerii Serpiva 他
日本語で読む → - 論文VLAロボティクス
汎用大規模言語モデルによるドローン指揮統制インターフェース
MCP標準とMavlinkを組み合わせ、LLMや機体に依存しない汎用的なドローン管制インターフェースを構築し、実機飛行制御を実証した。
原題: A Universal Large Language Model -- Drone Command and Control Interface / Javier N. Ramos-Silva, Peter J. Burke
日本語で読む → - 論文VLA画像認識
DTP: 視覚言語行動モデルのための簡便かつ効果的な妨害トークン枝刈りフレームワーク
VLAモデルがタスク無関係領域の画像トークンに過剰に注意する問題を解決するため、動的に検出・枝刈りするプラグアンドプレイのDTPフレームワークを提案し、タスク成功率を改善した。
原題: DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models / Chenyang Li, Jieyuan Liu, Bin Li 他
日本語で読む → - 論文VLAロボティクス
TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
原題: TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion / Weishi Mi, Yong Bao, Xiaowei Chi 他
日本語で読む → - 論文VLA自然言語
Moxin-VLMとMoxin-VLAを備えたオープンソースマルチモーダルMoxinモデル
完全オープンソースのLLM「Moxin」を基に、視覚言語理解・視覚言語行動・中国語対応の3つの派生モデルを開発し、公開した。
原題: Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA / Pu Zhao, Arash Akbari, Xuan Shen 他
日本語で読む → - 論文VLA機械学習
視覚言語行動モデルの汎用性を測る統一ベンチマーク
VLMとVLAの6つの能力領域にわたるクロスドメイン汎用性を評価する統一ベンチマークMultiNet v1.0を提案し、既存モデルが訓練分布外で大きく性能劣化することを示した。
原題: Benchmarking the Generality of Vision-Language-Action Models / Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka 他
日本語で読む → - 論文VLA画像認識
決定論的ワールドモデルによる視覚ベースEnd-to-End制御の閉ループ到達可能性解析
物理状態から合成カメラ画像を生成する決定論的ワールドモデルを提案し、確率的潜在変数による過大近似なしに視覚ベース制御器の閉ループ到達可能性解析を可能にした。
原題: Deterministic World Models for Closed-loop Reachability Analysis of End-to-End Vision-based Control / Yuang Geng, Zhongzheng Zhang, Chengzhen Jiang 他
日本語で読む → - 論文VLAロボティクス
LEO-RobotAgent:言語駆動型身体操作のための汎用ロボットエージェント
LLMがUAV・ロボットアーム・車輪ロボットなど多様なロボットを操作し、複雑なタスクをこなす汎用エージェントフレームワークを提案。モジュール式ツールセットと人間との協調機構を備える。
原題: LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator / Lihuang Chen, Xiangyu Luo, Jun Meng
日本語で読む → - 論文VLAロボティクス
Cosmos-H-Surgical: 世界モデルによる手術ロボット方策の動画学習
手術動画から世界モデルを構築し、逆動力学モデルで擬似キネマティクスを推定することで、実演データ不足を補い手術ロボットのVLA方策を学習する手法を提案。
原題: Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling / Yufan He, Pengfei Guo, Mengya Xu 他
日本語で読む → - 論文VLA画像認識
SpaceTools: 二重対話型強化学習によるツール拡張空間推論
VLMが複数の視覚ツールを強化学習で協調利用できるよう訓練する二段階フレームワークDIRLを提案し、空間推論ベンチマークで最高性能と実機マニピュレーションを実現した。
原題: SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL / Siyi Chen, Mikaela Angelina Uy, Chan Hee Song 他
日本語で読む →