論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
少数ショット視覚言語行動インクリメンタル方策学習
少数の実演から新しい操作タスクを継続的に学習するため、タスク固有プロンプトとタスク関係グラフによる進化戦略を組み合わせたTOPICを提案した論文。
原題: Few-Shot Vision-Language Action-Incremental Policy Learning / Mingchen Song, Xiang Deng, Guoqiang Zhong 他
日本語で読む → - 論文VLAロボティクス
UAV-VLN: 無人航空機のためのエンドツーエンド視覚言語誘導ナビゲーション
大規模言語モデルと視覚認識を統合し、自然言語指示に基づいて無人航空機が未知環境を自律飛行するエンドツーエンドの視覚言語ナビゲーション手法を提案した。
原題: UAV-VLN: End-to-End Vision Language guided Navigation for UAVs / Pranav Saxena, Nishant Raghuvanshi, Neena Goveas
日本語で読む → - 論文VLAロボティクス
大規模言語モデルによる軌道適応
事前学習済みLLMを用いて、人間の指示に応じてロボットの軌道ウェイポイントをコード生成により適応させる、タスク特化型学習不要のフレームワークを提案。
原題: Trajectory Adaptation using Large Language Models / Anurag Maurya, Tashmoy Ghosh, Ravi Prakash
日本語で読む → - 論文VLAロボティクス
SAS-Prompt: 大規模言語モデルを数値最適化器として活用したロボットの自己改善
LLMが数値最適化を行える点に着目し、過去のロボット軌道を要約・分析・統合する単一プロンプト(SAS-Prompt)でロボット方策を反復的に自己改善する手法を提案。シミュレーションと実機の卓球タスクで検証した。
原題: SAS-Prompt: Large Language Models as Numerical Optimizers for Robot Self-Improvement / Heni Ben Amor, Laura Graesser, Atil Iscen 他
日本語で読む → - 論文VLAロボティクス
RoboAct-CLIP: ロボティクス向け原子行動理解のための動画駆動型事前学習
ロボット動画を原子行動単位で再注釈したデータセットと、CLIPを時間的に脱結合する微調整戦略により、ロボット操作に重要な時系列行動意味を学習する手法を提案。
原題: RoboAct-CLIP: Video-Driven Pre-training of Atomic Action Understanding for Robotics / Zhiyuan Zhang, Yuxin He, Yong Sun 他
日本語で読む → - 論文VLA画像認識
視覚障害者向け大規模視覚言語モデルによる環境認識システム
RGB画像のセグメンテーション結果を外部知識としてLVLMに入力し、幻覚を抑えつつ視覚障害者が周囲環境を理解できるウェアラブルシステムを提案した。
原題: A Large Vision-Language Model based Environment Perception System for Visually Impaired People / Zezhou Chen, Zhaoxiang Liu, Kai Wang 他
日本語で読む → - 論文VLAロボティクス
視覚環境と対話する身体性複雑質問応答のための計画手法
視覚階層シーングラフと外部ルールを用いて、複雑な質問に逐次計画で答える身体性ロボットのフレームワークを提案し、新データセットで有効性を示した。
原題: Visual Environment-Interactive Planning for Embodied Complex-Question Answering / Ning Lan, Baoshan Ou, Xuemei Xie 他
日本語で読む → - 論文VLAロボティクス
自然言語対話によるロボットタスクの曖昧性解消
言語指示の曖昧さをシーンに基づいて検出・解消するAmbResVLMを提案し、実機で下流ポリシーの成功率を69.6%から97.1%に改善した。
原題: Robotic Task Ambiguity Resolution via Natural Language Interaction / Eugenio Chisari, Jan Ole von Hartz, Fabien Despinoy 他
日本語で読む → - 論文VLAAI
大規模言語モデルとシンボルネットワークを用いたアフォーダンス駆動型環境認識フレームワークの提案
LLMの出力を形態素・係り受け解析でシンボルネットワークに再構成し、ネットワーク距離から文脈依存のアフォーダンスを自動獲得する手法を提案した。
原題: Proposition of Affordance-Driven Environment Recognition Framework Using Symbol Networks in Large Language Models / Kazuma Arii, Satoshi Kurihara
日本語で読む → - 論文VLAロボティクス
ATLASv2: エッジ上でのLLM誘導による適応的ランドマーク獲得とナビゲーション
Jetson Nano上でTinyLLMと物体検出を組み合わせ、自然言語指示を分解してランドマークを動的に獲得しながらナビゲーションと操作を行うエッジ完結型システムを実現した。
原題: ATLASv2: LLM-Guided Adaptive Landmark Acquisition and Navigation on the Edge / Mikolaj Walczak, Uttej Kallakuri, Tinoosh Mohsenin
日本語で読む → - 論文VLAロボティクス
MuTRAP:ロボットタスクプランニングを攻撃するマルチトリガートロイの木馬
LLMを用いたロボットタスクプランナーに対し、少数のタスク特化パラメータでバックドアを注入し、複数のトリガーで悪意ある行動を引き起こす初のマルチトリガートロイ攻撃手法を提案。
原題: MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems / Mohaiminul Al Nahian, Zainab Altaweel, David Reitano 他
日本語で読む → - 論文VLAAI
身体性エージェントに空間推論能力を与える視覚言語ナビゲーション
生物の空間認知理論に基づくBrainNavを提案し、二重マップと二重方位戦略で実世界の視覚言語ナビゲーションにおける空間幻覚を低減した。
原題: Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation / Qianqian Bai, Zhongpu Chen, Ling Luo 他
日本語で読む → - 論文VLAロボティクス
マルチモーダル融合と視覚言語モデル:ロボットビジョンのサーベイ
ロボットビジョンにおけるマルチモーダル融合手法と視覚言語モデルの応用をタスク指向で体系的にレビューし、課題と将来方向を整理したサーベイ。
原題: Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision / Xiaofeng Han, Shunpeng Chen, Zenghuang Fu 他
日本語で読む → - 論文VLAロボティクス
身体性を持つ生成AIシステムの性能・効率・拡張性に関するシステムレベル分析
LLMを活用した身体性エージェントシステムを4つのパラダイムに分類し、ベンチマークを通じて性能とシステム効率を評価して課題を明らかにし、最適化戦略を提案した初のシステムレベル分析。
原題: Generative AI in Embodied Systems: System-Level Analysis of Performance, Efficiency and Scalability / Zishen Wan, Jiayi Qian, Yuhang Du 他
日本語で読む → - 論文VLAロボティクス
原子力廃炉検査のための選好駆動型アクティブ3Dシーン表現
原子力廃炉の遠隔検査において、作業者の選好をRLHFで報酬関数に組み込み、ロボットアームの視点計画を最適化するフレームワークを提案した。
原題: Preference-Driven Active 3D Scene Representation for Robotic Inspection in Nuclear Decommissioning / Zhen Meng, Kan Chen, Xiangmin Xu 他
日本語で読む → - 論文VLA画像認識
身体性を活用した画像キャプション生成:空間的に一貫した説明のための自己教師あり学習エージェント
エージェントが環境を探索して画像とキャプションのペアを収集し、大規模言語モデルによるコンセンサスで擬似キャプションを生成、コントラスティブ学習を加えてキャプションモデルを微調整することで、視点によらず一貫した物体説明を可能にする自己教師ありフレームワークを提案。
原題: Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions / Tommaso Galliena, Tommaso Apicella, Stefano Rosa 他
日本語で読む → - 論文VLAロボティクス
身体性行動連鎖推論とマルチモーダル基盤モデルによるヒューマノイドのゼロショット移動操作エージェント
基盤モデルの推論と身体性行動連鎖(CoA)機構を組み合わせ、人間の指示を移動・操作のプリミティブ列に分解することで、ヒューマノイドのゼロショット移動操作を実現したフレームワーク。
原題: Humanoid Agent via Embodied Chain-of-Action Reasoning with Multimodal Foundation Models for Zero-Shot Loco-Manipulation / Congcong Wen, Geeta Chandra Raju Bethala, Yu Hao 他
日本語で読む → - 論文VLAロボティクス
NORA: 実世界タスク向け小型オープンソース汎用視覚言語行動モデル
3Bパラメータのマルチモーダルモデルを基盤に97万件の実ロボット実演で学習し、大規模VLAより低計算コストで高いタスク性能を実現した。
原題: NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks / Chia-Yu Hung, Qi Sun, Pengfei Hong 他
日本語で読む → - 論文VLA画像認識
マルチモーダル大規模言語モデルによる一人称視点動画質問応答の高度化
一人称視点動画のQAデータセットQaEgo4Dv2を整備し、4つのMLLMをゼロショットとファインチューニングで評価、オープンソースモデルが新たな最高性能を達成した。
原題: Advancing Egocentric Video Question Answering with Multimodal Large Language Models / Alkesh Patel, Vibhav Chitalia, Yinfei Yang
日本語で読む → - 論文マルチモーダルVLAロボティクス
TransforMerger: 音声とジェスチャーを融合するTransformerベースのロボットコミュニケーション
音声とジェスチャーを統合したマルチモーダル入力から、Transformerでロボット操作の行動コマンドを推論する手法を提案。ノイズや曖昧な指示に強く、実世界実験で有効性を示した。
原題: TransforMerger: Transformer-based Voice-Gesture Fusion for Robust Human-Robot Communication / Petr Vanc, Karla Stepanova
日本語で読む → - 論文VLA自然言語
ConformalNL2LTL:自然言語指示を時間論理式へ変換する適合的保証付き手法
大規模言語モデルと適合予測を組み合わせ、自然言語の指示を線形時間論理式に変換する際の正しさをユーザー指定の成功率で保証しつつ、人手介入を最小化する手法を提案。
原題: ConformalNL2LTL: Translating Natural Language Instructions into Temporal Logic Formulas with Conformal Correctness Guarantees / David Smith Sundarsingh, Jun Wang, Jyotirmoy V. Deshmukh 他
日本語で読む → - 論文VLAロボティクス
OPAL: ロボット学習のための物理システムの因果的理解の符号化
物理法則に基づくトポロジー制約をフローマッチングに導入した視覚-言語-行動アーキテクチャOPALを提案し、複雑なマニピュレーションタスクでゼロショット性能を向上させつつ推論コストを42%削減した。
原題: OPAL: Encoding Causal Understanding of Physical Systems for Robot Learning / Daniel Tcheurekdjian, Joshua Klasmeier, Tom Cooney 他
日本語で読む → - 論文VLAロボティクス
KeyMPs: 遮蔽の多いタスクに向けたDMPシーケンスによるワンショット視覚言語誘導動作生成
視覚言語モデル(VLM)の高レベル推論と空間認識を活用し、キーワードラベル付きプリミティブ選択とキーポイントペア生成によってDMPを連結し、遮蔽が多いタスクでもワンショットで複雑なロボット動作を生成するフレームワークを提案。
原題: KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks / Edgar Anarossi, Yuhwan Kwon, Hirotaka Tahara 他
日本語で読む → - 論文VLAロボティクス
LangWBC: 言語指示によるヒューマノイド全身制御のエンドツーエンド学習
言語コマンドを直接解釈してヒューマノイドの全身動作を生成するエンドツーエンド方策を、強化学習と方策蒸留およびCVAE構造で実現し、実機で検証した。
原題: LangWBC: Language-directed Humanoid Whole-Body Control via End-to-end Learning / Yiyang Shao, Xiaoyu Huang, Bike Zhang 他
日本語で読む → - 論文VLAロボティクス
SoccerDiffusion: 試合記録からエンドツーエンドのヒューマノイドサッカーを学習する
RoboCupの試合記録からトランスフォーマー拡散モデルでヒューマノイドロボットのサッカー制御を直接学習し、蒸留により実機でリアルタイム推論を実現した。
原題: SoccerDiffusion: Toward Learning End-to-End Humanoid Robot Soccer from Gameplay Recordings / Florian Vahl, Jörn Griepenburg, Jan Gutsche 他
日本語で読む → - 論文VLAロボティクス
BT-ACTION:行動木とLLMを活用したユーザ指示のモジュール的理解のためのテスト駆動型アプローチ
行動木(BT)のモジュール構造とLLMを組み合わせ、複雑なユーザ指示からロボットの行動系列を生成するテスト駆動型手法を提案し、料理支援タスクでのユーザ研究で直接LLMプロンプトより誤りが少なく信頼性が高いことを示した。
原題: BT-ACTION: A Test-Driven Approach for Modular Understanding of User Instruction Leveraging Behaviour Trees and LLMs / Alexander Leszczynski, Sarah Gillet, Iolanda Leite 他
日本語で読む → - 論文VLA画像認識
ST-Booster: 連続環境における視覚言語ナビゲーションのための反復的時空間知覚強化手法
連続環境での視覚言語ナビゲーションにおいて、トポロジカルグラフとグリッドマップを組み合わせた階層的時空間符号化と、指示に基づく経路点生成により、知覚精度とナビゲーション性能を向上させる手法を提案した。
原題: ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments / Lu Yue, Dongliang Zhou, Liang Xie 他
日本語で読む → - 論文VLAロボティクス
PRISM-DP: セグメンテーション・メッシュ生成・姿勢追跡による拡散ポリシーのための空間姿勢観測
セグメンテーションとメッシュ生成、姿勢追跡を組み合わせ、手動メッシュ作成なしで物体の空間姿勢を観測として拡散ポリシーを学習する手法を提案。画像ベースより高精度で、真の状態と同等の性能を実現。
原題: PRISM-DP: Spatial Pose-based Observations for Diffusion-Policies via Segmentation, Mesh Generation, and Pose Tracking / Xiatao Sun, Yinxing Chen, Daniel Rakita
日本語で読む → - 論文VLAロボティクス
音声から軌道へ:ロボット動作のための人間らしい言語指示の学習
音声コマンドを直接動作軌道に変換するDirective Language Model(DLM)を提案し、言い換えへの頑健性と人間らしい動作生成を実現した。
原題: Speech-to-Trajectory: Learning Human-Like Verbal Guidance for Robot Motion / Eran Beeri Bamani, Eden Nissinman, Rotem Atari 他
日本語で読む → - 論文VLAロボティクス
ロボット主導の視覚言語モデルによる子どものウェルビーイング評価
ソーシャルロボットNAOが子どもに絵を見せて語らせ、その内容を視覚言語モデルが評価する手法を試み、心理士の評価と比較した。
原題: Robot-Led Vision Language Model Wellbeing Assessment of Children / Nida Itrat Abbasi, Fethiye Irmak Dogan, Guy Laban 他
日本語で読む →