論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しする
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
原題: SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation / Zekun Qi, Wenyao Zhang, Yufei Ding 他
日本語で読む → - 論文VLAHCI
AoECR:高齢者介護ロボットのAI化
介護ベッドを基盤に患者と看護師の対話データセットを構築し、大規模言語モデルを微調整して安全な操作と人間らしい応答を実現する高齢者介護ロボット向けの汎用AIアーキテクチャを提案した。
原題: AoECR: AI-ization of Elderly Care Robot / Linkun Zhou, Jian Li, Yadong Mo 他
日本語で読む → - 論文VLAロボティクス
RAPID: 逆強化学習を用いた視覚ベースドローン航法のための堅牢で敏捷なプランナ
逆強化学習を活用し、複雑な環境でドローンが高速かつ衝突回避しながら飛行する視覚ベースのプランナを提案。シミュレーションのみで学習し実環境に直接適用可能。
原題: RAPID: Robust and Agile Planner Using Inverse Reinforcement Learning for Vision-Based Drone Navigation / Minwoo Kim, Geunsik Bae, Jinwoo Lee 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルの微調整:速度と成功率の最適化
VLAモデルの微調整戦略を検討し、並列デコードやアクションチャンキングを組み合わせた最適化レシピを提案。LIBEROベンチマークで成功率を76.5%から97.1%に向上させ、推論速度も26倍高速化した。
原題: Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success / Moo Jin Kim, Chelsea Finn, Percy Liang
日本語で読む → - 論文VLAロボティクス
GEVRM: 目標表現型ビデオ生成モデルによるロバストな視覚マニピュレーション
内部モデル制御の原理を取り入れ、テキスト誘導のビデオ生成で将来の視覚的目標を生成しつつ、摂動を内部埋め込みとして推定することで、外乱に強い閉ループVLAを実現した研究。
原題: GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation / Hongyin Zhang, Pengxiang Ding, Shangke Lyu 他
日本語で読む → - 論文VLAAI
User-VLM 360°: 社会的ヒューマンロボットインタラクションのためのユーザー認識チューニングによる個人適応型視覚言語モデル
ユーザーの視覚・言語信号に基づきリアルタイムで適応する個人化視覚言語モデルを提案し、バイアス軽減と社会的感情データセットを統合してPepperロボットで実証した。
原題: USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions / Hamed Rahimi, Adil Bahaj, Mouad Abrini 他
日本語で読む → - 論文VLAロボティクス
RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデル
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
原題: RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete / Yuheng Ji, Huajie Tan, Jiayu Shi 他
日本語で読む → - 論文VLAロボティクス
4D表現で事前学習する自己回帰ロボットモデル
人間の動画から得た3D点追跡の4D表現を活用し、ロボット制御に効率的に転移できる自己回帰モデルARM4Rを提案した。
原題: Pre-training Auto-regressive Robotic Models with 4D Representations / Dantong Niu, Yuvan Sharma, Haoru Xue 他
日本語で読む → - 論文VLAロボティクス
3D空間接地型視覚言語フレームワークによるロボットタスク計画:プロンプト自動合成と教師あり推論
2D画像を点群にマッピングしてVLMに3D空間情報を自動抽出させ、小型言語モデルで出力を監督することで、幻覚を抑え高信頼なロボット制御コードを生成するフレームワークを提案。再学習不要で96%のタスク成功率を達成した。
原題: 3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning / Guoqin Tang, Qingxuan Jia, Zeyuan Huang 他
日本語で読む → - 論文VLAロボティクス
空間認識インストラクションチューニング:視覚障害者を支援する盲導犬ロボットのためのデータセットとベンチマーク
視覚障害者支援の盲導犬ロボット向けに、3D空間の経路と周囲環境を理解させるSAITデータセットとSA-Benchを構築し、空間認識を強化したVLMが歩行案内で既存手法を上回ることを示した。
原題: Space-Aware Instruction Tuning: Dataset and Benchmark for Guide Dog Robots Assisting the Visually Impaired / ByungOk Han, Woo-han Yun, Beom-Su Seo 他
日本語で読む → - 論文VLA画像認識
テキストと視覚を繋ぐ:クロスモーダル場所認識のためのマルチビューテキスト・視覚位置合わせ手法
テキスト記述のみで画像データベースを照合する初の場所認識手法Text4VPRを提案し、360度マルチビュー画像との位置合わせを実現した。
原題: Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition / Tianyi Shang, Zhenyu Li, Pengjie Xu 他
日本語で読む → - 論文VLAロボティクス
時間的絡み合いの罠:視覚運動ポリシー学習における事前学習済み視覚表現の活用
事前学習済み視覚表現を逐次意思決定に使うと時間的絡み合いが生じる問題を指摘し、その影響を定量化して、絡み合いを解く簡単なベースラインを提案した論文。
原題: The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning / Nikolaos Tsagkas, Andreas Sochopoulos, Duolikun Danier 他
日本語で読む → - 論文VLAロボティクス
ChatVLA:視覚・言語・行動モデルによるマルチモーダル理解とロボット制御の統合
視覚言語行動モデルにおける「忘却」と「タスク干渉」を解決するため、段階的アライメント訓練とMixture-of-Expertsを組み合わせたChatVLAを提案し、マルチモーダル理解と実ロボット操作の両方で高性能を実現した。
原題: ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model / Zhongyi Zhou, Yichen Zhu, Minjie Zhu 他
日本語で読む → - 論文VLAロボティクス
先見から熟慮へ:潜在空間アライメントによるVLM-in-the-Loop方策ステアリング
生成的なロボット方策の失敗を減らすため、潜在世界モデルで行動の結果を予測し、それをVLMが言語で評価して低レベル行動を選別する枠組みを提案。
原題: From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment / Yilin Wu, Ran Tian, Gokul Swamy 他
日本語で読む → - 論文VLAロボティクス
HAMSTER: オープンワールドロボット操作のための階層型行動モデル
高レベルVLMが粗い2D経路を予測し、低レベル3D制御ポリシーが精密操作を行う階層型VLAモデルを提案。非ドメインデータを活用し、実機でのオープンワールド汎化を実現する。
原題: HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation / Yi Li, Yuquan Deng, Jesse Zhang 他
日本語で読む → - 論文VLAロボティクス
QueryAdapter: 自然言語クエリに応答する視覚言語モデルの迅速適応
ロボットが収集した未ラベル画像を用い、自然言語クエリに関連する意味クラスへVLMを数分で適応させるフレームワークを提案。物体キャプションを負例として活用し、物体検索性能を向上させた。
原題: QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries / Nicolas Harvey Chapman, Feras Dayoub, Will Browne 他
日本語で読む → - 論文VLAロボティクス
VLAS: 音声指示によるカスタマイズ可能なロボット操作のための視覚-言語-行動モデル
音声認識をロボット方策モデルに直接統合したエンドツーエンドの視覚-言語-行動モデルVLASを提案し、音声指示によるロボット操作を実現した。
原題: VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation / Wei Zhao, Pengxiang Ding, Min Zhang 他
日本語で読む → - 論文VLAロボティクス
Humanoid-VLA:視覚統合による汎用人型ロボット制御
言語・自己視点映像・運動制御を統合し、大規模未ラベル動画を自己教師ありで活用することで、物体操作や環境探索をこなす汎用人型ロボット制御フレームワークを提案した。
原題: Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration / Pengxiang Ding, Jianfei Ma, Xinyang Tong 他
日本語で読む → - 論文VLAロボティクス
InstructRobot: 自然言語指示をロボット動作に変換するモデルフリー枠組み
大規模データセットやロボットの運動学モデルを必要とせず、強化学習で言語表現と逆運動学を同時学習し、26自由度ロボットの物体操作を実現するフレームワーク。
原題: InstructRobot: A Model-Free Framework for Mapping Natural Language Instructions into Robot Motion / Iury Cleveston, Alana C. Santana, Paula D. P. Costa 他
日本語で読む → - 論文VLA機械学習
協調知覚のための深層強化学習に基づくユーザスケジューリング
V2X通信を用いた協調知覚において、深層強化学習(DDQN)で通信リンクのスケジューリングを最適化し、ラベル不要の目的関数で知覚精度を高める手法を提案した論文。
原題: Deep Reinforcement Learning-Based User Scheduling for Collaborative Perception / Yandi Liu, Guowei Liu, Le Liang 他
日本語で読む → - 論文VLAロボティクス
時間表現アラインメント:後継特徴がロボット指示追従における創発的な構成性を可能にする
現在と将来の状態表現を時間的に整合させる損失で学習することで、明示的なサブタスク計画や強化学習なしに、基本タスクの組み合わせからなる複合タスクをこなせる構成性がロボット操作タスクで向上することを示した論文。
原題: Temporal Representation Alignment: Successor Features Enable Emergent Compositionality in Robot Instruction Following / Vivek Myers, Bill Chunyuan Zheng, Anca Dragan 他
日本語で読む → - 論文VLAロボティクス
LIR-LIVO: 照明に頑健な深層特徴を用いた軽量でロバストなLiDAR・視覚・慣性オドメトリ
照明が厳しい環境でも安定して動くよう、深層学習ベースの照明耐性特徴とLiDAR点群による深度統合、SuperPoint/LightGlueによる適応的マッチングを組み合わせた軽量なLiDAR-慣性-視覚オドメトリを提案し、複数データセットで高精度・低計算コストを実証した。
原題: LIR-LIVO: A Lightweight,Robust LiDAR/Vision/Inertial Odometry with Illumination-Resilient Deep Features / Shujie Zhou, Zihao Wang, Xinye Dai 他
日本語で読む → - 論文VLAロボティクス
VLAモデルの内部表現から記号的状態を探り認知アーキテクチャへ統合する
OpenVLAの隠れ層を解析し、物体・関係・行動状態の記号的表現が高精度で符号化されていることを示すとともに、認知アーキテクチャDIARCと統合して解釈性と堅牢性を高める手法を提案した。
原題: Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture / Hong Lu, Hengxu Li, Prithviraj Singh Shahani 他
日本語で読む → - 論文VLA機械学習
RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
原題: Learning the RoPEs: Better 2D and 3D Position Encodings with STRING / Connor Schenck, Isaac Reid, Mithun George Jacob 他
日本語で読む → - 論文VLAロボティクス
再学習不要のスケーラブルな視覚言語ロボティクス:コンシューマGPU向けモジュラー型マルチモデルフレームワーク
軽量なオープンソースAIモデルを組み合わせ、再学習なしで自然言語指示によるピック&プレースを実現するモジュラーフレームワークSVLRを提案。コンシューマ向けGPUでも動作する。
原題: Scalable, Training-Free Visual Language Robotics: A Modular Multi-Model Framework for Consumer-Grade GPUs / Marie Samson, Bastien Muraccioli, Fumio Kanehiro
日本語で読む → - 論文VLAAI
汎用人工知能に向けた大規模言語モデル:基礎原理とアプローチのサーベイ
大規模言語モデルが人間レベルの汎用知能に到達するために必要な身体性・記号接地・因果性・記憶という基礎的問題を整理し、最新の研究アプローチを概観したサーベイ論文。
原題: Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches / Alhassan Mumuni, Fuseini Mumuni
日本語で読む → - 論文VLAロボティクス
SpatialVLA:視覚-言語-行動モデルのための空間表現の探求
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
原題: SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model / Delin Qu, Haoming Song, Qizhi Chen 他
日本語で読む → - 論文VLA画像認識
MetaVQA:視覚言語モデルのための具現化シーン理解ベンチマーク
自動運転向けに、nuScenesとWaymoのデータからVQAペアを自動生成し、視覚言語モデルの空間推論と閉ループ意思決定を評価・改善するベンチマークMetaVQAを提案した。
原題: Embodied Scene Understanding for Vision Language Models via MetaVQA / Weizhen Wang, Chenda Duan, Zhenghao Peng 他
日本語で読む → - 論文VLAロボティクス
UAVとLLMの融合:エージェント型低空モビリティへの展望
UAVと大規模言語モデル(LLM)の統合に関する研究動向を整理し、マルチモーダルデータや応用タスクを分類するとともに、自律的な知能を持つエージェント型UAVへのロードマップを提案したサーベイ論文。
原題: UAVs Meet LLMs: Overviews and Perspectives Toward Agentic Low-Altitude Mobility / Yonglin Tian, Fei Lin, Yiduo Li 他
日本語で読む → - 論文VLAロボティクス
調整可能なマッピング仕様を持つ記号命令に対する柔軟な方策の強化学習
記号命令とそのマッピング仕様を分離して強化学習方策に組み込み、仕様認識型状態変調と記号数ベースのカリキュラムで柔軟な方策を学習する手法SIAMSを提案した。
原題: Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications / Wataru Hatanaka, Ryota Yamashina, Takamitsu Matsubara
日本語で読む →