論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA機械学習
RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
原題: Learning the RoPEs: Better 2D and 3D Position Encodings with STRING / Connor Schenck, Isaac Reid, Mithun George Jacob 他
日本語で読む → - 論文VLAロボティクス
VLAモデルの内部表現から記号的状態を探り認知アーキテクチャへ統合する
OpenVLAの隠れ層を解析し、物体・関係・行動状態の記号的表現が高精度で符号化されていることを示すとともに、認知アーキテクチャDIARCと統合して解釈性と堅牢性を高める手法を提案した。
原題: Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture / Hong Lu, Hengxu Li, Prithviraj Singh Shahani 他
日本語で読む → - 論文VLAロボティクス
LIR-LIVO: 照明に頑健な深層特徴を用いた軽量でロバストなLiDAR・視覚・慣性オドメトリ
照明が厳しい環境でも安定して動くよう、深層学習ベースの照明耐性特徴とLiDAR点群による深度統合、SuperPoint/LightGlueによる適応的マッチングを組み合わせた軽量なLiDAR-慣性-視覚オドメトリを提案し、複数データセットで高精度・低計算コストを実証した。
原題: LIR-LIVO: A Lightweight,Robust LiDAR/Vision/Inertial Odometry with Illumination-Resilient Deep Features / Shujie Zhou, Zihao Wang, Xinye Dai 他
日本語で読む → - 論文VLAロボティクス
時間表現アラインメント:後継特徴がロボット指示追従における創発的な構成性を可能にする
現在と将来の状態表現を時間的に整合させる損失で学習することで、明示的なサブタスク計画や強化学習なしに、基本タスクの組み合わせからなる複合タスクをこなせる構成性がロボット操作タスクで向上することを示した論文。
原題: Temporal Representation Alignment: Successor Features Enable Emergent Compositionality in Robot Instruction Following / Vivek Myers, Bill Chunyuan Zheng, Anca Dragan 他
日本語で読む → - 論文VLA機械学習
協調知覚のための深層強化学習に基づくユーザスケジューリング
V2X通信を用いた協調知覚において、深層強化学習(DDQN)で通信リンクのスケジューリングを最適化し、ラベル不要の目的関数で知覚精度を高める手法を提案した論文。
原題: Deep Reinforcement Learning-Based User Scheduling for Collaborative Perception / Yandi Liu, Guowei Liu, Le Liang 他
日本語で読む → - 論文VLAロボティクス
InstructRobot: 自然言語指示をロボット動作に変換するモデルフリー枠組み
大規模データセットやロボットの運動学モデルを必要とせず、強化学習で言語表現と逆運動学を同時学習し、26自由度ロボットの物体操作を実現するフレームワーク。
原題: InstructRobot: A Model-Free Framework for Mapping Natural Language Instructions into Robot Motion / Iury Cleveston, Alana C. Santana, Paula D. P. Costa 他
日本語で読む → - 論文VLAロボティクス
Humanoid-VLA:視覚統合による汎用人型ロボット制御
言語・自己視点映像・運動制御を統合し、大規模未ラベル動画を自己教師ありで活用することで、物体操作や環境探索をこなす汎用人型ロボット制御フレームワークを提案した。
原題: Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration / Pengxiang Ding, Jianfei Ma, Xinyang Tong 他
日本語で読む → - 論文VLAロボティクス
VLAS: 音声指示によるカスタマイズ可能なロボット操作のための視覚-言語-行動モデル
音声認識をロボット方策モデルに直接統合したエンドツーエンドの視覚-言語-行動モデルVLASを提案し、音声指示によるロボット操作を実現した。
原題: VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation / Wei Zhao, Pengxiang Ding, Min Zhang 他
日本語で読む → - 論文VLAロボティクス
QueryAdapter: 自然言語クエリに応答する視覚言語モデルの迅速適応
ロボットが収集した未ラベル画像を用い、自然言語クエリに関連する意味クラスへVLMを数分で適応させるフレームワークを提案。物体キャプションを負例として活用し、物体検索性能を向上させた。
原題: QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries / Nicolas Harvey Chapman, Feras Dayoub, Will Browne 他
日本語で読む → - 論文VLAロボティクス
応答性ノイズリレー拡散ポリシー:応答的で効率的な視覚運動制御
拡散ポリシーの応答性を高めるため、ノイズレベルを段階的に増やすバッファと逐次ノイズ除去を導入し、最新の観測に基づく即時行動生成を可能にした手法を提案。
原題: Responsive Noise-Relaying Diffusion Policy: Responsive and Efficient Visuomotor Control / Zhuoqun Chen, Xiu Yuan, Tongzhou Mu 他
日本語で読む → - 論文VLAロボティクス
先見から熟慮へ:潜在空間アライメントによるVLM-in-the-Loop方策ステアリング
生成的なロボット方策の失敗を減らすため、潜在世界モデルで行動の結果を予測し、それをVLMが言語で評価して低レベル行動を選別する枠組みを提案。
原題: From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment / Yilin Wu, Ran Tian, Gokul Swamy 他
日本語で読む → - 論文VLAロボティクス
HAMSTER: オープンワールドロボット操作のための階層型行動モデル
高レベルVLMが粗い2D経路を予測し、低レベル3D制御ポリシーが精密操作を行う階層型VLAモデルを提案。非ドメインデータを活用し、実機でのオープンワールド汎化を実現する。
原題: HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation / Yi Li, Yuquan Deng, Jesse Zhang 他
日本語で読む → - 論文VLAロボティクス
VL-Explore: モバイルロボットによるゼロショット視覚言語探索と目標発見
CLIPを用いて未知環境で地図や目標知識なしに探索と目標発見を同時に行うナビゲーションパイプラインを提案し、UGV「Open Rover」で実世界評価した。
原題: VL-Explore: Zero-shot Vision-Language Exploration and Target Discovery by Mobile Robots / Yuxuan Zhang, Adnan Abdullah, Sanjeev J. Koppal 他
日本語で読む → - 論文VLAロボティクス
汎用身体性エージェントのための視覚言語事前学習における順序性と連続性の証明可能な学習
人間の行動動画から視覚言語表現を事前学習する際に、目標到達に基づく時間対比学習ではなく、フレーム間の意味的差異とブラウン橋制約を用いて順序性と連続性を学習するAcTOLを提案し、模倣学習実験で操縦タスクの性能と指示スタイルへの頑健性を向上させた。
原題: Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents / Zhizhen Zhang, Lei Zhu, Zhen Fang 他
日本語で読む → - 論文VLAロボティクス
DeepUKF-VIN: IMU-視覚ネットに基づく3次元視覚慣性ナビゲーションのための適応調整型深層アンセンテッドカルマンフィルタ
IMUとカメラ画像から6自由度の姿勢・位置・速度を推定するため、深層学習でカルマンフィルタのノイズ共分散を適応調整する手法を提案し、GPS不要の3次元視覚慣性ナビゲーションを高精度化した。
原題: DeepUKF-VIN: Adaptively-tuned Deep Unscented Kalman Filter for 3D Visual-Inertial Navigation based on IMU-Vision-Net / Khashayar Ghanizadegan, Hashim A. Hashim
日本語で読む → - 論文VLAロボティクス
RAPID: 逆強化学習を用いた視覚ベースドローン航法のための堅牢で敏捷なプランナ
逆強化学習を活用し、複雑な環境でドローンが高速かつ衝突回避しながら飛行する視覚ベースのプランナを提案。シミュレーションのみで学習し実環境に直接適用可能。
原題: RAPID: Robust and Agile Planner Using Inverse Reinforcement Learning for Vision-Based Drone Navigation / Minwoo Kim, Geunsik Bae, Jinwoo Lee 他
日本語で読む → - 論文VLAロボティクス
視覚運動拡散ポリシー訓練のためのリアルタイム操作者介入
操作者が実行中の視覚運動拡散ポリシーにリアルタイムで介入し、修正動作を教示できる枠組みを提案し、剛体・変形・粒状物体タスクで性能向上を実証した。
原題: Real-Time Operator Takeover for Visuomotor Diffusion Policy Training / Marco Moletta, Michael C. Welle, Nils Ingelhag 他
日本語で読む → - 論文VLA画像認識
Magma: マルチモーダルAIエージェントのための基盤モデル
画像・動画・ロボットデータを統合的に学習し、UI操作からロボットマニピュレーションまでこなすマルチモーダル基盤モデルを提案。
原題: Magma: A Foundation Model for Multimodal AI Agents / Jianwei Yang, Reuben Tan, Qianhui Wu 他
日本語で読む → - 論文VLAロボティクス
RobotIQ: 実世界実行のための人間レベルの計画能力をモバイルロボットに付与するフレームワーク
任意のLLMと自然言語で連携し、ROS上でナビゲーション・マニピュレーション・物体位置推定などのタスクを計画・実行するモジュール型ロボットライブラリを提案し、高齢者支援の家庭サービスシナリオでシミュレーションと実機検証を行った。
原題: RobotIQ: Empowering Mobile Robots with Human-Level Planning for Real-World Execution / Emmanuel K. Raptis, Athanasios Ch. Kapoutsis, Elias B. Kosmatopoulos
日本語で読む → - 論文VLAロボティクス
VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーション
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。
原題: VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching / Siyu Xu, Yunke Wang, Chenghao Xia 他
日本語で読む → - 論文VLAロボティクス
ObjectVLA: 実演なしで実世界の物体操作を実現するエンドツーエンドVLA
Vision-Language-Actionモデルを用い、新規物体に対する実演データなしでロボットの物体操作スキルを汎化させる手法を提案し、実機で100種類の未見物体に対し64%の成功率を達成した。
原題: ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration / Minjie Zhu, Yichen Zhu, Jinming Li 他
日本語で読む → - 論文VLAロボティクス
行動ラベルなしデータからの推論による方策の汎化
人間の動画から言語ベースの推論を学習し、ロボットの行動ラベルなしデータを活用して汎化性能の高いロボット方策を訓練する手法RADを提案した。
原題: Action-Free Reasoning for Policy Generalization / Jaden Clark, Suvir Mirchandani, Dorsa Sadigh 他
日本語で読む → - 論文VLAロボティクス
MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
原題: MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation / Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu 他
日本語で読む → - 論文VLAロボティクス
身体性マルチモーダル大規模モデルの探求:開発・データセット・今後の展望
知覚・認知・行動を統合する身体性マルチモーダル大規模モデル(EMLM)について、LLMや大規模視覚モデルを含む発展、知覚・ナビゲーション・相互作用・シミュレーションの各側面、学習・評価用データセット、課題と今後の方向性を包括的にレビューした論文。
原題: Exploring Embodied Multimodal Large Models: Development, Datasets, and Future Directions / Shoubin Chen, Zehao Wu, Kai Zhang 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルの微調整:速度と成功率の最適化
VLAモデルの微調整戦略を検討し、並列デコードやアクションチャンキングを組み合わせた最適化レシピを提案。LIBEROベンチマークで成功率を76.5%から97.1%に向上させ、推論速度も26倍高速化した。
原題: Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success / Moo Jin Kim, Chelsea Finn, Percy Liang
日本語で読む → - 論文VLAロボティクス
連続環境における地上視点の視覚と言語によるナビゲーション
低視点の四足ロボット向けに、重み付き履歴観測と接続グラフ転移を用いて視覚と言語によるナビゲーションの汎化性能を高めるGVNavを提案した論文。
原題: Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments / Zerui Li, Gengze Zhou, Haodong Hong 他
日本語で読む → - 論文VLAAI
ImitDiff: 基盤モデルの事前知識を転移した妨害に頑健な視覚運動模倣ポリシー
視覚言語基盤モデルで指示をピクセル単位の意味マスクに変換し、二重解像度の知覚と拡散トランスフォーマで妨害に強い模倣学習ポリシーを実現した。
原題: ImitDiff: Transferring Foundation-Model Priors for Distraction Robust Visuomotor Policy / Yuhang Dong, Haizhou Ge, Yupei Zeng 他
日本語で読む → - 論文VLAロボティクス
Hi Robot: 階層型視覚言語行動モデルによるオープンエンドな指示追従
視覚言語モデルを階層的に用い、複雑な指示や実行中のフィードバックを解釈してロボットの低レベル行動に変換するシステムを提案し、片腕・双腕・移動ロボットで評価した。
原題: Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models / Lucy Xiaoyang Shi, Brian Ichter, Michael Equi 他
日本語で読む → - 論文VLA画像認識
V2V-LLM: マルチモーダル大規模言語モデルによる車車間協調自動運転
車車間通信で複数車両の知覚情報をマルチモーダルLLMで統合し、物体特定や計画などの運転タスクに答えるV2V-QAデータセットとベースライン手法を提案した論文。
原題: V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models / Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang 他
日本語で読む → - 論文VLAロボティクス
GSCE: 信頼性の高いLLM駆動ドローン制御のための推論強化プロンプトフレームワーク
LLMによるドローン制御の信頼性を高めるため、ガイドライン・スキルAPI・制約・例から成るプロンプトフレームワークGSCEを提案し、複雑なタスクでの成功率と完全性を改善した。
原題: GSCE: A Prompt Framework with Enhanced Reasoning for Reliable LLM-driven Drone Control / Wenhao Wang, Yanyan Li, Long Jiao 他
日本語で読む →