論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
視覚と言語によるナビゲーションエージェントを環境攻撃で乗っ取る
視覚と言語によるナビゲーション(VLN)エージェントに対し、環境中の3Dオブジェクトの見た目を最適化するホワイトボックス敵対的攻撃を開発し、指示を無視させたり経路を逸脱させたりできることを示した。
原題: Hijacking Vision-and-Language Navigation Agents with Adversarial Environmental Attacks / Zijiao Yang, Xiangxi Shi, Eric Slyman 他
日本語で読む → - 論文VLAロボティクス
GPS不測地域における6自由度視覚慣性ナビゲーションのためのクォータニオンベースアンセンテッドカルマンフィルタ
GPSが使えない環境でドローンの6自由度位置・姿勢・速度を推定するため、クォータニオンを用いた計算効率の良いアンセンテッドカルマンフィルタを提案し、実データで有効性を検証した。
原題: Quaternion-based Unscented Kalman Filter for 6-DoF Vision-based Inertial Navigation in GPS-denied Regions / Khashayar Ghanizadegan, Hashim A. Hashim
日本語で読む → - 論文VLA画像認識
AutoTrust: 自動運転向け大規模視覚言語モデルの信頼性ベンチマーク
自動運転向け視覚言語モデルの信頼性を、信憑性・安全性・堅牢性・プライバシー・公平性の観点から評価するベンチマークを構築し、6つのモデルを比較評価した。
原題: AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving / Shuo Xing, Hongyuan Hua, Xiangbo Gao 他
日本語で読む → - 論文VLA画像認識
NoisyEQA: ノイズを含む質問に対する身体性質問応答のベンチマーク
実世界で発生する4種類のノイズを含む質問に対して、身体性質問応答エージェントのノイズ検出・訂正能力を評価するベンチマークNoisyEQAを提案し、自己訂正プロンプト機構と新評価指標を導入した。
原題: NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries / Tao Wu, Chuhao Zhou, Yen Heng Wong 他
日本語で読む → - 論文VLAロボティクス
マルチカメラ・マルチマップ視覚慣性自己位置推定:システム、検証、データセット
因果的なリアルタイム自己位置推定を実現するマルチカメラ・マルチマップ視覚慣性システムを提案し、評価指標と長期キャンパスデータセットを構築して有効性を示した。
原題: Multi-cam Multi-map Visual Inertial Localization: System, Validation and Dataset / Yufei Wei, Fuzhang Han, Yanmei Jiao 他
日本語で読む → - 論文VLAロボティクス
最小限のフィードバックでアラインメントを最大化:視覚運動ロボット政策のアラインメントのための効率的な報酬学習
視覚運動ロボット政策を人間の選好に合わせるため、事前学習済み視覚エンコーダを微調整し特徴マッチングで密な視覚報酬を構築するRAPLを提案。従来のRLHFより5倍少ない人間フィードバックでアラインメントを実現。
原題: Maximizing Alignment with Minimal Feedback: Efficiently Learning Rewards for Visuomotor Robot Policy Alignment / Ran Tian, Yilin Wu, Chenfeng Xu 他
日本語で読む → - 論文VLAロボティクス
自動運転の協調走行を支えるROS2-DDSミドルウェア実装の性能評価
自動運転車の協調知覚で多数のROS2ノードを扱う際のDDSドメイン制約に着目し、ベンダー別DDS実装の通信性能を評価した論文。
原題: Performance Evaluation of ROS2-DDS middleware implementations facilitating Cooperative Driving in Autonomous Vehicle / Sumit Paul, Danh Lephuoc, Manfred Hauswirth
日本語で読む → - 論文VLAロボティクス
GraphEQA: 3Dセマンティックシーングラフを用いたリアルタイム身体性質問応答
未知環境での身体性質問応答のため、リアルタイム3Dメトリックセマンティックシーングラフとタスク関連画像をマルチモーダルメモリとしてVLMに接地し、階層的計画で探索・回答する手法を提案。シミュレーションと実環境で成功率向上と計画ステップ削減を示した。
原題: GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering / Saumya Saxena, Blake Buchanan, Chris Paxton 他
日本語で読む → - 論文VLA画像認識
CAD-Assistant:ツール拡張VLLMによる汎用CADタスクソルバ
VLLMをプランナーとし、FreeCADのPython APIやスケッチ画像パラメータ化などのツールを組み合わせて、多様なCAD設計タスクを解く汎用エージェントを提案。
原題: CAD-Assistant: Tool-Augmented VLLMs as Generic CAD Task Solvers / Dimitrios Mallis, Ahmet Serdar Karadeniz, Sebastian Cavada 他
日本語で読む → - 論文VLAロボティクス
CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
原題: CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction / Zhefei Gong, Pengxiang Ding, Shangke Lyu 他
日本語で読む → - 論文VLAロボティクス
連合学習を用いたUAVの近接制御:人とロボットの協調領域に向けて
複数ドローンにLSTMと連合学習を組み込み、分散学習で人間の動作を認識・制御し、遮蔽を防ぎつつ96%以上の精度を実現した。
原題: Proximal Control of UAVs with Federated Learning for Human-Robot Collaborative Domains / Lucas Nogueira Nobrega, Ewerton de Oliveira, Martin Saska 他
日本語で読む → - 論文VLAAI
LLMから実機エージェントへの身体性Chain-of-Thought蒸留
大規模言語モデルの身体性推論能力を階層的に分解し、小型言語モデルベースの方策へ蒸留することで、容量制限のある実機デバイス上で効率的に複雑な身体性タスクを実行できるフレームワークDeDerを提案した。
原題: Embodied CoT Distillation From LLM To Off-the-shelf Agents / Wonje Choi, Woo Kyung Kim, Minjong Yoo 他
日本語で読む → - 論文VLAロボティクス
言語生成デモンストレーションによる新規スキルの学習
視覚言語モデルと動画拡散モデルを組み合わせて自然言語指示から新規スキルのデモ動画を生成し、ロボットが効率的に新しいスキルを学習できるフレームワークDemoGenを提案した。
原題: Learning Novel Skills from Language-Generated Demonstrations / Ao-Qun Jin, Tian-Yu Xiang, Xiao-Hu Zhou 他
日本語で読む → - 論文VLAAI
GROOT-2: 弱教師ありマルチモーダル指示追従エージェント
ラベルなしデモで多様な行動を学びつつ、少数のラベル付きデモで人間の意図に合わせる半教師あり学習手法を提案し、マルチモーダル指示追従性能を向上させた。
原題: GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents / Shaofei Cai, Bowei Zhang, Zihao Wang 他
日本語で読む → - 論文VLAAI
TANGO: オープンワールドタスクのための訓練不要な身体性AIエージェント
LLMに少数の例を与えて基本動作を組み合わせさせることで、追加学習なしに物体探索・生涯ナビゲーション・質問応答などの身体性AIタスクをゼロショットで解く手法を提案。
原題: TANGO: Training-free Embodied AI Agents for Open-world Tasks / Filippo Ziliotto, Tommaso Campari, Luciano Serafini 他
日本語で読む → - 論文VLA画像認識
SAT: マルチモーダル言語モデルのための動的空間適性トレーニング
3Dシミュレータを用いて静的・動的な空間推論を含む17.5万件のQAペアと2万シーンからなるデータセットSATを構築し、マルチモーダル言語モデルの空間認識能力を訓練する手法を提案した。
原題: SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models / Arijit Ray, Jiafei Duan, Ellis Brown 他
日本語で読む → - 論文VLAロボティクス
TraceVLA:視覚トレースプロンプトで汎用ロボットポリシーの時空間認識を強化
状態行動軌跡を視覚的にエンコードする視覚トレースプロンプトを導入し、VLAモデルの時空間認識を改善。15万件の操作軌跡でOpenVLAを微調整したTraceVLAは、シミュレーションと実機で大幅な性能向上を達成。
原題: TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies / Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang 他
日本語で読む → - 論文自動運転VLAロボティクス
PKRD-CoT: 自動運転向けマルチモーダル大規模言語モデルのための統合チェーン・オブ・ソート・プロンプティング
自動運転の知覚・知識・推論・意思決定の4能力に基づくゼロショットCoTプロンプト設計PKRD-CoTを提案し、GPT-4.0などMLLMの運転タスク性能を評価した研究。
原題: PKRD-CoT: A Unified Chain-of-thought Prompting for Multi-Modal Large Language Models in Autonomous Driving / Xuewen Luo, Fan Ding, Yinsheng Song 他
日本語で読む → - 論文VLA画像認識
SOLAMI:3D自律キャラクターとの没入型インタラクションのための社会的視覚-言語-行動モデリング
3Dキャラクターが人間と社会的に交流できるよう、視覚・言語・行動を統合した初のエンドツーエンドVLAフレームワークを提案し、合成データセットとVRインターフェースを開発した。
原題: SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters / Jianping Jiang, Weiye Xiao, Zhengyu Lin 他
日本語で読む → - 論文VLAAI
車載ビジョン言語モデルによる個人適応型自動運転の運動制御:システム設計と実車検証
車載向けの軽量VLMとRAGベースの記憶モジュールを組み合わせ、人間のフィードバックから個人の運転嗜好を継続学習して低遅延で個別化された運転を実現し、実車実験でテイクオーバー率を最大76.9%削減した。
原題: On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation / Can Cui, Zichong Yang, Yupeng Zhou 他
日本語で読む → - 論文VLAロボティクス
トランスフォーマーは本当にロボティクスの基盤なのか?
GPTベースのロボティクスは計算コストや訓練時間、オフボード制御などの制約が大きく、昆虫の脳の自律性と対比して生物から学ぶべき点を論じた論文。
原題: Are Transformers Truly Foundational for Robotics? / James A. R. Marshall, Andrew B. Barron
日本語で読む → - 論文VLAロボティクス
言語駆動ロボティクスの堅牢性向上:失敗低減のためのモジュラーアーキテクチャ
小型LLMを用いたロボットのタスク計画において、目標条件付きPOMDPで失敗モードを整理し、「期待される結果」モジュールとフィードバック機構を組み合わせたモジュラー構成で成功率を改善した研究。
原題: Enhancing Robustness in Language-Driven Robotics: A Modular Approach to Failure Reduction / Émiland Garrabé, Pierre Teixeira, Mahdi Khoramshahi 他
日本語で読む → - 論文VLAロボティクス
ロボット学習タスクにおける視覚・言語・行動モデルのベンチマーク評価
GPT-4oやOpenVLAなど3つのVLAモデルを20種類の操作タスクで評価し、性能のばらつきや多段階計画の難しさを明らかにした。
原題: Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks / Pranav Guruprasad, Harshvardhan Sikka, Jaewoo Song 他
日本語で読む → - 論文VLAロボティクス
すべてを統べる一つ:自然言語によるコミュニケーション・知覚・行動の統合
大規模言語モデル(LLM)と改良ReActフレームワークを組み合わせ、自然言語指示を動的な環境でロボットの実行可能な行動に変換するアーキテクチャを提案した。
原題: One to rule them all: natural language to bind communication, perception and action / Simone Colombani, Dimitri Ognibene, Giuseppe Boccignone
日本語で読む → - 論文VLAロボティクス
ロボティクスにおける視覚言語行動モデルの敵対的脆弱性の探究
VLAモデルに対する敵対的パッチ攻撃を提案し、シミュレーションと実環境で最大100%のタスク成功率低下を引き起こすことを示した。
原題: Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics / Taowen Wang, Cheng Han, James Chenhao Liang 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルは文脈内価値学習器である
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
原題: Vision Language Models are In-Context Value Learners / Yecheng Jason Ma, Joey Hejna, Ayzaan Wahid 他
日本語で読む → - 論文VLAロボティクス
基盤モデルを用いたグローバルタスク計画とローカル行動拡張のための遠隔生活支援ロボットインターフェースシステム
言語指示にテンプレート変数を用いて不確実な情報を伝え、基盤モデルでロボットの行動を計画・拡張する遠隔生活支援システムを提案し、実タスクで有効性を示した。
原題: Remote Life Support Robot Interface System for Global Task Planning and Local Action Expansion Using Foundation Models / Yoshiki Obinata, Haoyu Jia, Kento Kawaharazuka 他
日本語で読む → - 論文VLAAI
初心者から熟練者へ:ステップ単位強化学習によるLLMエージェントの政策最適化
専門家とエージェントの行動を比較して中間報酬を自動生成し、ステップ単位の強化学習でLLMエージェントを効率的に訓練する手法StepAgentを提案。
原題: From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning / Zhirui Deng, Zhicheng Dou, Yutao Zhu 他
日本語で読む → - 論文VLAロボティクス
ゼロショット物体中心指示追従:基盤モデルと従来型ナビゲーションの統合
因子グラフ地図上で自然言語指示をゼロショットで接地するLIFGIFを提案し、物体中心VLNデータセットOC-VLNで評価、Spotロボットでの実世界実証も行った。
原題: Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation / Sonia Raychaudhuri, Duy Ta, Katrina Ashton 他
日本語で読む → - 論文VLA画像認識
g3D-LF: 具現化タスクのための汎化可能な3D言語特徴フィールド
大規模3D言語データセットで事前学習した3D表現モデルで、RGB-D画像から新規視点表現やBEVマップを生成し、多粒度言語でターゲットをクエリできる。未見環境への汎化とリアルタイム更新を実現し、VLNや物体ナビゲーション、状況付きQAで有効性を示した。
原題: g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks / Zihan Wang, Gim Hee Lee
日本語で読む →