論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
論理制約付きロボティクストランスフォーマーによる知覚・行動計画の強化
信号時相論理の仕様を自己回帰型トランスフォーマーの軌道計画に組み込み、仕様充足率をベースラインより74.3%向上させた。あわせて基盤モデルの事前学習・評価用軌道データセットも提供する。
原題: Logically Constrained Robotics Transformers for Enhanced Perception-Action Planning / Parv Kapoor, Sai Vemprala, Ashish Kapoor
日本語で読む → - 論文VLAAI
視覚言語モデルを用いたマルチエージェント計画
環境の単一画像から自由形式のドメインで身体性タスク計画を行うマルチエージェント構成を提案し、計画品質を評価する新手法PG2Sを導入した。
原題: Multi-Agent Planning Using Visual Language Models / Michele Brienza, Francesco Argenziano, Vincenzo Suriani 他
日本語で読む → - 論文VLAロボティクス
UNMuTe: ナビゲーションとマルチモーダル対話テキスト生成の統合
GPT-2ベースの対話モデルと視覚言語ナビゲータを組み合わせ、迷ったときに自然言語で道を尋ねながら目的地へ進むエージェントを実現した研究。
原題: UNMuTe: Unifying Navigation and Multimodal Dialogue-like Text Generation / Niyati Rawal, Roberto Bigazzi, Lorenzo Baraldi 他
日本語で読む → - 論文VLAcs.IR
イベント知識グラフによる粗粒度視覚言語ナビゲーションのタスク計画強化
粗粒度の指示で視覚言語ナビゲーションを行うため、イベント知識グラフVLN-EventKGを構築し、知識強化型ナビゲーション計画EventNavと動的履歴バックトラックを提案した。
原題: Towards Coarse-grained Visual Language Navigation Task Planning Enhanced by Event Knowledge Graph / Zhao Kaichen, Song Yaoxian, Zhao Haiquan 他
日本語で読む → - 論文VLAロボティクス
V2X-VLM:大規模視覚言語モデルによるエンドツーエンドV2X協調自動運転
車両とインフラのカメラ映像とテキスト記述を視覚言語モデルで統合し、対照学習と知識蒸留を用いて協調自動運転の軌道計画精度を向上させた。
原題: V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models / Junwei You, Haotian Shi, Zhuoyu Jiang 他
日本語で読む → - 論文VLAロボティクス
双方向意図コミュニケーション:大規模基盤モデルの役割
音声や視線などのマルチモーダル入力を用いて、言葉とジェスチャーの両方で人間と双方向にやり取りできるユーザー中心のロボットフレームワーク「Bident」を提案した論文。
原題: Bidirectional Intent Communication: A Role for Large Foundation Models / Tim Schreiter, Rishi Hazra, Jens Rüppel 他
日本語で読む → - 論文VLA画像認識
FLAME: 都市環境におけるマルチモーダルLLMによるナビゲーション学習
都市の視覚言語ナビゲーション向けに、3段階のチューニングでマルチモーダルLLMを適応させるエージェントFLAMEを提案し、Touchdownデータセットでタスク完了率を7.3%向上させた。
原題: FLAME: Learning to Navigate with Multimodal LLM in Urban Environments / Yunzhe Xu, Yiyuan Pan, Zhe Liu 他
日本語で読む → - 論文VLAロボティクス
双方向デコーディング:ガイド付きテスト時サンプリングによるアクションチャンキングの改善
アクションチャンキングの長所と短所を分析し、テスト時に複数候補から後方一貫性と前方コントラストで最適行動を選ぶBIDを提案、シミュレーションと実機で性能を向上させた。
原題: Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling / Yuejiang Liu, Jubayer Ibn Hamid, Annie Xie 他
日本語で読む → - 論文VLA画像認識
Surgical-VQLA++: ロボット手術における校正済みロバスト視覚質問局所回答のための敵対的対照学習
手術画像に対する質問応答で、回答とともに関連領域を局所化するVQLAタスクを提案し、マルチモーダル情報を統合する校正済み共注意ゲート付き視覚言語埋め込みと敵対的対照学習で性能とロバスト性を向上させた。
原題: Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery / Long Bai, Guankun Wang, Mobarakol Islam 他
日本語で読む → - 論文VLAロボティクス
NeuroVE: スパイキングニューラルネットワークによる脳に着想を得た線形・角速度推定
イベントカメラとスパイキングニューラルネットワーク(SNN)を組み合わせ、脳の空間細胞の機能を模倣してロボットの自己速度を高精度に推定するフレームワークを提案。
原題: NeuroVE: Brain-inspired Linear-Angular Velocity Estimation with Spiking Neural Networks / Xiao Li, Xieyuanli Chen, Ruibin Guo 他
日本語で読む → - 論文VLAロボティクス
MAPPO-PIS: 事前意図共有を用いたマルチエージェント近接方策最適化によるコネクテッド自動運転車の協調意思決定
V2V通信下の自動運転車の協調意思決定に、将来の意図軌跡を生成・共有する意図生成モジュールと安全性強化モジュールを組み込んだMARL手法を提案し、人車混在の合流領域で安全性・効率を改善した。
原題: MAPPO-PIS: A Multi-Agent Proximal Policy Optimization Method with Prior Intent Sharing for CAVs' Cooperative Decision-Making / Yicheng Guo, Jiaqi Liu, Rongjie Yu 他
日本語で読む → - 論文VLAロボティクス
D-RMGPT: 大規模マルチモーダルモデルによるロボット支援協調作業
GPT-4VとGPT-4を組み合わせ、マーカーや訓練なしに組立作業を認識し、ロボットが次に渡す部品を計画・提供する協調作業支援システムを提案。
原題: D-RMGPT: Robot-assisted collaborative tasks driven by large multimodal models / M. Forlini, M. Babcinschi, G. Palmieri 他
日本語で読む → - 論文VLAロボティクス
Space-LLaVA:地球外環境に適応した視覚言語モデル
火星などの地球外データベースに言語注釈を付与してLLaVAを微調整し、未知のタスクでゼロショット性能を向上させた視覚言語モデル。
原題: Space-LLaVA: a Vision-Language Model Adapted to Extraterrestrial Applications / Matthew Foutter, Daniele Gammelli, Justin Kruger 他
日本語で読む → - 論文VLAロボティクス
検索拡張型階層的文脈内強化学習と後知恵モジュール反省によるLLMタスクプランニング
LLMで複雑なタスクをサブタスクに分解し、検索拡張と後知恵モジュール反省で効率的に計画するフレームワークを提案し、ベンチマークとSPOTロボットで有効性を示した。
原題: Retrieval-Augmented Hierarchical in-Context Reinforcement Learning and Hindsight Modular Reflections for Task Planning with LLMs / Chuanneng Sun, Songjun Huang, Dario Pompili
日本語で読む → - 論文自動運転/VLAロボティクス
VLM-MPC: 視覚言語基盤モデルによるモデル予測制御を用いた自動運転
視覚言語モデル(VLM)が生成した運転パラメータをモデル予測制御(MPC)に渡して車両を制御する非同期型の自動運転システムを提案し、nuScenesデータセットで安全性と滑らかさの向上を検証した。
原題: VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving / Keke Long, Haotian Shi, Jiaxi Liu 他
日本語で読む → - 論文VLA画像認識
NanoMVG: プロンプト誘導カメラと4Dミリ波レーダーによるUSV中心の低消費電力マルチタスク視覚グラウンディング
水上自律走行体(USV)向けに、カメラと4Dミリ波レーダーを自然言語で誘導し、物体の位置を特定する低消費電力マルチタスク視覚グラウンディングモデルNanoMVGを提案。WaterVGデータセットで競争力のある性能を示し、厳しい環境でも長時間運用可能。
原題: NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar / Runwei Guan, Jianan Liu, Liye Jia 他
日本語で読む → - 論文VLAロボティクス
接地言語モデルによるヒューマノイドの移動操作のための自律行動計画
大規模言語モデルを活用し、テキスト指示からヒューマノイドロボットの移動操作行動を自律的に計画・実行し、失敗を検知して修正するフレームワークを提案した。
原題: Autonomous Behavior Planning For Humanoid Loco-manipulation Through Grounded Language Model / Jin Wang, Arturo Laurenzi, Nikos Tsagarakis
日本語で読む → - 論文VLAロボティクス
Body Transformer:ロボット身体性を活用した方策学習
ロボットの身体をセンサとアクチュエータのグラフとして表現し、マスク付きアテンションで情報を集約するBoTを提案。模倣学習・強化学習の方策において、通常のTransformerやMLPより高性能・高効率であることを示した。
原題: Body Transformer: Leveraging Robot Embodiment for Policy Learning / Carmelo Sferrazza, Dun-Ming Huang, Fangchen Liu 他
日本語で読む → - 論文VLAロボティクス
AeroVerse:航空宇宙エンボディド世界モデルのためのUAVエージェントベンチマークスイート
UAV向けの大規模実世界画像テキストデータセットと仮想データセットを構築し、5つの下流タスクの指示データセットとGPT-4ベースの評価指標を開発した。
原題: AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models / Fanglong Yao, Yuanchang Yue, Youzhi Liu 他
日本語で読む → - 論文VLA画像認識
Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
原題: Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders / Min Shi, Fuxiao Liu, Shihao Wang 他
日本語で読む → - 論文VLA画像認識
反復的視覚プロンプティングによるオープンボキャブラリ動作ローカリゼーション
学習不要で任意の動作を扱えるよう、視覚言語モデルにフレーム番号付きの連結画像を与え、サンプリング範囲を反復的に絞り込むことで動画中の動作区間を高精度に特定する手法を提案。
原題: Open-Vocabulary Action Localization with Iterative Visual Prompting / Naoki Wake, Atsushi Kanehira, Kazuhiro Sasabuchi 他
日本語で読む → - 論文VLAロボティクス
異なる身体を超えて学ぶ:操作・ナビゲーション・歩行・飛行を1つのポリシーで
20種類のロボットの90万軌道をTransformerで学習し、単一のポリシーでマニピュレーションから歩行・飛行まで制御できるCrossFormerを提案した。
原題: Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation / Ria Doshi, Homer Walke, Oier Mees 他
日本語で読む → - 論文VLA機械学習
テキスト認識拡散モデルによる方策学習
事前学習済みのテキスト条件付き拡散モデルを報酬源として使い、自然言語で指定した目標や動作を強化学習でゼロショット学習する手法を提案。
原題: Text-Aware Diffusion for Policy Learning / Calvin Luo, Mandy He, Zilai Zeng 他
日本語で読む → - 論文VLAロボティクス
スパース拡散方策:ロボット学習のためのスパースで再利用可能かつ柔軟な方策
Transformerベースの拡散方策にMixture of Expertsを組み込み、タスクごとに専門家を選択的に活性化することで、マルチタスク学習や継続学習を効率化する手法を提案した。
原題: Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning / Yixiao Wang, Yifei Zhang, Mingxiao Huo 他
日本語で読む → - 論文VLAロボティクス
WOMD-Reasoning: 運転シーンにおけるインタラクション推論のための大規模データセット
実世界の運転シーンにおける交通ルールに基づくインタラクションを記述・推論する300万件のQ&Aデータセットを構築し、それを用いた運転動作言語モデルMotion-LLaVAを提案した。
原題: WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving / Yiheng Li, Cunxin Fan, Chongjian Ge 他
日本語で読む → - 論文VLA画像認識
強化学習による視覚オドメトリの適応的制御
視覚オドメトリ(VO)を逐次意思決定問題として捉え、強化学習でキーフレーム選択やグリッドサイズを動的に調整することで、人手によるパラメータ調整を不要にし精度と頑健性を向上させた研究。
原題: Reinforcement Learning Meets Visual Odometry / Nico Messikommer, Giovanni Cioffi, Mathias Gehrig 他
日本語で読む → - 論文VLA画像認識
シーングラフを用いた交通事故事象理解のための視覚言語モデル強化
交通事故の種類を分類するため、映像をシーングラフに変換し、視覚・言語情報と融合するマルチモーダル手法を提案。DoTAベンチマークでシーングラフなしより約5ポイント高い精度を達成した。
原題: Enhancing Vision-Language Models with Scene Graphs for Traffic Accident Understanding / Aaron Lohner, Francesco Compagno, Jonathan Francis 他
日本語で読む →