論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
RoboNurse-VLA: 視覚-言語-行動モデルに基づく手術用器械出しロボットシステム
SAM 2とLlama 2を統合したVLAモデルにより、術者の音声指示に基づいて手術器械を高精度に把持・受け渡しするロボット看護師システムを開発した。
原題: RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model / Shunlei Li, Jin Wang, Rui Dai 他
日本語で読む → - 論文VLAロボティクス
MHRC: 大規模言語モデルによる分散型マルチ異種ロボット協調
大規模言語モデルを活用し、移動ロボット・マニピュレーションロボット・移動マニピュレーションロボットが分散協調して探索・運搬・整理タスクを遂行するフレームワークを提案。
原題: MHRC: Closed-loop Decentralized Multi-Heterogeneous Robot Collaboration with Large Language Models / Wenhao Yu, Jie Peng, Yueliang Ying 他
日本語で読む → - 論文VLAロボティクス
心の理論を用いた人間とロボットの協調における実用的な音声指示追従
雑音や発音の乱れがある音声指示でも、環境の文脈と心の理論に基づく推論でロボットが実用的に従えるニューロシンボリックモデルSIFToMを提案し、シミュレーションと実環境で有効性を示した。
原題: Pragmatic Embodied Spoken Instruction Following in Human-Robot Collaboration with Theory of Mind / Lance Ying, Xinyi Li, Shivam Aarya 他
日本語で読む → - 論文VLAロボティクス
RoboKoop: クープマン作用素を用いたロボティクスにおける視覚入力からの効率的な制御条件付き表現
クープマン理論に基づき、視覚入力からタスク条件付きの線形化表現を学習し、線形制御器と強化学習を組み合わせて効率的なロボット制御を実現する手法を提案。
原題: RoboKoop: Efficient Control Conditioned Representations from Visual Input in Robotics using Koopman Operator / Hemant Kumawat, Biswadeep Chakraborty, Saibal Mukhopadhyay
日本語で読む → - 論文VLAロボティクス
PLATO: LLMとアフォーダンスを活用した道具操作のためのプランニング
環境の事前知識なしに、複数のLLMエージェントが自然言語指示を解釈し、道具のアフォーダンスを予測して長期的な道具使用タスクの行動計画を生成するシステムを提案。
原題: PLATO: Planning with LLMs and Affordances for Tool Manipulation / Arvind Car, Sai Sravan Yarlagadda, Alison Bartsch 他
日本語で読む → - 論文VLAロボティクス
VLM-Vac: VLM知識蒸留と言語誘導経験再生によるスマート掃除機の高度化
視覚言語モデル(VLM)の知識を小型モデルに蒸留し、言語誘導型経験再生で継続学習することで、ロボット掃除機が多様な背景でも物体を回避・吸引できるようにした研究。
原題: VLM-Vac: Enhancing Smart Vacuums through VLM Knowledge Distillation and Language-Guided Experience Replay / Reihaneh Mirjalili, Michael Krawez, Florian Walter 他
日本語で読む → - 論文VLAロボティクス
自律型移動マニピュレーションタスクにおける言語モデルの接地
強化学習と全身最適化で動作ライブラリを構築し、LLMの計画・推論能力で階層的タスクグラフを生成することで、自由文の指示からヒューマノイドロボットの移動と操作を統合的に実行するフレームワークを提案した。
原題: Grounding Language Models in Autonomous Loco-manipulation Tasks / Jin Wang, Nikos Tsagarakis
日本語で読む → - 論文VLAロボティクス
Embodied-RAG: 具現化エージェントのための汎用ノンパラメトリック記憶検索生成
ロボットの探索で得たマルチモーダルな知識を階層的な「意味の森」として記憶し、ナビゲーションや言語生成に活用するRAGフレームワークを提案した。
原題: Embodied-RAG: General Non-parametric Embodied Memory for Retrieval and Generation / Quanting Xie, So Yeon Min, Pengliang Ji 他
日本語で読む → - 論文VLAロボティクス
言語埋め込みガウシアンスプラット(LEGS):移動ロボットによる部屋規模表現の漸進的構築
移動ロボットが環境を移動しながら、見た目と言語意味を統合した3D表現(LEGS)をオンラインで構築し、オープン語彙の物体検索を可能にする手法を提案。LERFより3.5倍高速で、最大66%の精度で物体を特定できる。
原題: Language-Embedded Gaussian Splats (LEGS): Incrementally Building Room-Scale Representations with a Mobile Robot / Justin Yu, Kush Hari, Kishore Srinivas 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによるシーン探索
VLMと能動的知覚を組み合わせ、ロボットマニピュレータが最適な視点を選んで遮蔽物越しの物体認識や意味的クエリに答えるフレームワークAP-VLMを提案。
原題: Scene Exploration by Vision-Language Models / Venkatesh Sripada, Samuel Carter, Frank Guerin 他
日本語で読む → - 論文VLAロボティクス
StratXplore: 視覚言語ナビゲーションのための戦略的な新規性探索と指示整合型探索
視覚言語ナビゲーションにおいて、過去の行動と視点特徴を記憶し、指示に合致する未探索の最適なフロンティアを選んで経路修正を行う手法を提案した。
原題: StratXplore: Strategic Novelty-seeking and Instruction-aligned Exploration for Vision and Language Navigation / Muraleekrishna Gopinathan, Jumana Abu-Khalaf, David Suter 他
日本語で読む → - 論文VLAロボティクス
最適化プロンプトを用いた視覚言語モデルによるロボット故障復旧の自動化
視覚言語モデル(VLM)の視覚・テキストプロンプトを最適化し、空間推論能力を高めることで、未知の故障に対する動作レベルとタスクレベルの復旧を自動化する手法を提案した。
原題: Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts / Hongyi Chen, Yunchao Yao, Ruixuan Liu 他
日本語で読む → - 論文VLAロボティクス
ASMA: シーン認識型制御バリア関数による視覚言語ドローン航法のための適応的安全マージンアルゴリズム
RGB-Dカメラと視覚言語モデルを用いたドローン航法において、シーン認識型制御バリア関数と適応的安全マージンをMPCに組み込み、動的障害物を回避しながら安全に飛行する手法を提案した。
原題: ASMA: An Adaptive Safety Margin Algorithm for Vision-Language Drone Navigation via Scene-Aware Control Barrier Functions / Sourav Sanyal, Kaushik Roy
日本語で読む → - 論文VLAロボティクス
RT-1-X基盤モデルをSCARAロボットに適用する
ロボット基盤モデルRT-1-Xを訓練時に見ていないSCARAロボットに適用し、ゼロショットでは汎化しないが、デモによるファインチューニングでスキルのみが転移することを示した。
原題: Bringing the RT-1-X Foundation Model to a SCARA robot / Jonathan Salzer, Arnoud Visser
日本語で読む → - 論文VLAロボティクス
R-AIF: 能動的推論と世界モデルによる疎報酬ロボットタスクの画素からの解決
部分観測マルコフ決定過程(POMDP)下で、画素入力と疎な報酬から連続行動を学習する能動的推論エージェントを提案し、事前選好学習と自己修正スケジュールで性能を向上させた。
原題: R-AIF: Solving Sparse-Reward Robotic Tasks from Pixels with Active Inference and World Models / Viet Dung Nguyen, Zhizhuo Yang, Christopher L. Buckley 他
日本語で読む → - 論文VLAロボティクス
P-RAG: 具現化された日常タスクの計画のための漸進的検索拡張生成
大規模言語モデルを用いた日常タスク計画において、正解データなしでタスク固有の知識を反復的に蓄積する漸進的検索拡張生成手法を提案し、類似タスクと類似状況のきめ細かい検索で性能を向上させた。
原題: P-RAG: Progressive Retrieval Augmented Generation For Planning on Embodied Everyday Task / Weiye Xu, Min Wang, Wengang Zhou 他
日本語で読む → - 論文VLA画像認識
ReVLA: ロボット基盤モデルの視覚的ドメイン制限を回復する
既存のロボット基盤モデルが視覚的なドメイン外シーンに弱い問題を分析し、モデルマージによる段階的バックボーン復元で視覚汎化性能を回復させる手法を提案した。
原題: ReVLA: Reverting Visual Domain Limitation of Robotic Foundation Models / Sombit Dey, Jan-Nico Zaech, Nikolay Nikolov 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる間取り図マップの解析
視覚言語モデル(VLM)に間取り図を与え、複雑な屋内ナビゲーションのタスク計画を生成させることで、地図解析能力を評価した研究。
原題: Vision Language Models Can Parse Floor Plan Maps / David DeFazio, Hrudayangam Mehta, Meng Wang 他
日本語で読む → - 論文VLAロボティクス
Robotic-CLIP: ロボット応用のための行動データによるCLIPの微調整
大規模な行動動画データでCLIPを対照学習により微調整し、動的な行動理解を可能にしたRobotic-CLIPを提案。言語駆動型ロボットタスクで既存CLIPモデルを上回り、実世界の把持タスクでも有効性を示した。
原題: Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications / Nghia Nguyen, Minh Nhat Vu, Tung D. Ta 他
日本語で読む → - 論文VLAcs.SE
VLATest: ロボットマニピュレーションのための視覚-言語-行動モデルのテストと評価
VLAモデルを多様なシーンでテストするファジングフレームワークVLATestを提案し、7つの代表モデルの堅牢性を評価した。
原題: VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation / Zhijie Wang, Zhehua Zhou, Jiayang Song 他
日本語で読む → - 論文VLAロボティクス
LLMの身体的・社会的グラウンディングへのロードマップ
LLMとロボットの融合において、言語の意味理解に必要な身体的・時間的・社会的要素を整理し、グラウンディングへの道筋を示したロードマップ論文。
原題: A Roadmap for Embodied and Social Grounding in LLMs / Sara Incao, Carlo Mazzola, Giulia Belgiovine 他
日本語で読む → - 論文VLAロボティクス
Open-Nav: オープンソースLLMによる連続環境でのゼロショット視覚言語ナビゲーションの探求
オープンソースLLMを使い、連続環境でのゼロショット視覚言語ナビゲーションを実現するOpen-Navを提案。時空間Chain-of-Thought推論と詳細な物体・空間知識でシーン認識を強化し、閉源LLMに匹敵する性能を示した。
原題: Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs / Yanyuan Qiao, Wenqi Lyu, Hui Wang 他
日本語で読む → - 論文VLAロボティクス
拡散方策の政策最適化
拡散モデルベースの方策を強化学習の政策勾配法でファインチューニングするDPPOを提案し、ロボット操作タスクで高い性能と安定性を示した。
原題: Diffusion Policy Policy Optimization / Allen Z. Ren, Justin Lidard, Lars L. Ankile 他
日本語で読む → - 論文VLAAI
ゲーム開始:言語モデルを強化学習の実験者として活用する
VLMを用いて強化学習の実験サイクルを自動化し、タスク提案・スキル分解・カリキュラム構築を行うエージェントアーキテクチャを提案した。
原題: Game On: Towards Language Models as RL Experimenters / Jingwei Zhang, Thomas Lampe, Abbas Abdolmaleki 他
日本語で読む → - 論文VLAAI
Cog-GA: 大規模言語モデルによる連続環境での視覚言語ナビゲーション生成エージェント
大規模言語モデルを基盤に、認知マップ構築・ウェイポイント予測・二チャネル場面記述・反省機構を組み合わせ、連続3D環境での視覚言語ナビゲーションを人間らしく効率的に行う生成エージェントを提案した。
原題: Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments / Zhiyuan Li, Yanfeng Lu, Yao Mu 他
日本語で読む → - 論文VLAロボティクス
TinyVLA: ロボットマニピュレーションのための高速・データ効率的な視覚言語行動モデル
大規模事前学習不要で高速推論が可能なコンパクトな視覚言語行動モデルTinyVLAを提案し、シミュレーションと実機でOpenVLAを上回る速度とデータ効率を実現した。
原題: TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation / Junjie Wen, Yichen Zhu, Jinming Li 他
日本語で読む → - 論文VLAロボティクス
FLaRe: 大規模強化学習ファインチューニングによる熟達した適応型ロボットポリシー
事前学習済みロボットポリシーを大規模強化学習でファインチューニングし、未見環境での長期的移動操作タスクの成功率を大幅に向上させ、新しい身体や行動への迅速な適応を実現した。
原題: FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning / Jiaheng Hu, Rose Hendrix, Ali Farhadi 他
日本語で読む → - 論文VLAロボティクス
GRACE: LLMと人間の説明を活用した社会的に適切なロボット行動の生成
LLMの常識知識と人間の説明を双方向の生成ネットワークで統合し、社会的規範と個人の好みに沿ったロボット行動を生成・説明する手法を提案。
原題: GRACE: Generating Socially Appropriate Robot Actions Leveraging LLMs and Human Explanations / Fethiye Irmak Dogan, Umut Ozyurt, Gizem Cinar 他
日本語で読む → - 論文VLAロボティクス
人間の生動画からロボットスキルを学ぶ:対比・模倣・適応
人間の生動画を対比してタスク事前知識を、軌道模倣で行動事前知識を学習し、新しい状況に適応する3段階のロボットスキル学習フレームワークCIAを提案。
原題: Contrast, Imitate, Adapt: Learning Robotic Skills From Raw Human Videos / Zhifeng Qian, Mingyu You, Hongjun Zhou 他
日本語で読む → - 論文VLAロボティクス
Astra: 身体性指示追従のための効率的Transformerアーキテクチャと対照的ダイナミクス学習
異なるモダリティのセグメントからなる軌跡を効率的に処理する新しいTransformerと、環境ダイナミクス理解を深める対照的学習目的を提案し、ロボット操作ベンチマークで性能を大幅に向上させた。
原題: Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following / Yueen Ma, Dafeng Chi, Shiguang Wu 他
日本語で読む →