論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
拡散トランスフォーマーポリシー
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
原題: Diffusion Transformer Policy / Zhi Hou, Tianyi Zhang, Yuwen Xiong 他
日本語で読む → - 論文VLAAI
オープンエンド対話からの目標推論
LLMとの対話から自然言語で目標を抽出し、ベイズ推論で不確実性を扱いながら多様なユーザー目標をオンラインで学習・達成する手法を提案。
原題: Goal Inference from Open-Ended Dialog / Rachel Ma, Jingyi Qu, Andreea Bobu 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット基盤モデルを価値誘導で操る:V-GPS
オフライン強化学習で学習した価値関数を用いて汎用ロボット方策の行動を再ランク付けし、微調整なしで性能を向上させる手法を提案。
原題: Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance / Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar 他
日本語で読む → - 論文VLAロボティクス
ROSA: 自然言語でロボットを操作するROSエージェント
大規模言語モデルを活用し、自然言語による指示をROSのコマンドに変換してロボット操作を可能にするAIエージェントROSAを提案。ROS1/ROS2対応で安全性機構も備える。
原題: Enabling Novel Mission Operations and Interactions with ROSA: The Robot Operating System Agent / Rob Royce, Marcel Kaufmann, Jonathan Becktor 他
日本語で読む → - 論文VLAAI
安全制約付き計画のための言語モデルの検証と改良の統合手法
言語モデルが生成するロボットプログラムをオートマトン表現に変換して安全仕様を検証し、その結果を活用した微調整で安全なプログラム生成を効率化する手法を提案。
原題: Joint Verification and Refinement of Language Models for Safety-Constrained Planning / Yunhao Yang, Neel P. Bhatt, William Ward 他
日本語で読む → - 論文VLA機械学習
制御指向の視覚潜在表現クラスタリング
模倣学習における視覚表現空間が制御に有用なクラスタ構造を持つことを示し、それを正則化に用いることで性能を向上させた研究。
原題: Control-oriented Clustering of Visual Latent Representation / Han Qi, Haocheng Yin, Heng Yang
日本語で読む → - 論文VLA自然言語
身体性会話AIのためのユーザーエージェントシミュレーション
大規模言語モデルを用いて、仮想環境内でロボットと対話するユーザーエージェントを構築し、TEAChデータセットと比較して人間らしい対話行動を生成できるか評価した。
原題: Simulating User Agents for Embodied Conversational-AI / Daniel Philipov, Vardhan Dongre, Gokhan Tur 他
日本語で読む → - 論文VLAロボティクス
EfficientEQA:オープン語彙な身体性質問応答への効率的アプローチ
ロボットが効率的に探索しながら自由形式で質問に答えるためのフレームワークを提案し、意味重視の探索と適応的停止、RAGによる回答生成で精度向上と探索ステップ削減を実現した。
原題: EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering / Kai Cheng, Zhengyuan Li, Xingpeng Sun 他
日本語で読む → - 論文VLAロボティクス
階層的表現による生涯ロボット経験のエピソード記憶言語化
ロボットの長期的な経験を木構造のエピソード記憶として表現し、大規模言語モデルをエージェントとして対話的に検索・要約することで、質問応答や経験の言語化を実現した研究。
原題: Episodic Memory Verbalization using Hierarchical Representations of Life-Long Robot Experience / Leonard Bärmann, Chad DeChant, Joana Plewnia 他
日本語で読む → - 論文VLAロボティクス
AlignBot: ユーザーのリマインダーに沿ったVLM駆動型家庭用ロボットのカスタマイズタスクプランニング
家庭用ロボット向けに、微調整したLLaVA-7BをGPT-4oのアダプタとして用い、ユーザーのリマインダーを構造化指示に変換してカスタマイズされたタスク計画を生成するフレームワークを提案し、実環境実験で成功率86.8%を達成した。
原題: AlignBot: Aligning VLM-powered Customized Task Planning with User Reminders Through Fine-Tuning for Household Robots / Zhaxizhuoma Zhaxizhuoma, Pengan Chen, Ziniu Wu 他
日本語で読む → - 論文衣類操作/VLAロボティクス
SKT: 状態認識キーポイント軌道と視覚言語モデルを統合したロボット衣類操作
視覚言語モデル(VLM)を用いて、多様な衣類の状態を単一モデルで認識しキーポイントを予測することで、ロボットによる衣類操作を汎用的に実現する手法を提案した。大規模合成データで学習し、キーポイント検出精度とタスク成功率を向上させた。
原題: SKT: Integrating State-Aware Keypoint Trajectories with Vision-Language Models for Robotic Garment Manipulation / Xin Li, Siyuan Huang, Qiaojun Yu 他
日本語で読む → - 論文VLA画像認識
3Dシーンにおけるマルチモーダル状況推論
3Dシーン内の状況理解のための大規模マルチモーダル質問応答データセットMSQAとナビゲーション評価ベンチマークMSNNを提案し、既存モデルの限界とマルチモーダル入力の重要性を示した。
原題: Multi-modal Situated Reasoning in 3D Scenes / Xiongkun Linghu, Jiangyong Huang, Xuesong Niu 他
日本語で読む → - 論文VLAロボティクス
異種ロボットデータによる自己受容・視覚学習のスケーリング
異なるロボット身体とタスクのデータを大規模に事前学習し、共有可能なポリシー表現を学習するHPTを提案。未知タスクでの微調整性能を20%以上向上させた。
原題: Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers / Lirui Wang, Xinlei Chen, Jialiang Zhao 他
日本語で読む → - 論文VLAロボティクス
事前学習済み視覚言語モデルとブラックボックス最適化によるロボットの環境状態認識
事前学習済み視覚言語モデルとブラックボックス最適化を用いて、扉の開閉や水道の流水などの環境状態を統一的な手法で認識する。
原題: Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization / Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa 他
日本語で読む → - 論文VLAロボティクス
知覚行動APIと大規模言語モデルによる物体属性の発見
視覚言語モデルと大規模言語モデルを組み合わせた知覚行動APIを提案し、ロボットが能動的な知覚を通じて物体の重さなどの非視覚的属性を検出できるようにした。
原題: Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs / Angelos Mavrogiannis, Dehao Yuan, Yiannis Aloimonos
日本語で読む → - 論文VLAロボティクス
AssistantX: LLMを活用した人間共存環境における能動的アシスタント
4つのLLMエージェントからなるマルチエージェント構成で、人間がいる実環境で自律的に動作し、指示への反応や状況に応じた戦略調整、人間への能動的な支援要請を行うアシスタントを提案した。
原題: AssistantX: An LLM-Powered Proactive Assistant in Collaborative Human-Populated Environment / Nan Sun, Bo Mao, Yongchang Li 他
日本語で読む → - 論文VLAロボティクス
MotIF: 動作指示ファインチューニング
ロボットの動作の成否を判定するために、キーポイント軌跡を最終画像に重ねた抽象表現で視覚言語モデルをファインチューニングする手法を提案し、MotIF-1Kデータセットを構築した。
原題: MotIF: Motion Instruction Fine-tuning / Minyoung Hwang, Joey Hejna, Dorsa Sadigh 他
日本語で読む → - 論文VLA画像認識
OccLLaMA: 自動運転のための占有・言語・行動生成ワールドモデル
意味的占有を視覚表現として用い、視覚・言語・行動を自己回帰モデルで統合した自動運転向け生成ワールドモデルを提案し、4D占有予測・運動計画・視覚質問応答で競争力のある性能を示した。
原題: OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving / Julong Wei, Shanshuai Yuan, Pengfei Li 他
日本語で読む → - 論文VLAロボティクス
VernaCopter: 形式仕様を用いた曖昧性のない自然言語駆動ロボット
自然言語の指示を信号時相論理(STL)仕様に変換し、LLMベースのロボット動作計画の曖昧さと不安定性を低減する手法を提案した論文。
原題: VernaCopter: Disambiguated Natural-Language-Driven Robot via Formal Specifications / Teun van de Laar, Zengjie Zhang, Shuhao Qi 他
日本語で読む → - 論文VLAAI
エッジデバイス上の大規模言語モデルによる効率的な運転行動の記述と推論
路側機にLLMを配備し、5Gで連携して運転シーンを記述・推論するエッジ向けフレームワークを提案。マルチモーダル情報を統合するプロンプト戦略で性能を向上させた。
原題: Efficient Driving Behavior Narration and Reasoning on Edge Device Using Large Language Models / Yizhou Huang, Yihua Cheng, Kezhi Wang
日本語で読む → - 論文VLAロボティクス
InteLiPlan: 家庭用ロボットの自律性を高める対話型軽量LLMプランナー
LLMを活用した対話型プランニングフレームワークを提案し、家庭用ロボットの自律性と堅牢性を向上させる。実機とシミュレーションで「取ってきて」タスクを95%の成功率で達成した。
原題: InteLiPlan: An Interactive Lightweight LLM-Based Planner for Domestic Robot Autonomy / Kim Tien Ly, Kai Lu, Ioannis Havoutis
日本語で読む → - 論文VLAロボティクス
特徴抽出器か意思決定者か:視覚運動ポリシーにおける視覚エンコーダの役割を再考する
視覚運動ポリシーにおいて視覚エンコーダが単なる特徴抽出器ではなく意思決定にも寄与していることを実験的に示し、OOD事前学習モデルの性能低下を明らかにした研究。
原題: Feature Extractor or Decision Maker: Rethinking the Role of Visual Encoders in Visuomotor Policies / Ruiyu Wang, Zheyu Zhuang, Shutong Jin 他
日本語で読む → - 論文VLAロボティクス
KARMA:長期・短期記憶システムで身体性AIエージェントを強化
長期記憶に3Dシーングラフ、短期記憶に物体の位置・状態変化を記録する二重記憶構造をLLMに組み込み、家庭内の長系列タスク計画の成功率と効率を大幅に改善した。
原題: KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems / Zixuan Wang, Bo Yu, Junzhe Zhao 他
日本語で読む → - 論文VLA自然言語
コボットのノーコードプログラミングに向けて:対話型プログラミングのための大規模コードモデルによるコード合成実験
大規模言語モデルを用いて、自然言語による指示から協働ロボット(コボット)の組立作業プログラムを対話的に生成する手法を検討し、その性能を評価した。
原題: Towards No-Code Programming of Cobots: Experiments with Code Synthesis by Large Code Models for Conversational Programming / Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen
日本語で読む → - 論文VLAロボティクス
SELP: 大規模言語モデルを用いたロボットエージェントの安全で効率的なタスクプラン生成
自然言語命令からLTL式を生成し、等価投票・制約付きデコーディング・ドメイン特化ファインチューニングを組み合わせて、安全で効率的なロボットのタスクプランを生成する手法SELPを提案した。
原題: SELP: Generating Safe and Efficient Task Plans for Robot Agents with Large Language Models / Yi Wu, Zikang Xiong, Yiran Hu 他
日本語で読む → - 論文VLA画像認識
FALCON: 未来予測と物体中心の文脈事前学習によるUAV行動認識
UAV映像の行動認識に向け、物体検出を事前学習時のみに用いて背景の影響を抑え、物体中心の短期・長期未来再構成を組み合わせた自己教師あり学習手法を提案。
原題: FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition / Ruiqi Xian, Xiyang Wu, Tianrui Guan 他
日本語で読む → - 論文VLAAI
継続学習による視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)エージェントが新しい環境を逐次学習しながら過去の知識を保持できるよう、脳の記憶リプレイに着想を得た二重ループシナリオリプレイ手法(Dual-SR)を提案した研究。
原題: Vision-Language Navigation with Continual Learning / Zhiyuan Li, Yanfeng Lv, Ziqin Tu 他
日本語で読む → - 論文VLA機械学習
豊富な報酬の落とし穴:VLM報酬のノイズを理解し軽減する
VLMが生成する報酬信号の偽陽性ノイズが強化学習エージェントの性能を低下させることを明らかにし、二値相互情報量(BiMI)報酬関数でノイズを軽減する手法を提案した。
原題: The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards / Sukai Huang, Shu-Wei Liu, Nir Lipovetzky 他
日本語で読む → - 論文VLAロボティクス
HiFi-CS: 視覚言語モデルを用いたロボット把持のためのオープン語彙視覚的グラウンディング
画像とテキストの埋め込みを階層的に融合する軽量デコーダで、複雑な指示文から把持対象を高精度に特定し、7自由度アームでの実機実験で90.33%の精度を達成した。
原題: HiFi-CS: Towards Open Vocabulary Visual Grounding For Robotic Grasping Using Vision-Language Models / Vineet Bhat, Prashanth Krishnamurthy, Ramesh Karri 他
日本語で読む → - 論文VLAAI
RAG-Modulo: 経験・批評家・言語モデルを活用した逐次タスクの解決
LLMエージェントに過去の経験を記憶し検索する仕組みと批評家による評価を組み合わせ、逐次タスクの成功率と効率を向上させるフレームワークを提案した。
原題: RAG-Modulo: Solving Sequential Tasks using Experience, Critics, and Language Models / Abhinav Jain, Chris Jermaine, Vaibhav Unhelkar
日本語で読む →