論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA自然言語
PRISM: 暗黙的シーン理解による選好洗練を用いた3D視覚言語選好ベース強化学習
3D点群と言語モデルを統合し、Chain-of-Thought推論で将来を考慮した選好を洗練させることで、遮蔽や視点バイアスに強い選好ベース強化学習フレームワークを提案した。
原題: PRISM: Preference Refinement via Implicit Scene Modeling for 3D Vision-Language Preference-Based Reinforcement Learning / Yirong Sun, Yanjun Chen
日本語で読む → - 論文VLA画像認識
視覚言語モデルを活用したオープンボキャブラリ物体検出・追跡
VLMの記述力とオープンボキャブラリ検出・動画セグメンテーションを組み合わせ、動的環境で未知物体をリアルタイムにセグメンテーション・追跡する手法を提案。
原題: Leveraging Vision-Language Models for Open-Vocabulary Instance Segmentation and Tracking / Bastian Pätzold, Jan Nogga, Sven Behnke
日本語で読む → - 論文VLA機械学習
VIPER: 逐次意思決定のための視覚知覚と説明可能な推論
VLMで画像をテキスト化しLLMで行動を推論するモジュール型パイプラインを提案し、ALFWorldで視覚指示ベースの計画性能を向上させた。
原題: VIPER: Visual Perception and Explainable Reasoning for Sequential Decision-Making / Mohamed Salim Aissi, Clemence Grislain, Mohamed Chetouani 他
日本語で読む → - 論文VLAロボティクス
EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
原題: EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks / Yi Zhang, Qiang Zhang, Xiaozhu Ju 他
日本語で読む → - 論文VLAロボティクス
PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
原題: PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding / Wenxuan Song, Jiayi Chen, Pengxiang Ding 他
日本語で読む → - 論文VLAロボティクス
事前学習済みLLMをロボット直列生産ラインのリアルタイム制御に活用
GPT-4などの大規模言語モデルを移動ロボットのスケジューリング制御に用いるフレームワークを提案し、従来手法を上回りMARLと同等のスループットを再学習なしで達成できることを示した。
原題: Pretrained LLMs as Real-Time Controllers for Robot Operated Serial Production Line / Muhammad Waseem, Kshitij Bhatta, Chen Li 他
日本語で読む → - 論文VLA画像認識
LIAM: 言語指示・画像・行動・セマンティックマップのためのマルチモーダルTransformer
家庭内サービスロボット向けに、言語指示・画像・行動履歴・セマンティックマップを入力として行動列を予測するエンドツーエンドモデルを提案し、ALFREDベンチマークで有効性を示した。
原題: LIAM: Multimodal Transformer for Language Instructions, Images, Actions and Semantic Maps / Yihao Wang, Raphael Memmesheimer, Sven Behnke
日本語で読む → - 論文VLAロボティクス
Dita: 汎用視覚言語行動ポリシーのための拡散Transformerのスケーリング
Transformerで連続行動列を直接ノイズ除去するマルチモーダル拡散フレームワークを提案し、多様なロボットデータを統合して長期的タスクや実環境適応を実現した。
原題: Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy / Zhi Hou, Tianyi Zhang, Yuwen Xiong 他
日本語で読む → - 論文VLAロボティクス
MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデル
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
原題: MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation / Rongyu Zhang, Menghang Dong, Yuan Zhang 他
日本語で読む → - 論文VLAロボティクス
AutoSpatial: 効率的な空間推論学習による社会的ロボットナビゲーションのための視覚言語推論
大規模視覚言語モデルの空間理解を、自動ラベリングしたVQAデータと2段階の階層的学習で強化し、社会的ロボットナビゲーションの知覚・予測・推論・行動・説明を改善する手法を提案。
原題: AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning / Yangzhe Kong, Daeun Song, Jing Liang 他
日本語で読む → - 論文VLAロボティクス
AutoMisty:Mistyソーシャルロボットのための自動コード生成マルチエージェントLLMフレームワーク
LLMを活用したマルチエージェント協調により、自然言語指示からMistyロボットの実行可能コードを自動生成するフレームワークを提案し、実機実験で有効性を示した。
原題: AutoMisty: A Multi-Agent LLM Framework for Automated Code Generation in the Misty Social Robot / Xiao Wang, Lu Dong, Sahana Rangasrinivasan 他
日本語で読む → - 論文VLAロボティクス
VLAモデルと専門家の協調による双方向マニピュレーション学習
VLAモデルと人間の専門家が協調してマニピュレーションを行い、互いのデータから学習し合う双方向ループを提案し、タスク成功率とBCI操作効率の向上を実証した。
原題: VLA Model-Expert Collaboration for Bi-directional Manipulation Learning / Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou 他
日本語で読む → - 論文自動運転/VLA画像認識
SimLingo: 言語と行動を整合させた視覚のみの閉ループ自動運転
カメラ映像のみを使う視覚言語モデルで、閉ループ運転・視覚言語理解・言語と行動の整合を同時に実現し、CARLAのBench2Driveで最高性能を達成した研究。
原題: SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment / Katrin Renz, Long Chen, Elahe Arani 他
日本語で読む → - 論文VLAロボティクス
GRaD-Nav: ガウス放射輝度場と微分可能力学による効率的な視覚ドローン航法の学習
3Dガウススプラッティングと微分可能強化学習を組み合わせ、視覚ベースのドローン航法ポリシーを効率的に学習するフレームワークを提案。シミュレーションから実機へのゼロショット転移と新しい環境への適応を実現した。
原題: GRaD-Nav: Efficiently Learning Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics / Qianzhong Chen, Jiankai Sun, Naixiang Gao 他
日本語で読む → - 論文VLAロボティクス
PhysVLM: 視覚言語モデルにロボットの物理的可到達性を理解させる
ロボットの可到達性を汎用的に表現するS-Pマップを導入し、それを視覚言語モデルに組み込むことで、実環境での embodied 推論精度を向上させた研究。
原題: PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability / Weijie Zhou, Manli Tao, Chaoyang Zhao 他
日本語で読む → - 論文VLAAI
グラフ接地型LLM:グラフ関数呼び出しによる幻覚の抑制
LLMにグラフライブラリの関数呼び出しを組み合わせることで、グラフ関連タスクにおける幻覚を減らし数学的正確性を高める手法を提案し、災害救助支援への応用も示した。
原題: Graph-Grounded LLMs: Leveraging Graphical Function Calling to Minimize LLM Hallucinations / Piyush Gupta, Sangjae Bae, David Isele
日本語で読む → - 論文自動運転/VLAロボティクス
交通規制データベースと視覚言語モデルを活用した規制対応経路計画
RGBカメラと視覚言語モデル、機械可読な交通規制データベースを組み合わせ、自動運転車が法規を守りながら経路を計画・判断できるフレームワークを提案し、シミュレーションと実車で検証した。
原題: Traffic Regulation-aware Path Planning with Regulation Databases and Vision-Language Models / Xu Han, Zhiwen Wu, Xin Xia 他
日本語で読む → - 論文VLA画像認識
視覚的想像は視覚と言語によるナビゲーションエージェントを改善するか?
指示文に含まれるランドマークの視覚的想像を拡散モデルで生成し、VLNエージェントの追加モダリティとして与えることでナビゲーション性能が向上するかを検証した。
原題: Do Visual Imaginations Improve Vision-and-Language Navigation Agents? / Akhil Perincherry, Jacob Krantz, Stefan Lee
日本語で読む → - 論文VLA画像認識
NuPlanQA: マルチモーダル大規模言語モデルによるマルチビュー運転シーン理解のための大規模データセットとベンチマーク
運転シーン理解のためのマルチビューVQAデータセットNuPlanQA-1Mと評価ベンチマークNuPlanQA-Evalを構築し、BEV特徴を統合したBEV-LLMを提案した。
原題: NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models / Sung-Yeon Park, Can Cui, Yunsheng Ma 他
日本語で読む → - 論文VLA機械学習
タスクトークン:行動基盤モデルを柔軟に適応させる手法
強化学習でタスク特化のエンコーダを学習し、凍結した行動基盤モデルへの追加入力トークンとして使うことで、汎用性を保ちながら特定タスクに適応させる手法を提案。
原題: Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models / Ron Vainshtein, Zohar Rimon, Shie Mannor 他
日本語で読む → - 論文VLAロボティクス
Falcon: 部分ノイズ除去による高速視覚運動ポリシー
拡散ポリシーの推論を高速化するため、過去の行動の部分ノイズ除去結果を再利用する学習不要の手法を提案し、性能を維持しつつ2〜7倍の速度向上を実現した。
原題: Falcon: Fast Visuomotor Policies via Partial Denoising / Haojun Chen, Minghao Liu, Chengdong Ma 他
日本語で読む → - 論文VLAAI
Cosmos-Reason1:物理的常識から身体性推論へ
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
原題: Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning / NVIDIA, :, Alisson Azzolini 他
日本語で読む → - 論文VLAロボティクス
Being-0: 視覚言語モデルとモジュール型スキルを統合したヒューマノイドロボットエージェント
基盤モデルによる高レベルな指示理解・計画と、モジュール型スキルライブラリによる歩行・マニピュレーションを、軽量VLMのConnectorで橋渡しする階層型エージェントを提案し、実機ヒューマノイドで長期的タスクを実現した。
原題: Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills / Haoqi Yuan, Yu Bai, Yuhui Fu 他
日本語で読む → - 論文VLAロボティクス
SafeVLA:制約付き学習による視覚言語行動モデルの安全アラインメント
視覚言語行動モデル(VLA)に制約付きマルコフ決定過程を用いた安全強化学習を適用し、タスク成功率を維持しつつ安全違反コストを大幅に削減する手法を提案した。
原題: SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning / Borong Zhang, Yuhao Zhang, Jiaming Ji 他
日本語で読む → - 論文VLAAI
オンライン言語スプラッティング
3DガウシアンスプラッティングSLAMにおいて、事前生成なしでオンラインかつほぼリアルタイムに言語特徴を統合し、高精度なオープンボキャブラリ3Dマッピングを実現するフレームワークを提案。
原題: Online Language Splatting / Saimouli Katragadda, Cho-Ying Wu, Yuliang Guo 他
日本語で読む → - 論文VLA画像認識
TRAVEL: 視覚と言語によるナビゲーションのための訓練不要な検索と位置合わせ
大規模言語モデルと視覚言語モデルをゼロショットで用い、自然言語指示からランドマークを抽出し、トポロジカルマップ上で経路仮説を生成・位置合わせするモジュール型視覚言語ナビゲーション手法を提案。
原題: TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation / Navid Rajabi, Jana Kosecka
日本語で読む → - 論文VLAロボティクス
生成的予測制御:動的で実演困難なタスクのためのフローマッチング方策
シミュレーション可能だが実演が難しい高速動的タスクに対し、サンプリングベース予測制御と生成的モデリングを結びつけたフローマッチング方策を提案し、推論時のウォームスタートで高頻度フィードバックを可能にした。
原題: Generative Predictive Control: Flow Matching Policies for Dynamic and Difficult-to-Demonstrate Tasks / Vince Kurtz, Joel W. Burdick
日本語で読む → - 論文VLAロボティクス
Evolution 6.0:生成AIによるロボット進化
VLM・VLA・テキストto3D生成モデルを組み合わせ、人間の指示に必要な道具をロボットが自律的に設計・製作し、その使い方を学習してタスクを遂行するシステムを提案。
原題: Evolution 6.0: Robot Evolution through Generative Design / Muhammad Haris Khan, Artyom Myshlyaev, Artem Lykov 他
日本語で読む → - 論文VLA画像認識
OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォーム
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
原題: Openfly: A comprehensive platform for aerial vision-language navigation / Yunpeng Gao, Chenhui Li, Zhongrui You 他
日本語で読む → - 論文VLAロボティクス
再学習不要のスケーラブルな視覚言語ロボティクス:コンシューマGPU向けモジュラー型マルチモデルフレームワーク
軽量なオープンソースAIモデルを組み合わせ、再学習なしで自然言語指示によるピック&プレースを実現するモジュラーフレームワークSVLRを提案。コンシューマ向けGPUでも動作する。
原題: Scalable, Training-Free Visual Language Robotics: A Modular Multi-Model Framework for Consumer-Grade GPUs / Marie Samson, Bastien Muraccioli, Fumio Kanehiro
日本語で読む →