論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御cs.MA
回廊ネットワークによる分散型自律交通管理
この論文は、複数の自律航空機が高密度で飛行する際の交通管理を、中央集権的な方法ではなく分散型で行うために、マルチエージェント強化学習を用いた手法を提案し、単一の回廊で訓練したポリシーが複雑なネットワークでもゼロショットで機能することを示しています。
原題: Decentralized Autonomous Traffic Management through Corridor Networks / Jasmine Jerry Aloor, Aadarsh Govada, Hamsa Balakrishnan
日本語で読む → - 論文遠隔操作/視線行動ロボティクス
予測的注視はロボット操作中も保持されるが、監視へと再編成される
ロボットを介した遠隔操作中の視線行動を調べ、予測的注視が維持されつつも、視覚的注意がロボットのエンドエフェクタや操作対象への監視に再配分されることを示した論文。
原題: Predictive Gaze Is Preserved but Reorganized toward Monitoring during Robot-Mediated Manipulation / Manuela Uliano, Silvia Fattorini, Marco Controzzi
日本語で読む → - 論文自動運転ロボティクス
MAGNIFIED: マルチモーダル大規模言語モデルの強化学習による動作計画の微調整
自動運転の動作計画のために、マルチモーダル大規模言語モデルを強化学習で微調整し、トークン単位の報酬を用いて計画目的に合わせる手法を提案した。
原題: MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning / Letian Chen, Yiren Lu, Justin Fu 他
日本語で読む → - 論文群制御/位置推定ロボティクス
単一ハイドロフォンペイロードを搭載した複数AUVによる隠れマルコフモデル付き粒子フィルタを用いた海洋生物追跡
複数のAUVに単一の小型ハイドロフォンを搭載し、隠れマルコフモデルに基づく粒子フィルタで音響タグの位置を推定する海洋生物追跡手法を提案した。実データとシミュレーションで約10〜15mの精度を確認した。
原題: Multi-AUV Marine Life Tracking with Single Hydrophone Payloads via a Hidden Markov Model Equipped Particle Filter / Christopher Herrera, Kehlani Fay, Christopher Clark 他
日本語で読む → - 論文ヒューマノイド歩行ロボティクス
TACT-ful:ペイロードに頑健な知覚ヒューマノイド歩行のためのマルチチャネル地形アフォーダンスとコンプライアンス訓練
単一の高さ情報では捉えられない地形特性を考慮するため、平坦性・急峻性・速度考慮の高さ可能性を組み合わせたマルチチャネル地形コストと前進登坂報酬を提案し、GPU並列DCM足場プランナと非対称アクタークリティック方策を深度画像からPPOで訓練する。また、仮想力を受ける下半身コンプライアンス訓練を導入し、力センサなしで負荷外乱に適応するヒューマノイド歩行を実現する。
原題: TACT-ful: Multi-Channel Terrain Affordance and Compliance Training for Payload-Robust Perceptive Humanoid Locomotion / Thanh Ly, Truong-Duy Dang, Chien Le 他
日本語で読む → - 論文模倣学習ロボティクス
TSD: 物理に着想を得た軌道顕著性検出器による効率的な模倣学習
ロボット操作の模倣学習において、データ収集コスト削減のため、軌道の重要度(顕著性)を物理指標(空間エントロピーと向心加速度)で検出する訓練不要のフレームワークTSDを提案し、データ圧縮・拡張に活用した。
原題: TSD: A Physics-Inspired Trajectory Saliency Detector for Efficient Imitation Learning / Yiming Zhao, Gongrui Ma, Qingkai Li 他
日本語で読む → - 論文ロボット学習ロボティクス
視覚検証による推論時制御と自律的なポリシー改善
汎用ロボットポリシーに視覚検証器を組み合わせ、推論時に行動を評価・選択することで追加学習なしで性能を向上させ、さらに検証済み軌道で微調整して自律的に改善する手法を提案した。
原題: Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement / Mingtong Zhang, Dhruv Shah
日本語で読む → - 論文触覚ロボティクス
TactX: 多様なセンサにわたる共有触覚表現の学習
異なる原理の触覚センサ(抵抗、磁気、視覚)からのデータを共通の潜在空間に写像するフレームワークTactXを提案し、あるセンサで訓練した操作ポリシーを別のセンサへゼロショット転移できることを示した。
原題: TactX: Learning Shared Tactile Representations Across Diverse Sensors / Junsung Park, Sachin Bhadang, Carmelo Sferrazza 他
日本語で読む → - 論文経路追従制御ロボティクス
非線形運動学モデルを用いた連結トラクタートレーラーシステムの経路追従性能の向上
連結トラクタートレーラーシステムの非線形運動学モデルを提案し、モデル予測制御と組み合わせてトレーラーの位置追従精度を向上させた。ROSとGazeboでシミュレーション検証を行った。
原題: Improving path-tracking performance of an articulated tractor-trailer system using a non-linear kinematic model / Marina Murillo, Guido Sanchez, Nestor Deniz 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動のための連続推論
自然言語はタスクレベルの粒度であり連続制御には不向きなため、VLAポリシーに適した連続思考を導入し、共有ガウス潜在変数として自己検証目的で学習する手法を提案した。
原題: Continuous Reasoning for Vision-Language-Action / Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota
日本語で読む → - 論文自動運転プランニングロボティクス
ConsistencyPlanner: 高速サンプリング整合性モデルによるリアルタイムプランニング
自動運転の閉ループプランニングを高速化するため、整合性モデルを用いた多様な軌道生成と注意機構による特徴統合を提案し、Waymaxシミュレータで安全性を向上させた。
原題: ConsistencyPlanner: Real-time Planning with Fast-Sampling Consistency Models / Qichao Zhang, Xing Fang, Jiaqi Fang 他
日本語で読む → - 論文3D物体検出画像認識
3D物体検出のための学習型非最大値抑制
LiDARベースの3D物体検出において、ヒューリスティックなNMSを学習ベースのフィルタリングモジュールに置き換え、検出精度を向上させる手法を提案した論文。
原題: Learned Non-Maximum Suppression for 3D Object Detection / Timo Osterburg, Stefan Schütte, Torsten Bertram
日本語で読む → - 論文VLAロボティクス
平坦性が視覚言語行動モデルの指示追従を維持する
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
原題: Flatness Preserves Instruction Following in Vision-Language-Action Models / Haochen Zhang, Yonatan Bisk
日本語で読む → - 論文ロボット学習ロボティクス
ロボット学習のための世界とタスクの因子分解
ロボット学習の汎化を改善するため、ポリシーを世界因子とタスク因子に構造的に分解する方法を提案し、その原理的条件を理論的に分析した。
原題: World-Task Factorization for Robot Learning / Eduardo Sebastián, Adrian Pfisterer, Vito Mengers 他
日本語で読む → - 論文サーベイロボティクス
ワールドアクションモデル:サーベイ
予測と行動を統合するワールドアクションモデル(WAM)の定義と分類を整理し、既存手法を生成対象と設計要素の2軸で分析したサーベイ論文。
原題: World Action Models: A Survey / Qiuhong Shen, Shihua Zhang, Yue Liao 他
日本語で読む → - 論文群制御ロボティクス
協調するロボット:結合ロボットポリシー学習のための逐次非対称模倣
2台の双腕移動ロボットが剛体・変形体を介して物理的に結合する協調作業を、単一オペレータの模倣カリキュラムで学習させる手法を提案。ロボットAを人間パートナーとの片側デモで訓練し、ロボットBをAのポリシーに対抗させて訓練、その後Aを介入で微調整する。
原題: Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies / Yincong Chen, Ranpeng Qiu, Zihao Li 他
日本語で読む → - 論文フロアプラン生成cs.CG
DPLAN: 最小接続性によるフロアプラン生成
ドア接続と非隣接の制約から、重なりや空きのないフロアプランを自動生成するグラフベースの手法を提案。
原題: DPLAN: Minimal Connectivity to Floorplan Generation / Rohit Lohani, Krishnendra Shekhawat
日本語で読む → - 論文四足歩行ロボティクス
無限の動きを解き放つ:生成ビデオ事前学習による表現豊かな四足歩行のスケーリング
動物を介さずに、LLMとビデオ拡散モデルで四足ロボットの多様な動きを生成し、実機で追従させるパイプラインUni-Moを提案した。
原題: Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors / Youzhi Liu, Li Gao, Yifei Qian 他
日本語で読む → - 論文VLAロボティクス
ReSiReg: 言語条件付きロボットタスクにおける空間的に一貫したセマンティクスの実現
視覚言語モデルの埋め込みはノイズが多く空間的に一貫性がない問題を解決するため、空間的に一貫した中間表現を用いて特徴を再構成する手法ReSiRegを提案した。
原題: ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks / Simon Schwaiger, David Seyser, Alessandro Scherl 他
日本語で読む → - 論文ナビゲーションロボティクス
Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデル
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
原題: Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System / Jiazhao Zhang, Gengze Zhou, Hale Yin 他
日本語で読む → - 論文生涯学習/操作ロボティクス
LiMoDE: 動的エキスパートの混合の視点から生涯ロボット操作を再考する
ロボットが連続的に新しいタスクに適応するための生涯学習手法を提案。動的MoE構造で事前学習し、適応段階では凍結したエキスパートと新しいエキスパートを組み合わせて知識転移を実現する。
原題: LiMoDE: Rethinking Lifelong Robot Manipulation from a Mixture-of-Dynamic-Experts Perspective / Zhihao Gu, Lin Wang
日本語で読む → - 論文VLAロボティクス
ThinkingVLA: ロボット操作のための視覚と言語の推論を交互に行う手法
ロボット操作タスクにおいて、視覚と言語の推論を交互に行う統一アーキテクチャを提案し、長期的な操作タスクでの性能を向上させた。
原題: ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation / Tianyi Lu, Hui Zhang, Zijie Diao 他
日本語で読む → - 論文経路計画ロボティクス
DIFF-IPPO: 拡散モデルに基づくオープンボキャブラリ信念マップを用いた情報経路計画
拡散モデルを用いて、非ガウス型の信念マップ上で情報利得を最大化する大域軌道を生成する経路計画手法を提案。シミュレーションの捜索救助シナリオで有効性を検証した。
原題: DIFF-IPPO: Diffusion-Based Informative Path Planning with Open-Vocabulary Belief Maps / Sausar Karaf, Oleg Sautenkov, Mikhail Martynov 他
日本語で読む → - 論文セマンティックセグメンテーション画像認識
ICRA 2026 GOOSE 2D細粒度セマンティックセグメンテーションチャレンジ技術報告:屋外シーン理解のためのクエリベースセグメンテーションと空間コンテキスト拡大の探求
GOOSEデータセットを用いた屋外の細粒度セマンティックセグメンテーションで、SegFormerからMask2Formerへの変更と訓練時のクロップサイズ拡大により精度を向上させ、テスト時拡張でmIoU 69.6%を達成した。
原題: Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding / David Pascual-Hernández, Roberto Calvo-Palomino, Inmaculada Mora-Jiménez 他
日本語で読む → - 論文VLA/エッジ展開ロボティクス
RhinoVLA技術報告:エッジSoC向け展開最適化VLAモデル
エッジSoC上でのリアルタイム展開を目指し、トークン効率的なVLAモデルと専用SoCを共同設計し、10Hzの実時間制御を達成した。
原題: RhinoVLA Technical Report / Huixi Technology, :, Chen Zhang 他
日本語で読む → - 論文模倣学習/データキュレーションロボティクス
デモンストレーションキュレーションメトリクスがポリシーに与える影響
デモンストレーションの欠陥検出メトリクスが、キュレーション後の行動クローニングポリシーの性能に与える影響を調査し、検出精度とポリシー性能が乖離することを示した論文。
原題: What Demonstration Curation Metrics Do to Your Policy / Aarav Bedi
日本語で読む → - 論文ナビゲーションロボティクス
GNSS遮断環境向けベイズ学習強化ディープスムージング
GNSSが使えない環境でのナビゲーション精度を高めるため、ベイズ平滑化にトランスフォーマーによる学習を組み合わせた手法を提案し、クアッドローターのデータで精度向上を実証した。
原題: BLENDS: Bayesian Learning-Enhanced Deep Smoothing for GNSS-Denied Environments / Nadav Cohen, Itzik Klein
日本語で読む → - 論文視覚的位置認識画像認識
深度認識蒸留による森林環境での視覚的位置認識
森林環境での視覚的位置認識の課題に対し、DINOv2ベースのモデルに幾何学的手がかりを注入する軽量な深度認識蒸留フレームワークを提案し、WildCrossベンチマークで外観変動に対する頑健性を向上させた。
原題: Visual Place Recognition in Forests with Depth-Aware Distillation / Walter Nedov, Saimunur Rahman, Kavindie Katuwandeniya 他
日本語で読む → - 論文VLA/強化学習/折りたたみロボティクス
折りたたみ学習:LeHomeチャレンジ2026優勝ソリューション(オンライン1位、オフライン2位)
両腕ロボットによる衣類折りたたみ競技会で、VLAポリシーに強化学習ループを組み合わせ、オンライン1位・実機2位を獲得したシステムを提案。
原題: Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline) / Ilia Larchenko
日本語で読む → - 論文VLAロボティクス
TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
原題: TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models / Wenbo Zhang, Jianxiong Li, Shuai Yang 他
日本語で読む →