論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文共有自律/操作ロボティクス
NeuroCommitSSM: EEG-EMG-ETコミット準備状態に基づく意思決定中心の共有自律による安全な支援操作
支援ロボット操作において、実行タイミングを決定する枠組みを提案。脳波・筋電・視線からコミット準備状態を予測し、安全確認後に動作を開始する。
原題: NeuroCommitSSM: Decision-Centric Shared Autonomy for Safe Assistive Manipulation via EEG-EMG-ET Commit Readiness / Tipu Sultan, Param Sangani, Kody Cool 他
日本語で読む → - 論文エージェントOSAI
ABot-AgentOS: 生涯マルチモーダルメモリを備えた汎用ロボットエージェントOS
低レベル制御の上に推論・記憶・ツール使用・検証・クロス実体実行を提供する汎用ロボットエージェントOSを提案し、実行可能なベンチマークと永続的なマルチモーダルグラフメモリを導入した。
原題: ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory / Jiayi Tian, Shiao Liu, Yuting Xu 他
日本語で読む → - 論文模倣学習/ロボット操作ロボティクス
逆転して前進:逆転した易しいタスクからの低コストな熟練ポリシー学習
難しいタスクの逆方向(易しいタスク)の軌道を反転させて教師信号とし、高価なテレオペレーションデータ収集コストを削減する枠組みを提案。自動収集・階層的リファインメント・反復学習で高精度な操作タスクを学習する。
原題: Reverse to Advance: Teleoperation-Cost Effective Hard Policy Learning from Reversed Easy Tasks / Qiyuan Qiao, Ge Yuan, Can Wang 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
通信喪失下でのロバストなマルチエージェント協調のための価値認識予測
通信が途切れる環境で、エージェントが欠落した状態情報を予測する際に、価値関数に基づく重み付けを導入し、予測モデルの学習を政策の進化に結びつける手法を提案した。
原題: Value-Aware Prediction for Robust Multi-Agent Coordination Under Communication Loss / Kemal Devrim Kafadar, Eren Özaltun, Mahmud Efnan Şanlı 他
日本語で読む → - 論文マニピュレーションロボティクス
受取者中心のロボットから人への手渡し:把持を考慮した物体姿勢制御
非対称な工具を人間に手渡す際、把持しやすい向きにロボットが自動調整する適応型ハンドオーバーシステムを提案し、実験で有効性を示した。
原題: Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation / Federico Biagi, Dario Onfiani, Simone Silenzi 他
日本語で読む → - 論文VLAロボティクス
Kepler-Encoder-v0.1: ロボットのためのマルチモーダル埋め込みモデルに向けて
ロボットの状態をモダリティとして扱い、視覚・ proprioception・力覚を共通の潜在空間に融合するエンコーダを提案。訓練時のみ状態を融合し、推論時は視覚のみで力覚などの状態を復元できることを示した。
原題: Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots / Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen 他
日本語で読む → - 論文人型ロボット制御ロボティクス
人型ロボットのためのスケーリング行動基盤モデル
人型ロボットの制御を大規模行動データで学習する行動基盤モデル(BFM)のスケーリング手法を提案し、学習パラダイム、データ、モデル構造の協調により性能が向上することを示した。
原題: Scaling Behavior Foundation Model for Humanoid Robots / Weishuai Zeng, Kangning Yin, Xiaojie Niu 他
日本語で読む → - 論文HRIロボティクス
エージェント・クライアントプロトコルによるGenAIアーキテクチャにおける人間とロボットのインタラクション
本論文は、ロボットシステムの人間とロボットのインタラクション層に、ソフトウェアエージェント用の通信標準であるAgent-Client Protocol (ACP)を採用し、MCPと組み合わせた3層アーキテクチャを提案する。これにより、異種UIの接続やロボット基盤の交換を容易にし、リアルタイム観測や人間の承認などの協調機能を実現する。
原題: Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol / Jesus Moncada-Ramirez, Jose-Raul Ruiz-Sarmiento, Javier Gonzalez-Jimenez
日本語で読む → - 論文ドローン/耐障害性ロボティクス
実用的な耐障害性と効率性を両立する変形型ヘキサロータ試作機
プロペラ間の角度を変えられる変形型ヘキサロータを用いて、単一プロペラ故障への耐性とエネルギー効率を両立する幾何学的領域が存在することを実験で実証した。
原題: A Morphing-Designed Hexarotor Prototype combining Practical Resilience and Efficiency / Murat Bronz, Mahmoud Hamandi, Elgiz Baskaya 他
日本語で読む → - 論文VLA/ヒューマノイドロボティクス
ラボから店舗へのギャップを埋める:小売ヒューマノイド向けデータ効率的なポストトレーニングと経験駆動学習VLAフレームワーク
スーパーマーケットの棚補充タスクにおいて、データ効率的なポストトレーニングと経験駆動の学習を組み合わせたVLAフレームワークを提案し、単一GPUで実世界運用可能な性能を達成した。
原題: Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids / Roger Sala Sisó, Tiago Silvério, Jakob Sand 他
日本語で読む → - 論文視覚慣性オドメトリロボティクス
多解像度ボクセル地図を用いたステレオ視覚慣性オドメトリ
事前地図を多解像度ボクセル化し、円錐状のインデックス戦略で2D特徴と3D地図点を関連付けることで、データ転送量と計算負荷を抑えつつ高精度な位置推定を実現するVIOシステムを提案した。
原題: Multi-Resolution Voxelized Map-Based Stereo Visual-Inertial Odometry / Shuyi Pan, Hangtian Wang, Zhaoxing Zhang 他
日本語で読む → - 論文ロボット学習ロボティクス
EgoRecovery: 人間の回復デモンストレーションから失敗回復能力を獲得する
ロボットの失敗回復行動を学習するために、人間の自己中心視点の回復デモを活用し、ロボットデータと共有する意図空間を介して少数のロボットデモで実行可能な行動に結びつける共学習フレームワークを提案した。
原題: EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration / Zuhao Ge, Yuchen Zhou, Weitao Zhou 他
日本語で読む → - 論文ロバスト計画math.OC
非線形システムのロバスト計画のための相対エントロピー有界曖昧チャンス制約
分布の曖昧さを考慮した確率制御問題において、非線形システムと未知分布に対するリスク値を相対エントロピー距離で有界化する手法を提案し、宇宙機の誘導問題で実証した。
原題: Relative Entropy-Bounded Ambiguous Chance Constraints for Robust Planning in Nonlinear Systems / Trevor N. Wolf, Jay W. McMahon
日本語で読む → - 論文UAV航法ロボティクス
非凸エアコリドーにおけるUAV航法のためのモデル予測プランナー
非凸な都市エアコリドー内でのUAV航法のための、混合整数追跡モデル予測制御に基づく運動計画フレームワークを提案。最短経路ベースのオフセットコストを組み込み、局所最小値問題を緩和しつつ、動的に有効でコリドー制約を満たす軌道を生成する。
原題: Model Predictive Planner for UAV Navigation in Non-Convex Air Corridors / Henrique Silva, Marcelo A. Santos, Guilherme V. Raffo
日本語で読む → - 論文水中モニタリングcs.IR
局所マルチエージェントRAGによるエネルギー制約下の階層型水中モニタリング
超低消費電力のエッジセンシングと高性能な局所推論を組み合わせた水中モニタリングアーキテクチャを提案し、エネルギー制約下での継続的な海洋生物監視を実現する。
原題: Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG / Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot
日本語で読む → - 論文視覚位置推定画像認識
高精度ストリートレベル画像を活用した視覚位置推定の精度ポテンシャル
高精度な地理参照を持つストリート画像を用いた視覚位置推定パイプラインを提案し、サブセンチメートルの真値を持つ大規模データセットを構築して精度を評価した。
原題: Accuracy potential of visual localization exploiting high-end street-level imagery / Jonas Meyer, Stephan Nebiker, Pascal Theiler 他
日本語で読む → - 論文モバイルマニピュレーションロボティクス
FloAff-Kitchen:正準的かつ段階的な床面アフォーダンス学習によるナビゲーションと操作の橋渡し
移動マニピュレーションにおいて、操作の成功率を最大化する床面アフォーダンス(FloAff)を予測する統一フレームワークを提案。正準表現学習と段階的アフォーダンス事前学習により、異種操作スキル間の共有知識とタスク固有知識を分離し、新規ベンチマークで優位性を示した。
原題: FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning / Ping Zhong, Manling Teng, Tao Wu 他
日本語で読む → - 論文群制御ロボティクス
非剛体から剛体へ:限られたセンシング下での安全な剛体通信グラフ獲得
限られたセンシング範囲で動作するマルチロボットシステムに対し、衝突を回避しつつ剛体通信グラフを時間変化の中で獲得する分散制御手法を提案した。
原題: From Non-Rigid to Rigid: Safe Acquisition of Rigid Communication Graphs under Limited Sensing / S. Saharsh, Vedhas Talnikar, Pushpak Jagtap
日本語で読む → - 論文認識/自動化ロボティクス
鉱山における自律型インパクトハンマーのためのリアルタイムRGB-D認識パイプライン:自己フィルタリング、岩石セグメンテーション、破砕ポーズ生成
鉱山のインパクトハンマー自動化に向け、RGB-Dカメラを用いて岩石をセグメンテーションし、破砕可能なポーズを生成するリアルタイム認識パイプラインを提案。約10Hzで動作し、実時間での自律運用に適することを実験で示した。
原題: A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation / Martín Gallegos, Francisco Leiva, Patricio Loncomilla 他
日本語で読む → - 論文生成モデルロボティクス
GS-Agent: 生成シミュレーションによる4D物理世界の構築
自然言語の記述から、物理的に妥当で動的な4D世界を自動生成するマルチエージェントフレームワークを提案した論文。
原題: GS-Agent: Creating 4D Physical Worlds With Generative Simulation / Hongxin Zhang, Chunru Lin, Junyan Li 他
日本語で読む → - 論文VLAロボティクス
視覚運動ポリシー学習のための順序付きアクショントークン
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
原題: Ordered Action Tokens for Visuomotor Policy Learning / Chaoqi Liu, Yue Zhao, Haonan Chen 他
日本語で読む → - 論文VLA/評価AI
空中MLLMエージェントのゼロショットミッションレベル評価
空中3D環境での長期的なタスクを評価するベンチマークMissionBenchを提案し、22のMLLMモデルが人間の84.4%に対し35%未満の成功率であることを示した。
原題: Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents / Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt 他
日本語で読む → - 論文継続的RL/自律レースロボティクス
自律レースにおける継続的RLによる汎化:RoboRacerプラットフォームでの検証
実世界データのみを用いて、継続的バックプロパゲーションに基づく継続的RLフレームワークを提案し、複数のトラックで汎用的なポリシーを訓練した後、15分以内の微調整で古典的制御器を上回る性能を達成した。
原題: Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform / Joel Siegert, Edoardo Ghignone, Michele Magno
日本語で読む → - 論文VPR/生涯学習ロボティクス
SLAM:忘却耐性と領域ロバストな生涯VPRのための構造化・局所化解析多様体適応
生涯視覚場所認識(VPR)における解析的クラス増分学習(ACIL)の領域シフト脆弱性を解決するため、不変多様体とスタイル分離によるドメイン整合、およびEKFとの同型性に基づく制御理論的枠組みSLAMを提案し、非定常データセットで性能を向上させた。
原題: SLAM: Structured and Localized Analytic Manifold Adaptation for Forgetting-Immune and Domain-Robust Lifelong VPR / Kenta Tsukahara, Kanji Tanaka, Rai Hisada
日本語で読む → - 論文制御統合制御
強化学習と最適制御を架橋する実行可能行動マッピング
強化学習の行動を最適制御問題の実行可能なパラメータ集合に写像するアルゴリズムを提案し、制約を厳密に満たしつつ柔軟な制御を実現する。ロボット卓球のリアルタイム動作計画で有効性を示した。
原題: Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping / Stefan Richter, Alberto Giammarino, Guillem Torrente 他
日本語で読む → - 論文HRIロボティクス
公共空間3箇所で運用した人型ロボットヘッドの受容性に関するケーススタディ
感情表現を伴う多言語対話が可能な人型ロボットヘッドを3つの公共空間で数日間運用し、TAM2アンケートで受容性を評価。観光案内所や図書館では好意的に受け入れられたが、役所では対話意欲が低く、応答速度の遅さが課題と判明した。
原題: A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces / Marcel Heisler, Luca Randecker, Christian Becker-Asano
日本語で読む → - 論文VLA評価画像認識
HumanCLAW: 視覚言語モデルは身体を通して行動できるか?
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
原題: HumanCLAW: Can Vision-Language Models Act Through a Body? / Li Siyao, Jiawei Gu, Shuai Liu 他
日本語で読む → - 論文科学エージェントAI
ロボット化学実験室における大規模言語モデルエージェントのストレステスト
ロボット化学実験室を物理世界のテストベッドとして使い、大規模言語モデルエージェントの科学的エージェンシーを測定可能にした研究。実験の実行可能性と証拠に基づく再計画の能力を評価した。
原題: Stress-testing large language model agents in a robotic chemistry laboratory / Lulu Guo, Yingkai Sun, Xiaobo Li 他
日本語で読む → - 論文VLAロボティクス
言葉は長く語る:言語によるロボットポリシー合成のガイド
この論文では、ロボットのポリシー獲得を対話的なプログラム合成タスクとして扱うフレームワーク「ARCHITECT」を提案し、人間の自然言語による修正をコードに反映し、再利用可能なスキルライブラリを構築することで、長期的なタスクでの性能向上と人間の介入削減を実現しています。
原題: A Few Words Go a Long Way: Language Guided Robot Policy Synthesis / Daphne Chen, Archit Ritesh Jain, Eric Goossen 他
日本語で読む → - 論文移動操作画像認識
探索・対話・展開可能:オープンワールド移動操作のための視覚駆動型具現化エージェント
実世界展開可能な移動操作エージェントのためのフレームワークREALを提案し、シミュレーションと実機のギャップを埋める環境とベンチマークを構築、物理ロボットで高い成功率を達成した。
原題: Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation / Boyu Mi, Mengchen Ma, Yifei Yao 他
日本語で読む →