論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/操作ロボティクス
凍結VLAポリシーのための達成基盤メモリによる閉ループエージェント
凍結された視覚-言語-行動(VLA)ポリシーに、物理的証拠で検証されたサブゴール進行ポインタを持つ軽量メモリを追加し、開ループ実行を閉ループ化するフレームワークを提案。
原題: AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies / Hongbo Gao, Zeyu Ni, Xin Wen 他
日本語で読む → - 論文プランニングロボティクス
凸集合グラフを用いたサンプリングベースの認定プランニング
凸領域のグラフを用いたプランナーが返す軌道の衝突安全性を検証する新しい手法を提案し、従来法の誤り率を大幅に低減しつつ高速化を実現した。
原題: Sampling-based Certified Planning with Graphs of Convex Sets / Peng Xie, Amr Alanwar
日本語で読む → - 論文慣性オドメトリロボティクス
VeloBins: ビン分割と誤差条件付きガウスラベルによる空中慣性オドメトリの速度と不確実性の学習
慣性オドメトリの速度回帰をビン分類問題に変換し、不確実性を明示的に教師あり学習する手法を提案。4つの空中データセットで誤差を大幅に削減した。
原題: VeloBins: Learning Velocity and Its Uncertainty via Bins and Error-Conditioned Gaussian Labels for Aerial Inertial Odometry / Maulana Bisyir Azhari, Seungwook Lee, Donghun Han 他
日本語で読む → - 論文ソフトロボティクス/視覚制御ロボティクス
シリアルモジュール型ソフトロボットのためのモジュール数適応型視覚形状制御
単一モジュールの学習データのみで、モジュール数が1〜5個のロボット全体の形状をカメラ画像から制御する手法を提案。画像をモジュールごとに分割し、共通のセグメンタと局所コントローラを適用することで、構成変更時の再学習を不要にした。
原題: Module Number Adaptive Visual Shape Control for Serial Modular Soft Robots / Kyohei Akamine, Takato Horii, Yusuke Sakaue 他
日本語で読む → - 論文深度推定画像認識
OptiGeo: 光学的に困難なシーンにおける身体化知覚のための効率的な単眼幾何学
透明・反射・鏡面環境での単眼深度推定の信頼性を向上させるため、センサ由来のバイアスを補正する学習フレームワークOptiGeoを提案した。
原題: OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes / Muxin Liu, Tianbo Liu, Jing Xia 他
日本語で読む → - 論文全身操作/自己受容感覚ロボティクス
盲目の巧みさ:純粋な自己受容感覚による全身ヒューマノイド操作
カメラや触覚センサーを使わず、関節エンコーダのみの自己受容感覚でUnitree G1ヒューマノイドが全身操作タスク(歩行、ボールトラップ、スーツケース持ち上げ、スケートボード搭乗)を達成できることを示した論文。接触による関節読み取り値の変化が全身触覚チャネルとして機能することを明らかにした。
原題: Blind Dexterity: Whole-Body Humanoid Manipulation via Pure Proprioception / Aditya Bhatt, Oleg Kaidanov, Puze Liu 他
日本語で読む → - 論文制御理論機械学習
計算遅延を考慮したネットワークシステムのイベントトリガ制御とオンライン学習
計算遅延を考慮し、ネットワーク上の遠隔計算ノードでオンライン学習ベースの制御を行う際の追従誤差限界を導出し、通信と計算の効率を両立する非同期イベントトリガ機構を提案した。
原題: Event-triggered Control and Online Learning for Networked Systems under Computational Delays / Xiaobing Dai, Armin Lederer, Zewen Yang 他
日本語で読む → - 論文航法/状態推定ロボティクス
未知の測定遅延を伴う一貫した支援慣性航法のためのガリレイ群上のスライディングウィンドウフィルタ
支援慣性航法において、センサ測定に未知の一定遅延がある場合に、遅延と航法状態を同時に推定する手法を提案した。ガリレイ群上で問題を定式化し、観測可能性を解析した上で、スライディングウィンドウフィルタを用いて遅延補正を適用することで推定の一貫性を向上させる。
原題: A Sliding Window Filter on the Galilean Group for Consistent Aided Inertial Navigation with Unknown Measurement Delays / Jonathan Kelly
日本語で読む → - 論文VLAロボティクス
DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
原題: DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting / Yuxuan Gao, Shiqi Zhang, Yedong Shen 他
日本語で読む → - 論文世界モデル/ベンチマーク調査ロボティクス
世界モデルはより優れたロボットを作るのか?予測的身体知能の評価ベンチマーク調査
ロボット学習における世界モデルとVLA政策の評価手法の乖離を指摘し、2017〜2026年の160件のベンチマークを分類・分析した調査論文。
原題: Do World Models Make Better Robots? A Survey of Evaluation Benchmarks for Predictive Embodied Intelligence / Gaytri Jena, Kapil Wanaskar, Vinija Jain 他
日本語で読む → - 論文群制御cs.MA
信号時相論理仕様からの拡散による汎化可能なマルチエージェント計画
拡散モデルとSTLの微分可能近似を組み合わせ、訓練時に見たことのない仕様にも汎化できるマルチエージェント計画手法を提案した。
原題: Generalizable Multi-Agent Planning from Signal Temporal Logic Specifications via Diffusion / Joe Eappen, Zikang Xiong, Shreyash S. Iyengar 他
日本語で読む → - 論文VLM/ナビゲーション/ベンチマーク画像認識
GeoAgent: 身体化ナビゲーションによるVLMの地理的位置特定能力の評価
視覚言語モデル(VLM)の地理的位置特定能力を、静的画像ではなく身体化ナビゲーション環境で評価するベンチマークGeoAgentを提案した。エージェントがストリートビューを探索して位置を推定する過程で、VLMの性能やバイアスを分析している。
原題: GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation / Arka Mukherjee, Soham Roy, Kartikeya Trivedi 他
日本語で読む → - 論文視覚認識画像認識
極度な視覚的疎密を透視する:単一のランダム視覚パッチからの表面理解
本研究は、画像の10%しか見えない極端に疎な観測から表面の再構築と材質分類を同時に行う統一フレームワークSSUFを提案し、4つの事前学習モデルを比較評価した。
原題: Seeing Through Extreme Visual Sparsity: Surface Understanding from a Single Random Visual Patch / Sindhuja Penchala, Sudip Mittal, Noorbakhsh Amiri Golilarz
日本語で読む → - 論文歩行ロボティクス
人型ロボットのための疎な3次元構造物の俊敏な知覚横断学習
人型ロボットが猿渡りバーを跳び移りながら渡り切るタスクを強化学習で実現。頭部搭載ライダーの生データを注意機構付きエンコーダで処理し、実機で高い成功率を達成した。
原題: Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids / Efe Ongan, Chong Zhang, Boyang Sun 他
日本語で読む → - 論文自動運転/能動学習ロボティクス
自己認識型能動学習による自動運転の継続的改善
自動運転システムが稀な分布シフトや長尾イベントで失敗する問題に対し、予測世界モデルから得られる「恐怖」と「好奇心」の信号を用いて介入閾値を適応的に調整し、専門家への制御移行と模倣学習で継続的に改善する能動学習フレームワークSAGEを提案した。
原題: Self-Aware Active Learning Enables Continual Improvement in Autonomous Driving / Dong Hu, Chao Huang, Carman K. M. Lee 他
日本語で読む → - 論文VLAロボティクス
EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現する
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
原題: EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy / Zhirui Fang, Qingchi Yu, Ziyang Chen 他
日本語で読む → - 論文sim2realロボティクス
タスク関連特徴ダイナミクスの忠実度がロボット超音波走査のゼロショットsim-to-real転送を可能にする
シミュレーションと実機の間で、プローブ動作に伴うタスク関連の特徴変化の一貫性(TR-FDF)を保つことで、実機データなしで訓練したポリシーが高成功率でゼロショット転送できることを示した。
原題: Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning / Yizhao Qian, Jiayuan Luo, Wanyi Zhu 他
日本語で読む → - 論文軌道検証ロボティクス
LARC: ロボットマニピュレータ軌道の遅延適応到達可能性認証
軌道の連続時間安全性を効率的に検証するため、区間を適応的に分割して認証する手法を提案。固定細分割と同等の判定精度を維持しつつ、計算量を大幅に削減した。
原題: LARC: Lazy Adaptive Reachability Certification of Robot Manipulator Trajectories / Yu Feng, Hao Wu, Yuzhe Wang 他
日本語で読む → - 論文VLA/蒸留/操作制御
対称性を活用した視覚言語行動蒸留によるロボット操作
大規模VLAモデルの知識を、操作タスクの幾何学的対称性を利用して小型の学生ポリシーに蒸留するフレームワークを提案し、サンプル効率と汎化性を向上させた。
原題: SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation / Hyewon Choi, Donggyu Kim, Soojean Han
日本語で読む → - 論文強化学習ロボティクス
SmoothRL: 非同期実行中のオンライン強化学習
事前学習済みロボットポリシーを非同期推論ループ内でオンライン強化学習により微調整するフレームワークを提案。非同期実行を考慮した学習により、高レイテンシ環境でもスムーズな制御を実現する。
原題: SmoothRL: Online Reinforcement Learning During Asynchronous Execution / Guang Gao, Yuxuan Nong, Baifu Huang 他
日本語で読む → - 論文敵対的攻撃画像認識
テキスト誘導拡散モデルによる胸部X線画像への敵対的攻撃
胸部X線画像の分類モデルに対する、テキスト条件を最適化する拡散ベースの敵対的攻撃手法を提案し、既存の画素操作攻撃よりも高い攻撃成功率と画像品質を実現した。
原題: Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images / Basudha Pal, Arjun Narayanan, Neha Ajith 他
日本語で読む → - 論文Human-Robot Collaborationロボティクス
誤った例を用いたロボットポリシーの人間への教授法
本論文は、教育分野で効果が知られる「誤った例」を用いてロボットの行動ポリシーを人間に教える手法を提案し、ユーザー実験によりその有効性を示した。
原題: Teaching Robot Policies to Humans Using Erroneous Examples / Rithika Narayan, Suresh Kumaar Jayaraman, Henny Admoni
日本語で読む → - 論文シミュレーションロボティクス
Agri-Sim: 温室ロボティクスにおける具現化知能評価のための農業シミュレーションプラットフォーム
温室環境での農業ロボット開発を支援するため、UnityとROS2を統合したシミュレーションプラットフォームを構築し、自律ナビゲーションと双腕トマト収穫の閉ループ評価を実証した。
原題: Agri-Sim: Agricultural Simulation Platform for Embodied Intelligence Evaluation in Greenhouse Robotics / Shuhan Shi, Zhenfeng Xue, Minghao Mei 他
日本語で読む → - 論文ワールドモデル機械学習
潜在計画は点群でも生き残るか?幾何学的観測のための行動条件付きJEPAワールドモデル
画像ベースのJEPAワールドモデルを点群観測に拡張し、潜在空間での計画が機能することを示した。特に、分布事前モデルが画像ベースと同等の性能を達成し、行動感応モデルが最も動きの多いシーンで最強の結果を得た。
原題: Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations / Fabio F. Oberweger, Michael Schwingshackl
日本語で読む → - 論文世界モデル機械学習
Flow-JEPA: フローマッチングによるJEPA世界モデルの堅牢な潜在ダイナミクス
JEPA世界モデルの決定論的予測を条件付きフローマッチングに置き換え、ノイズ下での堅牢性と成功率を向上させた。
原題: Flow-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models / Yanchen Huo, Ziying Song, Yadan Luo
日本語で読む → - 論文軌道計画ロボティクス
マルチモーダル経路から実行可能な軌道へ:4WISロボットのための軌道計画フレームワーク
4輪独立操舵ロボットの多様な動作モードを活用するため、モード拡張フロントエンド探索とモード一貫セグメント軌道最適化を組み合わせた軌道計画フレームワークを提案した。
原題: From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots / Runjiao Bao, Lin Zhang, Yongkang Xu 他
日本語で読む → - 論文構造最適化ロボティクス
ひずみエネルギー分布最適化に基づくロボットの体系的な軽量化手法
ロボットの軽量化を目的に、ひずみエネルギー密度を均一化するという基準に基づき、システム全体の最適化を部品ごとの最適化に分解する手法を提案した。ロボットアームの例で有効性を示した。
原題: Systematic Lightweight Method for Robotics Based on Strain Energy Distribution Optimization / Jingchen Li
日本語で読む → - 論文ナビゲーションロボティクス
CGFM-Nav: 意味ガイド型生涯マルチモーダル具現化ナビゲーションのための認知グラフフィールドメモリ
視覚言語ナビゲーションのための、明示的な関係メモリと連続的な空間直感を組み合わせた永続的なマルチモーダルシーン表現を提案し、目標検索と探索ガイダンスを統合したフレームワークを構築した。
原題: CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation / Yuxiang Xiao, Xibei Chen, Xin Zhou 他
日本語で読む → - 論文探索計画ロボティクス
意味的ガイド付き探索:画像空間ウェイポイントサンプリングによる非構造環境の探索
地上車両向けの探索フレームワークで、ピクセル単位の意味セグメンテーションをウェイポイント選択と経路最適化に統合し、地形の走行可能性や障害物、関心対象を考慮した意味的効用関数で探索目標を評価する。シミュレーションと実環境で性能を検証した。
原題: SGE: Semantically-Guided Exploration for Unstructured Environments via Image-Space Waypoint Sampling / Christopher Tatsch, Yu Gu
日本語で読む → - 論文共有自律ロボティクス
AUV運用における共有自律のための認知アーキテクチャ
オペレータの状況認識向上と負荷軽減のため、オントロジーと複数の大規模言語モデルを組み合わせた認知アーキテクチャを提案し、ミッションの実現可能性評価、計画、実行を支援する。
原題: A Cognitive Architecture for Shared Autonomy in AUV Operations / Niamh Ellis, Thi Tran, Ignacio Carlucho 他
日本語で読む →