論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
LIRA: 視覚言語行動デコーディングのための局所クロスレイヤー情報ルーティング
VLAモデルにおいて、VLMの中間特徴をアクションデコーダにルーティングする新しい機構LIRAを提案。深さを考慮した局所ウィンドウで情報を集約し、既存のバックボーンや学習手法を変えずに性能を向上させる。
原題: LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding / Zhewei Zhang, Puyue Wang, Guanren Qiao 他
日本語で読む → - 論文操作ロボティクス
JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
原題: JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation / Xiao Liu, Yuguang Yang, Xi Wang 他
日本語で読む → - 論文ハプティックロボティクス
運動感覚ハプティックシステムにおける非線形仮想環境のクープマン表現
非線形仮想環境の力覚レンダリングにクープマン演算子を用いる手法を提案し、シミュレーションと実験で有効性を確認した。閉ループ安定性解析も行い、従来の受動性ベース手法より保守的でないことを示した。
原題: Koopman Representation of Nonlinear Virtual Environments in Kinesthetic Haptic Systems / Yanting Zhou, Jozsef Kövecses, James Richard Forbes
日本語で読む → - 論文深度推定画像認識
RGB基盤モデルの階層的監督による熱画像深度推定への転用
熱画像からの深度推定において、RGB基盤モデルの階層的表現を活用するフレームワークRGB-HSを提案し、複数レベルでの特徴整合と品質検証により性能を向上させた。
原題: Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision / Jie Hong, Tingtian Li, Xuesong Li 他
日本語で読む → - 論文VLAロボティクス
マルチモーダルロボットデモにおける指示と軌道の不一致の監査
ロボットのデモデータセットに含まれる、正しい動作だが誤った指示が付与されたデータを検出・修正する監査手法を提案した。
原題: Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations / Simon Holk, Ryosuke Takanami, Tatsuya Matsushima 他
日本語で読む → - 論文全身制御/学習ロボティクス
LooperMuscle: 構造化Mixture-of-Expertsによるヒューマノイド全身追従の高速かつ安定な学習
ヒューマノイドの全身追従タスクにおいて、高速学習手法FastSACの性能低下を、構造化MoEアクターと専門家認識型クリティック、寄与度ルーティングリプレイを組み合わせた閉ループ学習で改善し、PPOに近い精度を約45分で達成した。
原題: LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts / Boyi Liu, Qijin Li, Tianqi Yu 他
日本語で読む → - 論文監視/不確実性ロボティクス
仕様を守り続ける:不確実性下でのリアルタイム監視と海事ケーススタディ
不確実性下でロボットが複雑な仕様を満たすことを監視する枠組みを提案し、データ駆動の到達可能集合を用いてデータ要件を削減。海事ナビゲーションに適用し、シミュレーションと実機実験で有効性を示した。
原題: Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study / Elizabeth Dietrich, Hanna Krasowski, Emir Cem Gezer 他
日本語で読む → - 論文3D再構成画像認識
Swimm3R: 水中3D再構成のための媒質対応SfMとベータスプラッティング
水中環境での散乱や減衰による3D再構成の失敗を解決するため、媒質対応SfMとベータスプラッティングを組み合わせた統一フレームワークを提案し、新たな水中ビデオデータセットで有効性を示した。
原題: Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction / Minseong Kweon, Junaed Sattar
日本語で読む → - 論文VLAAI
Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?
ビデオ世界モデルと行動予測を組み合わせたWorld Action Models (WAMs)の計算負荷を減らすため、事前学習済みビデオTransformerを表現ハブとし、軽量な出力ヘッドをドッキングする新しい設計原理DoTを提案し、単層行動ヘッドを30層ビデオバックボーンに接続したFaster-WAMを実装。低遅延で競争力のある性能と汎化を実証した。
原題: Faster-WAM: Do World Action Models Need Deep Action Modules? / Liheng Ma, Rui Heng Yang, Zhanguang Zhang 他
日本語で読む → - 論文グリッパ/ハードウェアロボティクス
高帯域・透明な物理的相互作用のための超低インピーダンスロボットグリッパ
高減速比の伝達機構と外部センサに頼らず、ダイレクトドライブモータと低減速比の差動機構を組み合わせた9自由度3指グリッパを提案し、低インピーダンスで高帯域な物理的相互作用を実現した。
原題: Ultra-Low-Impedance Robotic Gripper for High-Bandwidth and Transparent Physical Interaction / Joon Lee, Ari Choi, Seokhwan Jeong
日本語で読む → - 論文触覚ロボティクス
ヒューマノイド向け形状適応型全身触覚:3Dプリント共形EITスキン
3Dプリントで作る曲面に沿った電気インピーダンス断層撮影(EIT)触覚スキンを提案し、平面・曲面・顔形状で接触位置推定を検証した。
原題: Toward Geometry-Scalable Whole-Body Touch for Humanoids: A 3D-Printed Conformal EIT Skin / Haofeng Chen, Carson Kohlbrenner, Jiri Kubik 他
日本語で読む → - 論文マニピュレーションロボティクス
AffordTrajDP: 動的アフォーダンス誘導によるロボット操作の視覚運動ポリシー学習
静的アフォーダンスの限界を克服するため、物体のSE(3)姿勢を媒体にアフォーダンス軌道を生成し、時間的に一貫した状態認識ガイダンスを提供する動的フレームワークを提案。ManiSkill3で70%の成功率を達成し、実機でも堅牢性を実証した。
原題: AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation / Gaoyuan Wu, Ziyu Shan, Haoyang Du 他
日本語で読む → - 論文pHRIロボティクス
ロボット支援入浴のための高忠実度な人間デモンストレーションの捕捉・再構築・転移
臨床医による入浴デモンストレーションを接触領域を基盤として高忠実度に記録し、そのデータを用いてソフトハンド搭載ロボットによる入浴動作を実現した。
原題: High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing / Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo 他
日本語で読む → - 論文VLA画像認識
Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデル
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
原題: Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models / Haodong Yan, Junfeng Li, Junjie He 他
日本語で読む → - 論文姿勢推定画像認識
カメラ校正誤差に対する証明可能な一次免疫を備えた差動6自由度姿勢推定
フレーム間の画像変位と既知の3D制御点からプラットフォームの6自由度運動を直接推定する差動法を提案し、並進の外部校正誤差が厳密に相殺されることを証明した。
原題: Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors / Yueqiang Zhang, Liang Deng, Yi Zhang 他
日本語で読む → - 論文身体化エージェント/記憶システムロボティクス
Mimir: インタラクティブ環境における身体化エージェントのための動的グラウンディングを備えたニューロシンボリック記憶システム
身体化エージェントの長期タスク遂行を改善するため、世界記憶とタスク記憶を分離し、行動前に動的にグラウンディングするニューロシンボリック記憶システムMimirを提案した。
原題: Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments / Haoming Xu, Zhenlin He, Hengyi Wang 他
日本語で読む → - 論文群制御ロボティクス
機械内の形態的多様性による環境レジリエンス
生物が内部の多様な部品間の相互作用を通じて環境変化に適応する仕組みを、機械の結合体で再現し、内部の物理的逆境が外部環境への耐性を高めることを示した。
原題: Environmental resilience via morphological diversity within machines / Alice Hein, Josh Bongard
日本語で読む → - 論文VLA/解釈可能性ロボティクス
VLA表現からのタスク進捗の解読
視覚言語行動モデル(VLA)の内部表現からタスクの進捗状況が線形に読み取れることを発見し、それを用いたラベル不要の異常検出器を提案した論文。
原題: Decoding Task Progress from VLA Representations / Atiksh Bhardwaj, Edward Weiyi Duan, Prithwish Dan 他
日本語で読む → - 論文LLM/海上航行AI
実海域の航海シナリオにおける状況理解とCOLREG遵守のためのLLM能力の探求
AISデータから作成した50の実世界の航海シナリオを用いて、大規模言語モデル(LLM)が海上航行規則(COLREG)と「良き船乗り」の慣行を理解し、適切な行動を推論できるかを評価した。その結果、微調整なしでは大きなオンラインモデルでもこのタスクは難しいことが示された。
原題: Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios / Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen 他
日本語で読む → - 論文群制御ロボティクス
PRIMAL3: 強化学習と模倣学習によるマルチエージェント経路探索 - LaCAM3を活用した大規模フレームワーク
本論文は、強化学習と模倣学習を統合した大規模マルチエージェント経路探索フレームワークPRIMAL3を提案し、ボトルネックや行き止まりなどの重要な状態でのエージェント間の協調を改善する。
原題: PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3 / Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps 他
日本語で読む → - 論文世界モデル画像認識
ワールドモデリングはどこへ向かうのか?
エージェントの継続的改善のための世界モデルの概念を、物理状態遷移からエージェント中心の情報遷移へと拡張し、6つのプロキシ形式と3つの活用レベルを提案する。
原題: Quo Vadis, World Modeling? / Yu Yang, Xuemeng Yang, Licheng Wen 他
日本語で読む → - 論文産業用自動化ロボティクス
RAGベースの産業用フィールドバス機器自動設定
産業用機器の設定を自動化するパイプラインを提案。PDFマニュアルからハイブリッド検索とLLMで設定を生成し、安全ゲートで誤動作を防ぐ。
原題: RAG-Based Auto-Configuration for Industrial Fieldbus Devices / Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi
日本語で読む → - 論文VLAロボティクス
抑制は効くが局所性は脆い:VLAポリシーにおけるタスクベクトル否定の閉ループ標的・制御監査
マルチタスクの視覚言語行動(VLA)ポリシーからタスクベクトルを引き算したときの挙動を、全10スキルで監査し、抑制可能・抵抗・全崩壊の3つの様式があることを示した。
原題: Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies / Shaoguang Wang, Weiyu Guo, Rushi Dai 他
日本語で読む → - 論文VLAロボティクス
HarnessWAM:世界行動モデルにおける予測と熟考の橋渡し
世界行動モデル(WAM)の予測と実行のギャップを埋めるエージェントフレームワークを提案。視覚言語モデルによるタスク管理とイベント駆動の二重タイムスケールフィードバックで、複雑なタスクの計画・実行・失敗回復を実現する。
原題: HarnessWAM: Bridging Prediction and Deliberation in World Action Models / Zhaopeng Gu, Bingke Zhu, Tianxi Lin 他
日本語で読む → - 論文世界モデル画像認識
行動制御可能な世界モデルにおける統計的バイアスの克服
行動条件付き世界モデルが統計的ショートカットに依存する問題を指摘し、反事実的一貫性フレームワークCoCoを導入して行動制御性を向上させた。
原題: Overcoming Statistical Bias in Action-Controllable World Models / Yuhong Shi, Zhenhao Chu, Jie Wei 他
日本語で読む → - 論文多物体追跡画像認識
GenTrack3: クラスタ認識型関連付けを用いた確率的・決定的ハイブリッドオンライン多物体追跡
決定論的手法と確率的手法を統合したオンライン多物体追跡フレームワークを提案し、スケーラブルなトラック検出マッチング手法を導入して群追跡を支援する。
原題: GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association / Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft 他
日本語で読む → - 論文VLAロボティクス
時間で検索し、周波数で補正する
凍結された視覚言語行動ポリシーの性能を、訓練なしのテスト時補正フレームワークで向上させる。成功軌道からの低周波残差を転送し、長期的な操作タスクの成功率を改善する。
原題: Retrieve in Time, Correct in Frequency / Yuze Fan, Yue Cao, Pengjie Gao 他
日本語で読む → - 論文経路計画ロボティクス
SCOPE: 未知3D環境における視野を考慮した安全ボリューム認証による経路計画
ロボット搭載の限られた視野センサで、移動前に意図した動作の安全ボリューム全体を観測・検証することを要求し、これをオンラインで認証する経路計画フレームワークSCOPEを提案。未知環境での安全なナビゲーションを実現し、シミュレーションと実機で有効性を示した。
原題: SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification / Junbin Yuan, Muqing Cao, Yunwoo Lee 他
日本語で読む → - 論文人間ロボット協調ロボティクス
隠れた目標下でのゼロショット人間ロボット協調のための構造化LLM推論
プライベートな目標を持つ協調構築タスクにおいて、LLMを用いた構造化アーキテクチャで心の理論推論と階層的計画を組み合わせ、ゼロショットで人間とロボットの協調を実現する手法を提案した。人間実験で、従来の強化学習ベースラインより少ないインタラクション数と高い信頼評価を達成した。
原題: Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals / Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo 他
日本語で読む → - 論文位置推定ロボティクス
惑星探査ドローン向けテザー慣性位置推定
惑星探査用UAVの位置推定を、テザー(ケーブル)の長さと角度の計測と慣性センサを組み合わせて行う新しい手法を提案。ケーブルのたるみをモデル化し、ガウス過程で誤差を補正することで、高精度な位置推定を実現した。
原題: Tether-Inertial Localization for Planetary Drones / Dielof van Loon, Anton Bredenbeck, Lennart Puck 他
日本語で読む →