論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/24 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文グラフ説明可能性機械学習
グラフ上の説明可能な説明を用いた介入仮説の生成:G2I、二段階貪欲フレームワーク
グラフニューラルネットワークの予測を介入設計に活用するため、局所的な反事実説明を貪欲探索で生成し、それを解釈可能なルールに変換してネットワーク全体の介入選択をDNF被覆問題として解くフレームワークを提案した。
原題: Generating Intervention Hypotheses using Explainable Explanations on Graphs: G2I, a Two-Stage Greedy Framework / Mulin Tian, Ajitesh Srivastava
日本語で読む → - 論文経路計画ロボティクス
VikPath: 自己教師あり経路探索における効果的な障害物回避のためのビジョンKansformerフレームワーク
障害物回避と経路の滑らかさを考慮した自己教師あり経路探索フレームワークを提案し、ラベルなしで障害物分布を学習する新しいVision Kansformerモジュールを導入した。
原題: VikPath: A Vision Kansformer Framework for Effective Obstacle Avoidance in Self-Supervised Pathfinding / Junyao Wang, Yulin Xu, Mohammad Abdullah Al Faruque
日本語で読む → - 論文VLA/操作ロボティクス
必要な時だけ考える:視覚言語行動操作における選択的スローパス介入のためのプロンプト権限制御
凍結された視覚言語行動(VLA)ポリシーに検索テキストを追加すると、プロンプト形式の変化が実行を支配し成功率が大幅に低下する「プロンプト形式崩壊」を特定し、候補生成とポリシー入力変更の許可を分離するプロンプト権限インターフェースTOWN-VLAを導入。これにより、シミュレーションと実機で成功率が向上した。
原題: Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation / Zhiruo Zhou, Zelin Li, Xiwen Chen 他
日本語で読む → - 論文進化ロボティクスロボティクス
適応的制御学習によるロボット形態進化ダイナミクスの形成
ロボットの形態と制御の共進化において、制御学習が形態進化に与える影響を分析し、早期の適応度評価が真の潜在能力を過小評価して形態多様性を損なうことを示し、そのバイアスを補正するAdaControlを提案した。
原題: Shaping the Evolutionary Dynamics of Robot Morphology via Adaptive Control Learning / Junru Song, Yang Yang, Yaqing Xu 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
InstructMove: 指示追従操作のためのテキスト必須ベンチマーク
視覚的に顕著な物体や唯一の動作候補に頼らず、言語指示にのみ従って正解が決まる「テキスト必須」な操作ベンチマークInstructMoveを提案し、VLAモデルの指示追従能力を診断・改善する。
原題: InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation / Mengao Zhao, Ziang Li, Chaodong Huang 他
日本語で読む → - 論文統計物理ロボティクス
一様カーパーキングの厳密な有限長理論:空間法則、吸収、凝集
有限長の線分上での一様カーパーキング過程(ランダム逐次吸着)について、厳密な有限長理論を展開し、駐車位置の同時密度や統計量を効率的に計算する方法を提案した。
原題: Exact Finite-Length Theory of Uniform Car Parking: Spatial Laws, Absorption, and Aggregation / Ganesh P Kumar
日本語で読む → - 論文VLAロボティクス
意図を持って行動する:視覚言語行動モデルのための行動意図の蒸留
視覚言語行動モデルの行動デコーダに、将来の行動の意図を蒸留する手法を提案し、シミュレーションと実世界のタスクで成功率を向上させた。
原題: Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models / Sangoh Lee, Sangwoo Mo, Wook-Shin Han
日本語で読む → - 論文キャリブレーション画像認識
異種イベント-RGBステレオシステムのための簡略化されたクロスモーダルキャリブレーション
イベントカメラとフレームカメラの外部キャリブレーションを、動きを必要とせず、標準ディスプレイ上の変調ChArUcoターゲットを用いて簡易化する手法を提案。再投影誤差を既存手法より低減し、ロボットのアイツーハンドキャリブレーションでの実用性も示した。
原題: Simplified Cross-Modal Calibration for Heterogeneous Event-RGB Stereo Systems / Nico Hessenthaler, Adam T. Müller, Nicolaj C. Stache
日本語で読む → - 論文画像生成画像認識
MIVIFI:多視点魚眼画像生成モデルの訓練のための視点と魚眼ドメインの橋渡し
自動運転のための多視点魚眼画像生成を、等距離円筒投影を用いたクロスドメイン学習で実現し、データ不足を克服した。
原題: MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models / Matthias Neuwirth-Trapp, Begüm Altunbas, Jiayi Wang 他
日本語で読む → - 論文RL/遅延対応ロボティクス
待ち時間に学習する:推論遅延下での汎用ロボットポリシーのRLファインチューニング
推論遅延がRLのマルコフ性を壊す問題に対し、非同期推論と状態拡張で遅延を隠蔽しつつRL改善を可能にするフレームワークARLIを提案。シミュレーションと実機で有効性を実証した。
原題: Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency / Brian Zhu, Momen Khalil, E Harrison 他
日本語で読む → - 論文オンライン学習ロボティクス
自由エネルギーゲート可塑性による物理的ヒューマンロボットインタラクションにおけるリアルタイムオンライン運動学習
予測符号化に基づく変分リカレントニューラルネットワークを拡張し、変分自由エネルギーに応じて学習率を調整する自由エネルギーゲート可塑性を提案。ランダム初期化ネットワークがオフライン事前学習なしで3つの周期的運動パターンを獲得し、既存パターンの保持性能を向上させた。
原題: Free-Energy-Gated Plasticity for Real-Time Online Motor Learning in Physical Human--Robot Interaction / Hiroki Sawada, Jun Tani
日本語で読む → - 論文非言語行動生成AI
仮想人間のための不一致な言語・非言語行動のLLMベース選択
仮想エージェントの非言語行動生成において、発話内容と矛盾する行動を大規模言語モデルで選択する手法を提案し、人間による評価を行った。
原題: LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans / Parisa Ghanad Torshizi, Stacy Marsella
日本語で読む → - 論文VLA画像認識
Object-Uni: オブジェクト中心の空間理解と制御可能な生成のための統一モデル
オブジェクトの姿勢を明示的な幾何変数として扱い、姿勢認識・空間推論・姿勢条件付き生成・新規視点合成を統一したモデルを提案。視点ベースの姿勢抽象化とオブジェクトトークンに基づく姿勢アンカーにより、連続的な姿勢の理解と生成を実現する。
原題: Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation / Mining Tan, Yinuo Wang, Ziqi Zhou 他
日本語で読む → - 論文手術認識画像認識
手術トリプレット認識の最適化:知識駆動型Mixture-of-Expertsソリューション
手術映像から器具・動作・対象のトリプレットを認識するタスクで、成分間・カテゴリ間の最適化競合を解消し、知識駆動のMoE機構で表現を強化するフレームワークを提案した。
原題: Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution / Yiyi Zhang, Yuchen Yuan, Ying Zheng 他
日本語で読む → - 論文マニピュレーションロボティクス
CSymPlan:高自由度マニピュレータのための認定シンボリックプランニングと制御
高自由度マニピュレータの動作生成を、プランナーと制御器の分離による問題を解決するため、認定されたシンボリックプランニングと制御フレームワークを提案。オフラインとオンラインの2つの実装で、安全な到達回避タスクを実現する。
原題: CSymPlan: Certified Symbolic Planning and Control for High-DOF Manipulators / Aditya Narendra, Ashok Kumar Saini, Mahathi Anand 他
日本語で読む → - 論文VLAロボティクス
UniMem: 視覚言語行動モデルのためのマルチモーダル記憶と制御の統合
長期的な記憶を必要とするタスクで性能が低下するVLAモデルに対し、イベント分類器とキーフレームエンコーダを用いて記憶と制御を単一モデルに統合するフレームワークを提案し、シミュレーションと実機で既存手法を上回る性能を達成した。
原題: UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models / Lars Osterberg, Maggie Wang, Mac Schwager
日本語で読む → - 論文セマンティックセグメンテーション画像認識
Contextrast++: セマンティックセグメンテーションのためのロバストなマルチスケール文脈対比学習
セマンティックセグメンテーションの性能向上のため、文脈対比学習と境界認識ネガティブサンプリングを組み合わせた新しい対比学習手法を提案した。
原題: Contextrast++: Robust Multi-Scale Contextual Contrastive Learning for Semantic Segmentation / Changki Sung, Hyungtae Lim, Wanhee Kim 他
日本語で読む → - 論文歩行ロボティクス
誘導リーマン最適化(GuRO):モデル予測制御と決定トランスフォーマーの橋渡し
MPCの局所最適軌道予測で決定トランスフォーマーを誘導し、リーマン空間での曲率考慮最適化により非凸損失を効率的に学習する新しいフレームワークを提案。高次元四足歩行制御で既存手法を上回る性能を実証した。
原題: Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers / Hossein Abdi, Satya Prakash Dash, Mingfei Sun
日本語で読む → - 論文ナビゲーションロボティクス
OptiSight:意味推論と幾何制御を橋渡しする身体化ナビゲーション
視覚言語モデルによる意味推論と視覚サーボによる幾何制御を組み合わせたハイブリッドな屋内ナビゲーション手法を提案。AI Habitatでのゼロショット実験で有効性を確認。
原題: OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation / Alperen Avan, Jordi Sanchez-Riera
日本語で読む → - 論文世界モデル機械学習
MOSH-WM: マスク接地ソフトハミルトン力学によるオブジェクト中心世界モデル
オブジェクト中心の世界モデルで、マスクの空間モーメントから位置・運動量状態を構成し、学習したエネルギーでソフトな方向バイアスを与えて将来映像を予測する手法を提案。OBJ3DとCLEVRERで既存手法より高精度な予測を達成。
原題: MOSH-WM: Mask-Grounded Soft-Hamiltonian Dynamics for Object-Centric World Models / Zhekai Wang, Haoxiang Huang, Xiang Liu 他
日本語で読む → - 論文SLAM/ナビゲーションロボティクス
SuperMap: 視覚言語ナビゲーションのための時空間SLAMシステム
高頻度の幾何SLAMと非同期のオープンボキャブラリ知覚を統合し、物体の同一性維持と古い地図情報の整理を行う4D時空間マッピングフレームワークを提案。
原題: SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation / Shibo Zhao, Guofei Chen, Honghao Zhu 他
日本語で読む → - 論文UAVナビゲーションロボティクス
RACO: 点検指向UAV視覚言語ナビゲーションのための信頼性を考慮した粗目標最適化
UAVの視覚言語ナビゲーションにおいて、点検用途では目標領域内で停止し、類似する偽目標を避ける必要があるが、既存の粗密ナビゲーションは粗目標の信頼性を考慮せず失敗する。本論文では、この問題を評価するベンチマークLG-UVIを導入し、粗目標を実行時仮説として扱い、物体レベルのアンカーで補正するRACOフレームワークを提案する。
原題: RACO: Reliability-Aware Coarse-Goal Optimization for Inspection-Oriented UAV Vision-Language Navigation / Sen Wang, Yiming Sun, Jiaxuan He 他
日本語で読む → - 論文マニピュレーションロボティクス
ブラウザ制御と混合ステッパードライバ構成による再現可能な視覚誘導6自由度ロボットアーム
低コストで再現可能な6自由度ロボットアームを設計・製作し、混合ステッパードライバ構成とブラウザネイティブ制御、視覚パイプラインによる自動ピックアンドプレースを実現した。
原題: Reproducible Vision-Guided 6-DoF Robotic Manipulator with a Mixed Stepper-Driver Architecture and Browser-Native Control / Lasan Perera, Deneth Priyadarshana, Dulana Pitiwaduge 他
日本語で読む → - 論文医用画像合成画像認識
VeCAS: 血管介入のための血管焦点型無造影剤血管造影合成
非造影X線画像から血管造影画像を合成する2段階フレームワークを提案し、血管構造の局在化と造影外観の合成を分離することで、高品質な合成を実現した。
原題: VeCAS: Vessel-Focused Contrast-Free Angiogram Synthesis for Vascular Interventions / De-Xing Huang, Chen-Yu Wang, Hao Liang 他
日本語で読む → - 論文空間認識ロボティクス
概念誘導型探索:持続的で行動可能なシーングラフの構築
ロボットが事前のメトリックマップなしに、部屋やドアなどの概念エージェントが協調してシーングラフを能動的に構築する概念優先アーキテクチャを提案した。
原題: Concept-Guided Exploration: Building Persistent, Actionable Scene Graphs / Noé Zapata, Gerardo Pérez, Alejandro Torrejón 他
日本語で読む → - 論文操作学習ロボティクス
Triplet2Track: オブジェクト中心表現を用いた信頼性の高い長期的操作のための階層システム
長期的なロボット操作の信頼性を高めるため、人間の動画を活用し、高レベルのサブゴールをインスタンスに基づくトリプレットとして表現し、実行とオンライン再計画を行う閉ループ模倣学習システムを提案した。
原題: Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation / Jianxiang Liu, Gaojing Zhang, Chuan Wen 他
日本語で読む → - 論文VLAロボティクス
ROS2SmolVLA: 産業用軽量ロボットへの小型視覚言語行動モデル統合の実現
産業用ロボットに小型VLAモデルを統合するためのROS 2インターフェースを開発し、実機でのピックアンドプレース検証を行った。
原題: ROS2SmolVLA: Enabling Small Vision-Language-Action Models for Integration into Industrial-Grade Lightweight Robots / Nils Mandischer, Noah Böckmann, Ludwig Holl 他
日本語で読む → - 論文VLA/操作ロボティクス
Pointing-VLA: 視覚言語行動操作のための型付き空間接地インターフェース
VLAモデルの空間接地をテキスト座標ではなく型付きヘッドで直接予測し、実行契約によりPICKとPLACEを分離。Bridge/WidowXでSOTAを達成し、実ロボット成功率を52.7%から80.7%に向上させた。
原題: Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation / Xiwen Chen, Zelin Li, Zhiruo Zhou 他
日本語で読む → - 論文ロボット学習/汎化ロボティクス
物理フィルタリングがロボット学習の汎化を促進する
この論文は、物理フィルタリングによるフィードバック機構(PhyFilter)を提案し、限られた訓練データでもロボットが動的環境の不確実性に対して効果的に汎化できることを示した。
原題: Physics Filtering Favors the Generalization of Robot Learning / Jindou Jia, Shixuan Han, Meng Wang 他
日本語で読む → - 論文キャラクター制御画像認識
統一潜在空間における異種スキルの段階的学習
物理ベースのキャラクター制御において、多様なデータ・教師信号・タスクから得た異種スキルを統一潜在空間で段階的に学習するフレームワークHetSkillsを提案。モーション追跡、テキストからのモーション生成、モーション補完、下流タスク適応で有効性を示した。
原題: Progressively Learning Heterogeneous Skills in a Unified Latent Space / Yue-Yi Zhang, Ming Gong, Linpu He 他
日本語で読む →