論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文衝突処理cs.GR
凸衝突回避領域
変形物体の衝突処理を、各頂点の凸な可動領域を事前に構築して非貫通を明示的に保証する手法を提案。二次衝突や低次元接触にも対応し、XPBDなどと組み合わせて高効率に衝突処理を行う。
原題: Convex Collision-Free Regions / Tomoyo Kikuchi, Takashi Kanai
日本語で読む → - 論文移動操作ロボティクス
RLMM-Flow: 潜在空間強化学習を用いたフローベース移動操作フレームワーク
移動操作ロボットの全身動作生成を、専門家デモからのフローポリシー事前学習と潜在空間での強化学習後調整を組み合わせて改善するフレームワークを提案した。
原題: RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning / Shuhang Wang, Ziming Li, Hui Cheng
日本語で読む → - 論文意味的占有マッピングロボティクス
GEM-Occ: 視覚幾何学的証拠から身体化された意味的占有記憶へ
屋内エージェントのための階層的意味的占有マッピングを実現するため、新しいベンチマークHIOccと、局所的な視覚幾何学予測を一時的な証拠として扱い、永続的な階層記憶に融合するGEM-Occフレームワークを提案した。
原題: GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory / Hu Zhu, Bohan Li, Xianda Guo 他
日本語で読む → - 論文センサ融合/動的物体追跡ロボティクス
建設現場における動的物体検出と追跡:魚眼カメラとLiDARセンサ融合モデル
四足ロボットに搭載したLiDARと魚眼カメラのセンサ融合により、建設現場で動的物体をリアルタイムに検出・追跡するフレームワークを提案した。
原題: Dynamic Object Detection and Tracking in Construction: A Fisheye Camera and LiDAR Sensor Fusion Model / Yilong Chen, Huili Huang, Yong K. Cho
日本語で読む → - 論文VLAロボティクス
CLAP: 言語-動作接地による直接的なVLMからVLAへの適応
事前学習済みVLMを大規模なロボットデータで再学習せず、最小限のアーキテクチャ変更でVLAに変換する手法を提案。数値の動作系列の前に自然言語の動作記述を付与することで、VLMの言語分布を保ちつつ動作予測を可能にし、LIBEROで高い性能を達成した。
原題: CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding / Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya 他
日本語で読む → - 論文マニピュレーションロボティクス
SplatCtrl: ガウスシーン表現とリアクティブロボット制御による知覚-行動連携
3Dガウススプラッティングを用いたリアルタイムシーン再構築と衝突回避のためのリアクティブ制御を統合したフレームワークを提案し、動的環境でのロボットアーム制御を実現した。
原題: SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control / Siddarth Jain, Ho Jin Choi
日本語で読む → - 論文VLAロボティクス
世界行動モデルから具現化された脳へ:オープンワールド物理知能へのロードマップ
本論文は、物理世界で推論・行動できる汎用AIの実現に向けて、世界行動モデル(WAM)の進化を概観し、モデル役割・標準化・システム構成の3つのギャップを整理した上で、具現化された脳を中心とした共進化ロードマップを提案している。
原題: From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence / Yuanzhi Liang, Xufeng Zhan, Haibin Huang 他
日本語で読む → - 論文安全制御ロボティクス
D-SafeMPC: 拡散駆動型安全モデル予測制御と離散時間制御バリア関数
拡散モデルによる軌道生成に制御バリア関数と制御リアプノフ関数を組み込み、各ノイズ除去ステップでMPCが軌道を修正することで、安全で実行可能な軌道を生成する手法を提案した。
原題: D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions / Erdi Sayar, Ersin Daş, Joel W. Burdick 他
日本語で読む → - 論文マニピュレーションロボティクス
アクションマップポリシー:ピクセル分類による3D閉ループ操作の学習
ロボットの操作行動をカメラ画像平面上のピクセル位置として分類問題に変換し、高次元で多峰性の行動を効率的に学習する手法を提案。拡散ポリシーより高速で高精度な推論を実現。
原題: Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification / Haojie Huang, Zhang Ye, Linfeng Zhao 他
日本語で読む → - 論文HRI/動作生成ロボティクス
不確実性の解剖学:人間とロボットの協調作業における非言語コミュニケーションのためのロボットマニピュレータ動作の表現記述子
ロボットが知覚の不確実性を動作で表現するための数学的枠組みを提案し、Laban動作分析に基づいて不確実性状態を動作プリミティブにマッピングし、人間による認識実験で有効性を検証した。
原題: Anatomy of Uncertainty: Expressive Descriptors of Robotic Manipulator Motion for Non-verbal Communication in Human-Robot Collaboration / Ridhima Bector, Souravik Dutta, Poornima Ramachandran 他
日本語で読む → - 論文強化学習ロボティクス
VINE: 強化学習のための生成制御ポリシーの調整
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
原題: VINE: Taming Generative Control Policies for Reinforcement Learning / Rushuai Yang, Zhuo Han, Houlin Li 他
日本語で読む → - 論文VLA/ファインチューニングロボティクス
産業用ロボット操作における視覚言語行動モデルのLoRAファインチューニングの効率性
産業用ロボット操作タスクにおいて、大規模VLAモデルのLoRAファインチューニングが完全ファインチューニングと同等の性能を達成し、メモリ使用量を大幅に削減できることを示した。
原題: On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation / Finn Ferchau, Daniel Pommer, Cristian Axenie
日本語で読む → - 論文四足歩行ロボティクス
四足ロボットのための行動基盤:ABot-C0 テクニカルレポート
四足ロボット向けの汎用動作制御システムABot-C0を提案し、大規模データパイプラインとフローマッチングポリシーにより、動作追跡のスケーリング則を初めて実証した。
原題: Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report / Xufeng Zhao, Fuzhi Yang, Jianhui Chen 他
日本語で読む → - 論文SLAMロボティクス
DiffRadar: ガウス場を用いた微分可能な物理認識レーダーSLAM
レーダー観測を離散スキャンではなく微分可能な物理認識ガウス場としてモデル化し、ロボットの姿勢とシーン構造を同時最適化するリアルタイムレーダーSLAMシステムを提案した。
原題: DiffRadar: Differentiable Physics-Aware Radar SLAM with Gaussian Fields / Gaurav Bagwe, Xiaoyong Yuan, Yongji Wu 他
日本語で読む → - 論文ロボット展開/エージェント型AIAI
SPINE: エージェント型AIによるサイバー・物理ギャップの橋渡し
ロボットの展開に必要な専門的調整を自動化するエージェント型フレームワークSPINEを提案。初心者でも両腕ロボットのデバッグと展開を効率的に行えることを実証した。
原題: SPINE: Bridging the Cyber-Physical Gap with Agentic AI / Minkyu Ham, Dongho Kim, Chan Lee 他
日本語で読む → - 論文VLAロボティクス
表現アンカリングと言語-行動整合による汎化可能なVLAファインチューニング
事前学習済みVLMをロボットデモでファインチューニングする際に生じる表現劣化と言語-行動の不整合を防ぐため、凍結VLMからの層別蒸留と行動を離散方向ラベル化して同一観測で言語・行動を学習する手法を提案し、実機とシミュレーションで性能向上を確認した。
原題: Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment / Dwip Dalal, Shivansh Patel, Chahit Jain 他
日本語で読む → - 論文物理的HRI/計画ロボティクス
キャッチ、スロー、リピート:人間とロボットのパートナージャグリングのための計画
人間とロボットが協力してボールを投げ合うジャグリングを実現するための、リアルタイムの計画・制御アーキテクチャを提案した。予測トラッキングと軌道最適化を統合し、初心者から熟練者までの被験者で3ボールカスケードを達成した。
原題: Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling / Jonathan Rainer Lippert, Kai Ploeger, Abir Chowdhury 他
日本語で読む → - 論文ポーズ推定画像認識
SUFLECA: CADと画像の位置合わせのための特徴学習の大規模化
CADモデルと単一RGB画像の9Dポーズ(回転・並進・異方性スケール)を推定するゼロショット手法を提案。大規模なNOC教師付き学習で幾何学的特徴を獲得し、幾何学的整合性のあるマッチングで高精度な位置合わせを実現した。
原題: SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment / Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera 他
日本語で読む → - 論文評価方法機械学習
汎用ロボットポリシーの能動的実世界因子評価
ロボット操作ポリシーの性能を、タスク因子の組み合わせ空間を能動的に探索して効率的に評価する枠組みを提案し、実世界評価で試行数を20〜40%削減できることを示した。
原題: Active Real-World Factor-Based Evaluation for Generalist Robot Policies / Andrew Liao, Hanchen Cui, Karthik Desingh 他
日本語で読む → - 論文安全性評価ロボティクス
SafeRelBench: VLM駆動身体化エージェントのプロセス安全性を評価する空間関係認識ベンチマーク
VLM駆動の身体化エージェントの安全性を、物体の空間関係(支持・包含・近接)に着目して評価するベンチマークを提案し、タスク成功とプロセス安全性の乖離を明らかにした。
原題: SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents / Huaigang Yang, Ya Li, Min Ren 他
日本語で読む → - 論文目標追跡ロボティクス
IMMNet:モデルベースとデータ駆動のハイブリッド融合による機動目標追跡
機動目標追跡のためのIMMアルゴリズムに学習可能なニューラル部品を統合したハイブリッド手法を提案し、既存手法より高い追跡精度を実証した。
原題: IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking / Yixuan Zhao, Chaoqun Yang, Lin Gao 他
日本語で読む → - 論文3D再構成画像認識
G²SR: 高速かつメモリ効率的なガウスベース表面再構成のための幾何学的手法
少数視点のRGB画像から表面を再構成する際、2Dガウススプラットの対応関係を軽量ニューラルネットで検出・追跡し、多視点幾何で解析的に3Dスプラットへ変換する手法を提案。従来のエンドツーエンド法より高速でメモリ効率が良く、幾何精度も同等以上。
原題: G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction / Dasong Gao, Vivienne Sze, Sertac Karaman
日本語で読む → - 論文強化学習ロボティクス
fNIRS誘導強化学習によるロボット行動のオフライン学習手法
脳血流信号(fNIRS)を用いてロボットの強化学習を調整する手法を提案し、オフラインデータでも学習が可能であることを示した。
原題: An offline approach to fNIRS-guided reinforcement learning for robot behavior / Julia Santaniello, Madelaine Brower, Benson Jiang 他
日本語で読む → - 論文VLAロボティクス
DiMaS: 分布マッチングによる視覚言語行動モデルの制御
フローマッチング型の視覚言語行動モデル(VLA)に対して、内部表現の分布を移動させることで行動を細かく制御する手法DiMaSを提案した。従来の線形ステアリングがVLAでは効果が薄いことを示し、分布マッチングが有効であることを実証した。
原題: DiMaS: Distribution Matching for Steering Vision-Language-Action Models / Pegah Khayatan, Sara Meziane, Jayneel Parekh 他
日本語で読む → - 論文計画/記憶ロボティクス
MEMORA: 一人称視点ビデオからの身体化された行動記憶による推論と計画
ロボットの長期的な計画のために、一人称視点ビデオから経験を記憶し活用する「身体化された行動記憶」を実現するシステムを提案した。
原題: MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning / Zihao Yu, Xiu Yuan, Chongjie Zhang
日本語で読む → - 論文触覚/視覚統合ロボティクス
VTLoc: 視覚点群における学習ベースの触覚接触位置推定
触覚データと視覚点群を統合し、物体表面での接触位置を高精度に推定するフレームワークVTLocを提案した。幾何学的マルチモーダル整列と反復更新により、実世界100物体のベンチマークで精度を向上させた。
原題: VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds / Zhiyuan Wu, Zhuo Chen, Shan Luo
日本語で読む → - 論文世界モデル/ベンチマークロボティクス
KineBench: IDM不要の運動学的接地による身体化世界モデルのベンチマーク
身体化世界モデルの物理的整合性を評価するため、逆動力学モデルを使わずに生成動画から直接6Dエンドエフェクタ姿勢を抽出し、物理シミュレータで閉ループ検証する新しいベンチマークKineBenchを提案した。
原題: KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding / Zeyu Liu, Zhangzhe Zhu, Yang Zhang 他
日本語で読む → - 論文モデル検証/ペトリネット制御
制約駆動によるハイパーペトリネットの合成
ロボットシステムの動作を論理制約に従ってモデル化するため、観測可能な状態と実行可能な遷移を区別するハイパーペトリネット合成手法を提案した。
原題: Constraint-Driven Synthesis of Hyper Petri Nets / Maksym Figat, Alessandro Pinto
日本語で読む → - 論文動作キャプチャ画像認識
EgoExoMoCap: 分散型エゴ・エクソ人間動作キャプチャ
ヘッドマウントデバイスを装着した複数人が、自身と他者の動作を同時に推定する分散型フレームワークを提案。頭部・手首のトラッキングと画像特徴を組み合わせ、ノイズや遮蔽に頑健な動作再構築を実現した。
原題: EgoExoMoCap: Distributed Ego-Exo Human Motion Capture / Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang 他
日本語で読む → - 論文VLA/ロバスト性ロボティクス
両刃の剣としての推論:視覚-言語-行動モデルにおけるアーキテクチャと段階横断的ロバスト性
推論ステップを追加するとVLAモデルのロバスト性が向上するかを、3つのモデル(推論なし、テキストCoT、潜在反復ループ)で比較し、潜在反復モデルが最も脆弱であることを示した。また、推論出力を安全信号として利用する防御手法の限界も明らかにした。
原題: Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models / Tuan Duong Trinh, Naveed Akhtar, Basim Azam
日本語で読む →