論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
原題: FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment / Han Zhao, Jingbo Wang, Wenxuan Song 他
日本語で読む → - 論文制御/モデル学習ロボティクス
ニューラルKoopman演算子のスケーリング則
データ駆動型ニューラルKoopman演算子のサンプル数・潜在次元・制御性能の関係をスケーリング則として定式化し、2つの正則化で制御性能を改善した研究。
原題: Scaling Law of Neural Koopman Operators / Abulikemu Abuduweili, Yuyang Pang, Feihan Li 他
日本語で読む → - 論文ナビゲーションロボティクス
CoReLIN: 制約ベース推論によるゼロショット生涯対話型ナビゲーション
LLMとシーングラフを用いて、移動ロボットが障害物を移動させ経路を切り開きながら連続的な物体配置タスクをこなす生涯対話型ナビゲーション手法を提案。
原題: CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation / Apoorva Vashisth, Manav Kulshrestha, Pranav Bakshi 他
日本語で読む → - 論文VLAロボティクス
グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーション
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
原題: Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation / Zaijing Li, Bing Hu, Rui Shao 他
日本語で読む → - 論文強化学習ロボティクス
フローポリシー勾配によるロボット制御
フローマッチングを用いたポリシー勾配法を改良し、脚式移動やヒューマノイド動作追従、マニピュレーション、sim-to-real転移を実現した研究。
原題: Flow Policy Gradients for Robot Control / Brent Yi, Hongsuk Choi, Himanshu Gaurav Singh 他
日本語で読む → - 論文VLAロボティクス
Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースライン
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
原題: Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline / Wenxuan Song, Jiayi Chen, Xiaoquan Sun 他
日本語で読む → - 論文マニピュレーションロボティクス
外科手術ロボット把持におけるセンサレス高精度力制御のためのハイブリッドオフライン・オンライン強化学習
腱駆動手術器具の把持力を、遠位センサなしで高精度に制御するため、物理モデルとオフライン・オンライン強化学習を組み合わせたフレームワークを提案し、シミュレーションと実機で有効性を示した。
原題: Hybrid Offline-Online Reinforcement Learning for Sensorless, High-Precision Force Regulation in Surgical Robotic Grasping / Edoardo Fazzari, Omar Mohamed, Khalfan Hableel 他
日本語で読む → - 論文運動計画ロボティクス
知覚不確実性伝播が知覚ベース運動計画に与える影響
自動運転の運動計画において、知覚の不確実性を伝播させる手法とそのキャリブレーションが閉ループ性能に与える影響をnuPlanベンチマークで分析した。
原題: The Impact of Class Uncertainty Propagation in Perception-Based Motion Planning / Jibran Iqbal Shah, Andrei Ivanovic, Kelly Zhu 他
日本語で読む → - 論文マニピュレーションロボティクス
その価格は正しくない:ニューロシンボリック手法が構造化長期的操作タスクでVLAを上回り、エネルギー消費も大幅に低い
構造化された長期的操作タスクにおいて、PDDLベースのニューロシンボリック手法がファインチューニングされたVLAモデルより高い成功率と汎化性能を示し、訓練エネルギーも約2桁少ないことを実験的に示した。
原題: The Price Is Not Right: Neuro-Symbolic Methods Outperform VLAs on Structured Long-Horizon Manipulation Tasks with Significantly Lower Energy Consumption / Timothy Duggan, Pierrick Lorang, Hong Lu 他
日本語で読む → - 論文最適化ロボティクス
ODYN: ロボティクスとAIのための全シフト型非内点法二次計画法
制約の線形独立性を必要とせず、ウォームスタート性能に優れた新しい二次計画法ソルバODYNを提案し、ロボティクスやAIの応用で有効性を示した。
原題: ODYN: An All-Shifted Non-Interior-Point Method for Quadratic Programming in Robotics and AI / Jose Rojas, Aristotelis Papatheodorou, Sergi Martinez 他
日本語で読む → - 論文ロボット学習・フィードバックロボティクス
修正タイミングを活用した目標推論の強化
ロボットへの修正フィードバックにおいて、人が介入を決断するタイミングに着目し、その信号からロボットの動作特徴の特定や修正目標の迅速な推論、より精密なタスク制約の学習が可能かを検討した研究。
原題: Enhancing Goal Inference via Correction Timing / Anjiabei Wang, Shuangge Wang, Tesca Fitzgerald
日本語で読む → - 論文人間ロボット協調ロボティクス
推論か明示的意図伝達か:マルチモーダル性が完璧な予測器を忘れさせる理由
人間とロボットの協調物体運搬タスクで、意図予測器2種と明示的コミュニケーション2種を比較し、人間は性能向上よりも自然さを好むことを示した研究。
原題: When the Inference Meets the Explicitness or Why Multimodality Can Make Us Forget About the Perfect Predictor / J. E. Domínguez-Vidal, Alberto Sanfeliu
日本語で読む → - 論文マニピュレーションロボティクス
視覚・触覚・グラフ融合による適応的動的モダリティ拡散方策:マルチエージェントマニピュレーション
視覚・触覚・エージェント間位置グラフを適応的に統合する拡散方策を提案し、マルチエージェント協調マニピュレーションの把持安定性と衝突回避を改善した。
原題: ADM-DP: Adaptive Dynamic Modality Diffusion Policy through Vision-Tactile-Graph Fusion for Multi-Agent Manipulation / Enyi Wang, Wen Fan, Dandan Zhang
日本語で読む → - 論文自己位置推定ロボティクス
Graph-Loc: 低観測性・遮蔽環境下でのコンパクトな構造地図事前分布を用いたロバストなグラフベースLiDAR姿勢追跡
点と線の軽量グラフで表現した地図事前分布に対し、LiDARスキャンから抽出した点・線を不均衡最適輸送で対応付けることで、遮蔽や低観測性に強い姿勢追跡を実現した。
原題: Graph-Loc: Robust Graph-Based LiDAR Pose Tracking with Compact Structural Map Priors under Low Observability and Occlusion / Wentao Zhao, Yihe Niu, Zikun Chen 他
日本語で読む → - 論文VLAロボティクス
Vision-Language-Actionロボットのメタモルフィックテスト
VLAモデルを搭載したロボットのテストオラクル問題を緩和するため、メタモルフィック関係を提案し、入力変更が軌道に与える影響を評価する手法を検証した。
原題: Metamorphic Testing of Vision-Language Action-Enabled Robots / Pablo Valle, Sergio Segura, Shaukat Ali 他
日本語で読む → - 論文sim2realロボティクス
GeCo-SRT: ロボットのクロスタスクSim-to-Real転移のための幾何認識型継続適応
局所幾何特徴をドメイン・タスク不変な知識として活用し、継続的なSim-to-Real転移を可能にする幾何認識型Mixture-of-Expertsと優先経験再生を提案。新タスク適応でデータ効率を大幅に改善。
原題: GeCo-SRT: Geometry-aware Continual Adaptation for Robotic Cross-Task Sim-to-Real Transfer / Wenbo Yu, Wenke Xia, Weitao Zhang 他
日本語で読む → - 論文sim2real画像認識
SAGE: 身体性AIのためのスケーラブルなエージェント型3Dシーン生成
ユーザーが指定した身体性タスクを理解し、複数の生成器と評価器を組み合わせて物理的に妥当でシミュレータ対応の3D環境を自動生成するエージェントフレームワークを提案。
原題: SAGE: Scalable Agentic 3D Scene Generation for Embodied AI / Hongchi Xia, Xuan Li, Zhaoshuo Li 他
日本語で読む → - 論文ソフトアクチュエータロボティクス
ソフトロボティクス向け幾何学ベース空気圧アクチュエータ
CNC熱シール可能な制約層を導入し、予測可能な変形や極小曲げ半径、多状態駆動を実現する幾何学ベース空気圧アクチュエータを提案し、外骨格・触覚インタフェース・二足歩行ロボットで応用を示した。
原題: Geometry-based pneumatic actuators for soft robotics / Rui Chen, Daniele Leonardis, Domenico Chiaradia 他
日本語で読む → - 論文SLAM/視覚オドメトリ画像認識
FLIGHT: フィボナッチ格子を用いた実時間幾何学的方位推定
単眼動画からカメラの進行方向を推定するため、単位球面上のハフ変換をフィボナッチ格子で離散化する手法を提案し、ノイズや外れ値に頑健で高精度・高効率な推定を実現した。
原題: FLIGHT: Fibonacci Lattice-based Inference for Geometric Heading in real-Time / David Dirnfeld, Fabien Delattre, Pedro Miraldo 他
日本語で読む → - 論文磁気ロボット/医療ロボティクスロボティクス
透視画像制約下における磁気ロボット制御:Zernike多項式場モデリングと非線形MPC
低フレームレートでノイズの多い透視画像フィードバック下でも高精度に動作する磁気ロボット制御を提案し、脊椎ファントムでの薬剤送達実験でRMS誤差1.18mmを達成した。
原題: Fluoroscopy-Constrained Magnetic Robot Control via Zernike-Based Field Modeling and Nonlinear MPC / Xinhao Chen, Hongkun Yao, Anuruddha Bhattacharjee 他
日本語で読む → - 論文VLAロボティクス
FD-VLA:接触の多いマニピュレーションのための力蒸留視覚言語行動モデル
力センサを使わずに、視覚と言語から力覚を蒸留してVLAモデルに組み込み、接触を伴う器用な操作を可能にする手法を提案。
原題: FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation / Ruiteng Zhao, Wenshuo Wang, Yicheng Ma 他
日本語で読む → - 論文強化学習機械学習
因果的報酬整形による交絡に頑健な連続制御
オフラインデータから因果的ベルマン方程式を用いて報酬整形関数を自動学習し、未観測の交絡因子があっても連続制御タスクで安定した性能を実現する手法を提案。
原題: Confounding Robust Continuous Control via Automatic Reward Shaping / Mateo Juliani, Mingxuan Li, Elias Bareinboim
日本語で読む → - 論文模倣学習ロボティクス
力生成模倣学習:制御技術による位置軌道と力指令の橋渡し
位置軌道から力指令を生成するモデルを提案し、メモリなしモデルとフィードバック制御を組み合わせることで未知の軌道にも対応可能にした。
原題: Force Generative Imitation Learning: Bridging Position Trajectory and Force Commands through Control Technique / Hiroshi Sato, Sho Sakaino, Toshiaki Tsuji
日本語で読む → - 論文世界モデル画像認識
WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
原題: WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models / Yu Shang, Zhuohang Li, Yiding Ma 他
日本語で読む → - 論文VLA画像認識
JEPA-VLA:VLAモデルに動画予測埋め込みが必要な理由
動画で事前学習した予測埋め込み(V-JEPA 2)をVLAモデルに適応的に統合し、サンプル効率と汎化性能を大幅に向上させる手法を提案。
原題: JEPA-VLA: Video Predictive Embedding is Needed for VLA Models / Shangchen Miao, Ningya Feng, Jialong Wu 他
日本語で読む → - 論文VLAロボティクス
ABot-N0:多様な身体性ナビゲーションのためのVLA基盤モデルに関する技術報告
5種類のナビゲーションタスクを統一的に扱うVLA基盤モデルABot-N0を提案し、大規模データセット構築と7ベンチマークでのSOTA達成、実環境での長期ミッションを可能にした。
原題: ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation / Zedong Chu, Shichao Xie, Xiaolong Wu 他
日本語で読む → - 論文VLAロボティクス
マルチモーダル大規模言語モデルによる実時間状況推論
GPT-4oとTurtleBot 4を組み合わせ、家庭内の視覚情報から掃除開始の適切さを判断するシステムを構築し、文脈や価値観に基づく意思決定の可能性と課題を示した。
原題: Multimodal Large Language Models for Real-Time Situated Reasoning / Giulio Antonio Abbo, Senne Lenaerts, Tony Belpaeme
日本語で読む → - 論文マニピュレーションロボティクス
物体姿勢推定と再構成がロボット把持成功に与える影響のベンチマーク
物体の3D再構成と6D姿勢推定がロボット把持に与える影響を物理シミュレーションで評価する大規模ベンチマークを提案し、再構成の誤差よりも姿勢推定の空間誤差が把持成功を支配することを示した。
原題: Benchmarking the Effects of Object Pose Estimation and Reconstruction on Robotic Grasping Success / Varun Burde, Pavel Burget, Torsten Sattler
日本語で読む → - 論文ロボット学習ロボティクス
人間の選好モデリングと視覚運動予測による一人称視点人間動画からのロボットスキル学習
一人称視点の人間動画から、追跡点の運動予測と観測の一致度を報酬として定義し、ロボット上で強化学習を行うことで、実機ロボットのスキル学習を改善する手法を提案した。
原題: Human Preference Modeling Using Visual Motion Prediction Improves Robot Skill Learning from Egocentric Human Video / Mrinal Verghese, Christopher G. Atkeson
日本語で読む → - 論文マルチロボット計画ロボティクス
KGLAMP: 知識グラフで導く異種マルチロボットの適応的計画・再計画
知識グラフをLLMと組み合わせ、異種マルチロボットチームのPDDL計画を生成・動的に更新する枠組みを提案し、ベンチマークで性能を25%以上改善した。
原題: KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning / Chak Lam Shek, Faizan M. Tariq, Sangjae Bae 他
日本語で読む →