論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文安全強化学習機械学習
モデル予測制御のアイデアを用いた安全な強化学習
強化学習の探索中に安全制約を厳守するため、モデル予測制御で計算した安全な状態-行動空間への射影を安全フィルタとして用いる枠組みを提案し、実機で検証した。
原題: Safe Reinforcement Learning using Ideas from Model Predictive Control / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文VLA/推論ランタイムロボティクス
Embodied.cpp: 異種ロボット向け具現化AIモデルのポータブル推論ランタイム
VLAモデルや世界行動モデルなどの具現化AIモデルを、異なるロボットやエッジデバイス上で効率的に実行するためのC++推論ランタイムを提案。モジュール化された5層構造により、多レート実行や低遅延推論を実現し、Pythonベースラインと比較して1.05〜2.70倍の高速化とVRAM削減を達成した。
原題: Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots / Ling Xu, Borui Li, Hao Wu 他
日本語で読む → - 論文ロバスト制御制御
GPU並列線形化誤差境界による非線形・ニューラルネットワーク動力学のリアルタイムロバスト最適制御
非線形およびニューラルネットワーク動力学の線形時変近似に対する厳密で微分可能な線形化誤差境界をGPU上で並列計算し、ロバスト制御のリアルタイム最適化を実現した。
原題: GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics / Jeffrey Fang, Keyi Shen, Anutam Srinivasan 他
日本語で読む → - 論文VLAロボティクス
CoRE-VLA:条件付きエキスパートルーティングによるスケーラブルで堅牢な視覚言語行動モデリング
センサ欠落や多様な構成に頑健なVLAモデルを提案し、センサ可用性とタスク意図に基づく条件付きスパース計算でエキスパートをルーティングする。
原題: CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts / Haozhe Zhang, Sixian Li, Yifei Zhang 他
日本語で読む → - 論文ワールドモデルロボティクス
3Dポイントワールドモデル:点群補完による高精度なダイナミクス学習
部分点群を補完してから行動条件付きダイナミクスを学習する、3D空間で動作するタスク非依存のワールドモデルを提案し、長期的なロールアウトとモデルベース計画の精度を向上させた。
原題: 3D Point World Models: Point Completion Enables More Accurate Dynamics Learning / Skand Peri, Hung Nguyen, Chanho Kim 他
日本語で読む → - 論文安全性/VLAロボティクス
制約付きフローマッチングによる視覚言語行動モデルのための神経記号的安全性ガイダンス
フローマッチングに基づくVLAモデルに対し、予測軌道のノイズ除去過程で安全制約を最適化問題として適用し、衝突を予測的に回避する手法を提案した。
原題: Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching / William English, Hao Zheng, Rickard Ewetz
日本語で読む → - 論文VLA/世界モデルロボティクス
DREAMSTEER: 潜在世界モデルによるVLAポリシーの展開時誘導(微調整不要)
事前学習済みの視覚言語行動(VLA)ポリシーを、微調整なしで展開時に潜在世界モデルと価値モデルを用いて誘導し、分布シフト下での成功率と指示追従精度を大幅に向上させるフレームワークを提案した。
原題: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning / Hanchen Cui, Sergio Arnaud, Arjun Majumdar 他
日本語で読む → - 論文SLAM画像認識
リアルタイムLiDARガウシアンスプラッティングSLAM
LiDARの幾何情報を活用し、高速なG-ICPレジストレーションと球面ラスタライズによる高密度マッピングを組み合わせたリアルタイムSLAMフレームワークを提案。局所共分散を用いたガウシアン初期化と幾何スコアによる刈り込み・高密度化で、オンライン軌跡で高精度かつ高速なマッピングを実現。
原題: Real-Time LiDAR Gaussian Splatting SLAM / Seungjun Tak, Yewon Jeon, Jaeik Hwang 他
日本語で読む → - 論文マニピュレーションロボティクス
巧みな操作のための最小限のリターゲティング誘導強化学習レシピ
人間のデモ1つから、リターゲティングと強化学習を組み合わせて多指ロボットハンドの器用な操作ポリシーを学習し、実機にゼロショット転送する手法を提案した。
原題: A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation / Yunhai Feng, Natalie Leung, Jiaxuan Wang 他
日本語で読む → - 論文強化学習/操作ロボティクス
HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
原題: HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models / Angen Ye, Weijie Ke, Xiaofeng Wang 他
日本語で読む → - 論文ベンチマークロボティクス
RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマーク
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
原題: RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies / Tianxing Chen, Yue Chen, Zixuan Li 他
日本語で読む → - 論文全身制御ロボティクス
Athena-WBC: 能力に合わせたポリシー専門家による長尾的人型全身制御
人型ロボットの全身運動追従制御において、訓練データの長尾部分(高ダイナミクス遷移やバランス重視動作)が解けない問題を、動作要求と訓練手法の能力ミスマッチと捉え、動的専門家とバランス専門家を備えた教師-学生パイプラインを提案し、少数の専門家でベースラインを上回る性能を達成した。
原題: Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control / Yuan Jiang, Ningyuan Zhang, Xicun Yang 他
日本語で読む → - 論文データ生成ロボティクス
PRISM: 画像ベースのシーン・動作合成によるパーソナライズドロボットデータセット生成
単一画像と自然言語指示から、ユーザ環境に適合した多様なデジタル双子シーンと実行可能なデモを自動生成し、ロボットポリシー学習用のパーソナライズドデータセットを構築するパイプラインを提案。
原題: PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis / Dogyu Ko, Haneul Kim, Chanyoung Yeo 他
日本語で読む → - 論文VLAロボティクス
WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦する
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
原題: WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time / Yusen Feng, Bingchen Han, Jiangran Lyu 他
日本語で読む → - 論文VLAロボティクス
ロボット操作のための視覚言語行動モデルにおける二重潜在記憶
視覚言語行動モデルに、過去の経験を潜在記憶トークンとして統合するフレームワークを導入し、長期依存タスクの性能を向上させた。
原題: Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation / Hongyu Qu, Jianzhe Gao, Xiaobin Hu 他
日本語で読む → - 論文社会的ナビゲーションロボティクス
ロボットが道を尋ねる:コミュニケーション可能な社会的ナビゲーション
複数人がいる環境で、ロボットが住民に情報を尋ねながら目的の人物を探す新しいタスク「CommNav」を提案し、Habitat 3.0を拡張したシミュレータで評価した。
原題: Robots Ask the Way: Communication-Enabled Social Navigation / Valentino Sacco, Luca Scofano, Indro Spinelli 他
日本語で読む → - 論文SLAM/水中マッピングロボティクス
パミールのマッピング:水中難破船のマルチセッションビジュアル慣性SLAMと3次元再構成
手頃なアクションカメラとダイブコンピュータの深度データを用いて、水中環境のマルチセッションマッピングを行うフレームワークを提案し、バルバドス沖の難破船の外部と内部を複数セッションで3次元再構成した。
原題: Mapping Pamir: Multi-Session Visual-Inertial SLAM and 3D Reconstruction of an Underwater Shipwreck / Michalis Chatzispyrou, Luke Horgan, Hyunkil Hwang 他
日本語で読む → - 論文器用操作/ベンチマークロボティクス
DexVerse: 多タスク・多形態の器用操作のためのモジュール型ベンチマーク
多様な操作スキル、ロボット形態、視覚変化をカバーする大規模ベンチマークDexVerseを構築し、既存手法の汎化性能を評価した。
原題: DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation / Yunchao Yao, Zhuxiu Xu, Tianqi Zhang 他
日本語で読む → - 論文強化学習ロボティクス
Robo-ValueRL: オフラインからオンラインへの強化学習における信頼性の高い価値推定
オフラインからオンラインへの強化学習において、価値関数の信頼性がポリシー最適化に与える影響を分析する統一フレームワークを提案し、信頼性の高い価値推定が下流の性能向上に寄与することを実験で示した。
原題: Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning / Wenke Xia, Pei Ren, Wenbo Yu 他
日本語で読む → - 論文身体化AI/記憶アーキテクチャロボティクス
エピソード評価を超えて:連続的身体化質問応答における記憶アーキテクチャのボトルネック
身体化質問応答(EQA)を連続的に評価した際、既存の記憶保持だけでは不十分で、視覚的意味情報を保持する構造化された空間的記憶(3D幾何学に基づく)が必要であることを示した論文。
原題: Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering / Zikui Cai, Kaushal Janga, Tan Dat Dao 他
日本語で読む → - 論文HRIロボティクス
ERR@HRI 3.0チャレンジ:人間とロボットのインタラクションにおけるエラー検出と予測のマルチモーダル手法
本論文は、人間とロボットのインタラクションにおけるエラー検出と予測を目的としたチャレンジの第3版を紹介し、自然環境下で収集された2つのデータセットを提供して、参加者がマルチモーダルモデルを開発することを促す。
原題: ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions / Maria Teresa Parreira, Micol Spitale, Maia Stiber 他
日本語で読む → - 論文軌道計画ロボティクス
包括的グレブナー基底系に基づく実数量限定子消去を用いた3自由度ロボットマニピュレータの軌道計画と検証
3自由度ロボットマニピュレータの軌道計画と解の存在検証を、包括的グレブナー基底系に基づく実数量限定子消去法(CGS-QE法)で効率的に行うアルゴリズムを提案・実装した。
原題: Trajectory Planning and Certification for 3-DOF Robot Manipulators Using Real Quantifier Elimination Based on Comprehensive Gr\"obner Systems / Yu Nakai, Akira Terui, Masahiko Mikawa
日本語で読む → - 論文群制御cs.MA
スティグマージックグラフメモリ:多対多マルチエージェント集配のための環境認識アプローチ
倉庫内の多対多マルチエージェント集配問題において、過去の実行信号を記録する減衰メモリ層を導入し、経路計画前に適切なエージェント・出発地・目的地を選択することで、スループットを20.5〜36.7%向上させた。
原題: Stigmergic Graph Memory: An Environment-Aware Approach for Many-to-Many Multi-Agent Pickup and Delivery / Aditya Dutta, Joon-Seok Kim
日本語で読む → - 論文3Dシーングラフ画像認識
Hydra++: 物体形状推定を備えたリアルタイム階層型3Dシーングラフ構築
3Dシーングラフに学習ベースの物体形状推定を統合し、部分点群やCADテンプレートに頼らずインスタンス固有の形状を推定するシステムを提案。オンライン構築と屋外大規模対応のためのハイブリッドLiDAR-カメラ構成も評価した。
原題: Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation / Hyungtae Lim, Nathan Hughes, Xihang Yu 他
日本語で読む → - 論文運転行動解析ロボティクス
シーン文脈下での都市減速行動モード:Argoverse 2 マルチエージェント軌跡からの初期運動学的分類器
都市部の減速イベントを運動学的特徴でクラスタリングし、4つの安定した行動モードを発見。初期1秒のデータからモードを予測する分類器を構築した。
原題: Urban Deceleration Behavior Modes Under Scene Context: An Early-Kinematic Classifier from Argoverse 2 Multi-Agent Trajectories / Eni Solomon Laughter
日本語で読む → - 論文プランニングロボティクス
不確実性下での仮説駆動型モデル拡張によるオープンワールドロボット計画
未知環境で動作するサービスロボットが、基盤モデルを用いて世界モデルの仮説を生成・検証・更新しながら自律的に知識を拡張し、タスク計画を実行する枠組みを提案した。
原題: Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning / Anxing Xiao, Hanbo Zhang, Tianrun Hu 他
日本語で読む → - 論文階層的計画ロボティクス
ギャップに注意:LeWorldModelにおける階層的計画の約束と落とし穴
階層的計画が長期的な目標条件付き制御でLeWorldModelを改善できるかを調査し、高レベル計画を追加したHi-LeWMを提案。階層化は自動的に性能を向上させず、高レベルサブゴール生成がボトルネックであることを示し、適切な制約で性能が向上することを実証した。
原題: Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel / Niccolò Caselli, Francesco Massafra, Samuele Punzo 他
日本語で読む → - 論文能動学習ロボティクス
限られたアノテーションとナビゲーション予算下での物体検出のための身体化能動学習
ロボットのナビゲーション時間とアノテーション予算の制約下で、未知環境に物体検出器を適応させる能動学習手法を提案。空間的なラベル不整合を利用して、失敗事例に焦点を当てた画像と軌道を選択する。
原題: Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection / Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza 他
日本語で読む → - 論文操作学習ロボティクス
UR-VC: 時間由来の進捗指標に対する教師なしロボット価値補正
デモンストレーションの時間正規化を進捗ラベルとして使う際のノイズを、他エピソードの類似状態から補正する教師なし・学習不要の手法を提案した。
原題: UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies / Lirui Zhao, Modi Shi, Li Chen 他
日本語で読む → - 論文UAV/視覚AIロボティクス
低コストUAV向けリアルタイム視覚インテリジェンス:追跡・走査・ナビゲーションのためのモジュール式アプローチ
DJI Telloドローンを用いて、顔検出・認識・単眼深度推定を統合したモジュール式AIシステムを構築し、Webインターフェースで制御・監視できるようにした。低コスト・オープンソースで、人物追跡や屋内走査、自律ライン追従を実証した。
原題: Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation / Andrei-Marian Ungureanu, Stelian Spînu
日本語で読む →