論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文シーン理解ロボティクス
3Dシーングラフ:未解決の課題と今後の方向性
3Dシーングラフ(3DSG)の研究分野を統一的にレビューし、定義の整理、構築手法、応用、評価方法を解説するとともに、今後の課題と方向性を提示したサーベイ論文。
原題: 3D Scene Graphs: Open Challenges and Future Directions / Dennis Rotondi, Francesco Argenziano, Sebastian Koch 他
日本語で読む → - 論文VLA/実機展開ロボティクス
視覚-言語-行動モデル:実機UR5プラットフォームでの実験的洞察
実機UR5eマニピュレータ上でVLAモデル(OpenVLA等)を微調整・展開し、データ収集から制御までの再現可能なフレームワークを構築。オフライン指標と実機の閉ループ挙動の乖離が、行動表現や座標系、時間整合、画像前処理、データ品質に起因することを実験的に示した。
原題: Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform / Mathilde Hochedel, Marc Lalonde
日本語で読む → - 論文ロボットマニピュレーションロボティクス
HiL-ResRL: 人間参加型残差強化学習によるモデル非依存のファインチューニングアダプタ
模倣学習のVLAモデルに対して、モデル非依存でプラグイン可能な残差ポリシーを強化学習で訓練し、実ロボットで1.5時間の学習で成功率95%以上を達成するファインチューニング手法を提案した。
原題: HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning / Jingyi Liu, Zhaohong Mai, ShunSen He 他
日本語で読む → - 論文操作ロボティクス
Chronos: 非マルコフ的長期間操作のための物理情報を活用した全履歴フレームワーク
ロボットポリシーを力学系として捉え、観察履歴を状態として扱うことで、記憶依存の長期間操作を可能にするフレームワークを提案した。
原題: Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation / Yulin Zhou, Yimeng Wang, Nengyu Wang 他
日本語で読む → - 論文SLAMロボティクス
LiDAR SLAMのための自己教師あり幾何推論
LiDAR SLAMの局所幾何推定を自己教師ありで学習し、推定した幾何情報をSLAMに再帰的にフィードバックして精度を向上させるフレームワークを提案した。
原題: Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping / Jiwoo Kim, Jinwoo Lee, Woojae Shin 他
日本語で読む → - 論文安全強化学習ロボティクス
PPO-EAL: 安全なロボット制御のための正確な拡張ラグランジュ近位ポリシー最適化
安全制約を満たす強化学習のための新しい制約付きポリシー最適化フレームワークを提案し、正確な拡張ラグランジュ法をPPOに統合して、理論的に保証された制約充足と高いタスク性能を実現した。
原題: PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control / Jiatao Ding, Songqun Gao, Andrea Del Prete 他
日本語で読む → - 論文データセット/占有予測ロボティクス
ヒューマノイド全方位占有予測:身体化AIのためのステレオベース全周囲占有データセット
ヒューマノイドロボット向けに、ステレオカメラを用いた大規模な全周囲占有データセットを構築し、Real2Sim2Realパイプラインで実環境への汎化を実証した。
原題: Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI / Xianda Guo, Bohao Zhang, Chenwei Huang 他
日本語で読む → - 論文模倣学習ロボティクス
CoRDE: 概念事前知識によるルーティング拡散エキスパートを用いたロボット操作の構造的一般化
多タスク・長期的なロボット操作学習において、意味的なサブ段階間の勾配衝突を避けるため、概念エンコーダの事前知識でルーティングを制御する拡散エキスパート群(CoRDE)を提案した。パラメータ効率の良いLoRAベースのエキスパートプールにより、ルーティング崩壊を抑えつつ構造的一般化を実現する。
原題: CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation / Haidong Huang, Xixin Zhao, Yaohua Zhou 他
日本語で読む → - 論文強化学習ロボティクス
サポート制約付きRLによる実世界経験なしの実世界ポリシー改善
実データで事前学習したポリシーをシミュレーション内でRLにより改善する際、生成ポリシーのサポートに制約を課すことで、転移可能な行動を保証しつつ性能を向上させる手法SCOREを提案。8つの器用な多指操作タスクで成功率を大幅に改善した。
原題: Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience / Raymond Yu, William Huey, Mustafa Mukadam 他
日本語で読む → - 論文VLAロボティクス
SA-VLA: 状態認識トークナイザによる視覚言語行動モデルの性能向上
ロボットの現在状態を考慮して離散アクショントークンを連続値に復号する状態認識アクショントークナイザを提案し、操作タスクの成功率を大幅に向上させた。
原題: SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance / Tengyue Jiang, Chunpu Xu, Jiayue Kang 他
日本語で読む → - 論文操作ロボティクス
細部にこだわるロボット批評家
ロボット操作の成功と失敗を細かく見分ける批評家を、成功・失敗ロールアウトからペアの進捗監視で微調整し、候補行動の選択精度を向上させた。
原題: Robot Critics that Sweat the Small Stuff / Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan 他
日本語で読む → - 論文VLAロボティクス
ASCIIアートがLLMをVLAコントローラに変える
視覚情報をASCII表現に変換してテキストのみのLLMに入力することで、VLAスタイルのコントローラを構築できることを示した論文。シミュレーションと実機の2D操作タスクで有効性を実証している。
原題: ASCII Art Turns LLMs into VLA Controllers / Yitao Jiang, Roy Xing, Luyang Zhao 他
日本語で読む → - 論文多物体追跡画像認識
CylindTrack:パノラマ多物体追跡のための深度対応円筒運動モデリング
パノラマ映像における多物体追跡(MOT)の課題を解決するため、円筒座標系と深度情報を活用した追跡フレームワークCylindTrackを提案した。
原題: CylindTrack: Depth-Aware Cylindrical Motion Modeling for Panoramic Multi-Object Tracking / Buyin Deng, Kai Luo, Lingxin Huang 他
日本語で読む → - 論文触覚ロボティクス
TacEvo: LLM駆動の品質多様性探索によるロボット触覚認識の自己進化的アーキテクチャ発見
触覚画像認識のためのニューラルネットワーク構造を、LLMによるコード変異とMAP-Elites探索で自動進化させるフレームワークを提案し、力推定と細かいテクスチャ分類で専門家設計を上回る性能を達成した。
原題: TacEvo: Self-Evolving Architecture Discovery for Robotic Tactile Perception via LLM-Driven Quality-Diversity Search / Mohammed AbuSadeh, Lan Wei, Dandan Zhang
日本語で読む → - 論文ロボット学習ロボティクス
ロボットの自己改善:人間のビデオからの力学モデルを用いて
人間のビデオから学習した行動・力学・価値表現をロボットに転移し、失敗状態を修正するDGAC法を提案。7つの実世界操作タスクで成功率を40%から81%に向上させ、ロボットの自己改善を実証した。
原題: Robot Self-Improvement via Human-Video Dynamics Models / Hanzhi Chen, Anran Zhang, Simon Schaefer 他
日本語で読む → - 論文VLAロボティクス
構造化画像表現による説明可能なロボット学習
ロボットポリシーの学習にシーングラフを中間表現として用い、タスクに関連する部分グラフを抽出して行動生成に利用することで、モデルの判断過程を説明可能にする手法を提案した。
原題: SIR: Structured Image Representations for Explainable Robot Learning / Paul Mattes, Jan Schwab, Jens Bosch 他
日本語で読む → - 論文全身操作/模倣学習ロボティクス
WARP: オフラインの人間デモからの学習のための全身リターゲティング
人間のデモからロボットの全身動作を正確に抽出するオフラインパイプラインを提案し、ゼロショットでの全身移動操作を実現した。
原題: WARP: Whole-Body Retargeting for Learning from Offline Human Demonstrations / Zhenyang Chen, Chuizheng Kong, Chuye Zhang 他
日本語で読む → - 論文HRIロボティクス
REPAIR-Bench: ロボットのエラー知覚とインタラクション回復のためのベンチマーク
人間とロボットのインタラクションにおける失敗の知覚と回復を評価するためのベンチマークを構築し、失敗検出、タイプ分類、回復予測の3つのタスクを提案した。
原題: REPAIR-Bench: A Benchmark for Robot Error Perception And Interaction Recovery / Giuliano Pioldi, Yashika Batra, Arman Ibrayeva 他
日本語で読む → - 論文HRI/LLMロボティクス
多人数人機会話におけるLLM介入説明の理解
LLM駆動ロボットが多人数会話で介入する際の説明を分析し、介入理由のテーマと役割差を明らかにした研究。
原題: Understanding LLM Intervention Explanations in Multi-Party Human-Robot Interaction / Micol Spitale, Massimiliano Nigro, Emily Cross
日本語で読む → - 論文模倣学習/ポリシー編集ロボティクス
行動アンクローニング:推論時ステアリングなしでモードリダイレクションをポリシー重みに蒸留する手法
デモデータに含まれる望ましくない行動モードを抑制するため、一時的なモード分類器からのリダイレクション信号をポリシー重みに蒸留し、推論時オーバーヘッドなしで安全な行動を実現する手法MoREを提案した。
原題: Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering / Hao Wang, Jiuzhou Lei, Dayou Li 他
日本語で読む → - 論文位置推定ロボティクス
単一周波数GNSS受信機を相対観測で高精度測位へ
低コストな単一周波数GNSS受信機と相対運動センサを組み合わせ、仮想基準局とスライディングウィンドウ因子グラフを用いて、キャリア位相の連続追跡による高精度測位を実現する手法を提案した。実世界実験で数メートルからデシメートル級の精度向上を確認した。
原題: Empowering a Single-Frequency GNSS Receiver to Achieve High-Precision Positioning with Relative Observations / Xingpeng Wang, Ziwen Qu, Juncheng Chen 他
日本語で読む → - 論文介護ロボットロボティクス
身体性と環境の融合:文脈を考慮した安全な身体的介護ロボットに向けて
介護ロボットが多様な環境や身体性に適応するためのフレームワークE^2-CAREを提案し、3D動的シーングラフとタスク固有の制約を用いて、スキルテンプレートをゼロショットで安全に再利用できることを示した。
原題: Embodiment Meets Environment: Toward Context-Aware, Safe Physical Caregiving Robots / Zhanxin Wu, Ruofei Tong, Jiaying Fang 他
日本語で読む → - 論文データ拡張ロボティクス
1つのデモは千の軌道に値する:視運動ポリシーのためのアクション・ビュー拡張
実世界のデモから魚眼画像シーケンスと物理的に実現可能なアクション軌道を生成するデータ拡張フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を向上させた。
原題: One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies / Chuer Pan, Litian Liang, Dominik Bauer 他
日本語で読む → - 論文VLA/操作ロボティクス
UniviewVLA:世界モデリングを備えた統合マルチビュー視覚言語行動モデル
標準的な2つのカメラ観測のみから、世界モデルを用いてマルチビューの未来シーンを生成し、遮蔽された情報を補完して行動予測を改善するVLAモデルを提案。推論高速化のためのトークン圧縮と、動的な視点選択手法も導入。
原題: UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling / Tao Xu, Runhao Zhang, Zhijian Huang 他
日本語で読む → - 論文模倣学習/転移学習ロボティクス
キーポーズ探索:効率的な自動軌道ラベリングとクロスエンボディメントポリシー転送
把持関連タスクのデモからキーポーズを自動抽出するパイプラインを提案し、キーポーズ条件付き拡散ポリシーを訓練して、到達可能性マップによるフィルタリングで異なるロボットへのゼロショット転送を試みた。
原題: Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer / Yupu Lu, Hang Xu, Yizhou Chen 他
日本語で読む → - 論文ナビゲーションロボティクス
MVP-Nav: 多層価値マップによる物理認識ナビゲーション
RGB画像のみを用いたゼロショット物体ゴールナビゲーションにおいて、3D基盤モデルで2Dセマンティクスを3D境界ボックスに投影して物理占有を再構成し、セマンティック優先度と幾何を統合した多層価値マップで物理的に安全な経路計画を行う手法を提案。
原題: MVP-Nav: Multi-layer Value Map Planner Navigator / Wenyuan Xie, Shaokai Wu, Yijin Zhou 他
日本語で読む → - 論文ワールドモデルロボティクス
イベント条件付き診断:受動的オブジェクト状態ワールドモデルにおける運動学的・接触・物体永続性フィールドの解析
物理的状態を予測するワールドモデルの内部表現が、自由運動・衝突・遮蔽などのイベントに応じてどのように情報を編成・再重み付けするかを診断する手法を提案し、予測への機能的影響を検証した。
原題: Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models / Yang Liu, Yuming Chen
日本語で読む → - 論文交通シミュレーションロボティクス
閉ループ交通モデリングにおける局所観測と大域シミュレーションの橋渡し
自動運転の交通シミュレータが、局所的な観測データで学習した結果、閉ループ環境で不自然な挙動を起こす問題を、自己教師ありで失敗を発見し、選好アライメントで補正するフレームワークCRAFTを提案した。
原題: Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling / Ziyan Wang, Tan Xiang, Peng Chen 他
日本語で読む → - 論文自動運転画像認識
PriorEye: エンドツーエンド自動運転のための地理空間視覚事前知識
エンドツーエンド自動運転に、走行経路に紐づく地理空間の視覚事前知識を導入し、デュアルメモリと適応ゲートでセンサ非依存の先読みを実現する手法を提案。NAVSIM-v2で性能向上とセンサ劣化への頑健性を確認。
原題: PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving / Kyuhwan Yeon, Benjamin Ramtoula, Daniele De Martini
日本語で読む → - 論文生成モデル画像認識
幾何学的整合によるテキスト画像蒸留における初期ノイズ感度の回復
テキスト画像生成の蒸留において、初期ノイズへの感度が失われる問題を特定し、ヤコビアン・ベクトル積を整合させることで感度を回復するフレームワークGADを提案した。
原題: Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment / Huayang Huang, Ruoyu Wang, Jinhui Zhao 他
日本語で読む →