論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文システム同定ロボティクス
RigPI: VLMシード付き微分可能シミュレーションによる剛体の動的パラメータ同定
ロボットと物体の相互作用中に、剛体や多リンク剛体の慣性・摩擦パラメータを、視覚言語モデルによる初期化と微分可能シミュレーションの勾配情報を用いて正確に同定するフレームワークを提案した。
原題: RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation / Xincheng He, Rongrong Zhang, Wei Jiang 他
日本語で読む → - 論文ドローン検査ロボティクス
空中ロボットによる微小検査のためのモジュール式デュアルカメラパイプライン
ドローンにズームカメラと広視野ステレオカメラを搭載し、目標に接近せずに表面を細かく検査するためのパイプラインを提案。視覚フィードバックでドローンの動きを補償し、木や温室のトラップなどの非構造物を対象に評価した。
原題: A Modular Dual-Camera Pipeline for Micro-Inspection Using Aerial Robots / S. H. Mirtajadini, N. Rublein, R. M. Ramakrishnan 他
日本語で読む → - 論文器用な把持/シミュレーションロボティクス
SynManDex: 合成人間プレグラスプからの人間らしい器用な把持の合成
人間のプレグラスプを生成し、それをロボットハンドにリターゲットして力閉ループ接触を最適化することで、人間らしく安定した器用な把持を合成するパイプラインを提案。
原題: SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps / Yanming Shao, Zanxin Chen, Wenwei Lin 他
日本語で読む → - 論文動作生成/インタラクション画像認識
MOCHI: 協調的な人と物体のインタラクションの動作強調
複数人と物体が同時に関わる協調インタラクションのノイズを含む動作データを、物理的に妥当な手の把持生成と拡散モデルによる全身動作の最適化で高品質に補正する2段階フレームワークを提案した。
原題: MOCHI: Motion Enhancement of Collaborative Human-object Interactions / Jiye Lee, Yonghun Choi, Jungdam Won
日本語で読む → - 論文世界モデル画像認識
ATM: 行動整合性転移行列による潜在世界モデルの診断と改善
潜在世界モデルの表現が計画に有用かどうかを、シミュレータ評価なしで軽量なプローブにより診断する行列ATMを提案し、さらにその診断信号を訓練に用いて計画性能を改善する手法も示した。
原題: ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models / Jiaheng Chen
日本語で読む → - 論文動作合成ロボティクス
文脈内モデル予測生成:言語モデルから物理へのオープンボキャブラリ動作合成
テキスト記述から人間の動作を合成する際に、言語モデルの意味理解と物理シミュレーションの現実性を統合したフレームワークICMPGを提案し、オープンボキャブラリの指示に対して物理的に妥当な動作を生成する。
原題: In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics / Xiaomeng Fu, Junfan Lin, Yang Liu 他
日本語で読む → - 論文VIOロボティクス
Sphere-VIO: 統一球面表現による異種マルチカメラシステム向けの高速で堅牢な視覚慣性オドメトリ
異なるカメラ構成のマルチカメラシステムに対応するため、統一球面パノラマモデルと並列加速された深度誘導トラッキングを備えた、軽量なフィルタベースのVIOフレームワークを提案した。
原題: Sphere-VIO: Fast and Robust Visual-Inertial Odometry via Unified Spherical Representation for Heterogeneous Multi-Camera Systems / Yueteng Yang, Yusen Xie, Hao Wei 他
日本語で読む → - 論文全身制御ロボティクス
CWI: 複合ヒューマノイド全身模倣システムによる移動操作
上半身の操作と下半身の移動を分離し、モーションキャプチャデータを活用してヒューマノイドの全身協調動作を実現する模倣学習フレームワークを提案した。
原題: CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation / Wenqi Ge, Junde Guo, Zhen Fu 他
日本語で読む → - 論文ロボット学習ロボティクス
形態を横断する到達可能性: RAM
ロボットの形態に依存しない、自己衝突を考慮した到達可能領域を高速に推定する暗黙的ニューラル表現を提案し、大規模データセットで学習して未見の形態にも汎化させる。
原題: RAM: Reachability Across Morphologies / Tim Walter, Xinyu Chen, Jonathan Külz 他
日本語で読む → - 論文3D物体検出画像認識
3D物体検出のための学習型非最大値抑制
LiDARベースの3D物体検出において、ヒューリスティックなNMSを学習ベースのフィルタリングモジュールに置き換え、検出精度を向上させる手法を提案した論文。
原題: Learned Non-Maximum Suppression for 3D Object Detection / Timo Osterburg, Stefan Schütte, Torsten Bertram
日本語で読む → - 論文最適化ロボティクス
非線形最適化のスケーリング:多数の問題を1つのGPUで
GPUバッチ処理に対応した非線形計画法ソルバーjaxipmをJAXで実装し、多数の最適化問題を並列に解くことでロボティクス学習パイプラインへの統合を可能にした。
原題: Scaling Nonlinear Optimization: Many Problems One GPU / John Viljoen, Johanna Haffner, Masayoshi Tomizuka 他
日本語で読む → - 論文VLAロボティクス
Vesta: 汎用身体化推論モデル
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
原題: Vesta: A Generalist Embodied Reasoning Model / Johan Bjorck, Zhiqi Li, Yunze Man 他
日本語で読む → - 論文マニピュレーションロボティクス
行動プロンプト方策:操作のためのデモンストレーションをプロンプトとして活用
単一の人間のデモンストレーションをプロンプトとして用い、推論時に新しいタスクを実行できるロボットのパラダイムを提案。新しいアーキテクチャ、データ収集インターフェース、評価ベンチマークを導入し、微調整なしで新しいスキルを教える柔軟な方法を示した。
原題: Behavior Prompting Policy: Demonstrations as Prompts for Manipulation / Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez 他
日本語で読む → - 論文シミュレーション/データ拡張ロボティクス
Pipette: ウェットラボロボットのための具現化シミュレーションプラットフォーム、ベンチマーク、およびデータ効率的な拡張フレームワーク
ウェットラボ(生物医学実験)ロボットの学習を効率化するため、カスタマイズ可能なシミュレータ、編集可能なアセット、限られたデモから訓練データを増強するパイプラインを備えたプラットフォーム「Pipette」を提案した。
原題: Pipette: An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics / Zhe Liu, Huanbo Jin, Zhaohui Du 他
日本語で読む → - 論文マニピュレーションロボティクス
嗜好較正型ヒューマン・イン・ザ・ループ強化学習によるロボット操作
人間介入を利用した強化学習で、介入が誘発する嗜好信号から劣った軌道区間を特定し、Q値の過大評価を防ぎつつ方策を人間の修正行動に合わせて較正するPACTフレームワークを提案した。
原題: Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation / Zeyi Liu, Guangyao Liu, Yinuo Qu 他
日本語で読む → - 論文模倣学習ロボティクス
ヒューマン・アズ・ヒューマノイド:人間に合わせた身体を持つエゴ・エクソ人間ビデオからのゼロショット人型ロボット学習
人間のデモ動画を高自由度ヒューマノイドのVLA学習に使えるように、身体・センシング・行動ラベルを揃えるフレームワークを提案し、実機で検証した。
原題: Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments / Xiaopeng Lin, Ruoqi Yang, Shijie Lian 他
日本語で読む → - 論文触覚/操作ロボティクス
Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
原題: Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation / Yunfan Lou, Yifan Ye, Yankai Fu 他
日本語で読む → - 論文エッジ推論画像認識
ベンチマークを超えて:細粒度路側認識のための連続エッジ推論
エッジデバイス上での連続AI推論における実運用上の課題(熱スロットリングや時間的不安定性など)を分析し、NVIDIA Jetson Orin Nano上で路側認識のための連続推論システムEdge-TSRを提案。時間的安定化機構により、フレーム単位の推論と比較して最大10.16%の分類精度向上を達成した。
原題: Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception / Aditya Mishra, Haroon Lone
日本語で読む → - 論文ナビゲーションロボティクス
階層的意味拡張ナビゲーション:最適輸送とグラフ駆動推論による視覚言語ナビゲーション
連続環境での視覚言語ナビゲーション(VLN-CE)のための、階層的意味シーングラフと最適輸送に基づくプランナー、グラフ認識強化学習を統合したフレームワークを提案し、長期的タスクでの性能を向上させた。
原題: Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation / Xiang Fang, Wanlong Fang, Changshuo Wang
日本語で読む → - 論文自動実験/プロトコル変換ロボティクス
自然言語プロトコルをロボット実験プラットフォームへ変換するためのクロスモデル検証付きデュアルエージェントフレームワーク
生物実験プロトコルを自然言語からロボット制御コマンドへ変換するエージェントベースのフレームワークを提案し、パーサーと検証エージェントの連携により精度を向上させた。
原題: Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform / Hyeonna Choi, Jung Yup Kim, Hyuneui Lim 他
日本語で読む → - 論文群制御ロボティクス
物理情報に基づくロボット群の創発行動のモデリングと制御
ロボット群の多段階創発行動を、物理制約付き密度場の進化として表現するマイクロ・マクロ枠組み「PhySwarm」を提案し、強化学習とPINNを組み合わせた制御器で統一的に生成する。
原題: Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms / Zixuan Jin, Wenzhuo Zhang, Shuxian Quan 他
日本語で読む → - 論文行動クローニングロボティクス
オープンデータ・訓練・評価によるスケーラブルな行動クローニング
大規模な遠隔操作データセットABC-130K(3500時間、13万エピソード)とオープンソースのハードウェア・訓練・シミュレーション基盤を公開し、行動クローニングの再現可能な研究基盤を提供した。
原題: Scalable Behavior Cloning with Open Data, Training, and Evaluation / Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh 他
日本語で読む → - 論文ナビゲーションロボティクス
蒸留型視覚言語信頼性ガイド付き拡散モデルによる空中ナビゲーション
UAVの自律ナビゲーション向けに、観測の信頼性を考慮した拡散ベースの経路生成プランナーを提案。視覚言語モデルから蒸留した信頼性ヒートマップで不確実領域を検出し、ESDFコストで物理障害物と同等に扱うことで、衝突率を大幅に低減した。
原題: Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation / Ivan Valuev, Iana Zhura, Valerii Serpiva 他
日本語で読む → - 論文マイクロロボットロボティクス
膜ベース音響マイクロロボット
気泡の溶解による寿命低下を防ぐため、PDMS膜で密閉した微小空洞を用いた音響マイクロロボットを提案し、24時間以上の連続動作と磁気制御による方向制御を実証した。
原題: Membrane-based Acoustic Microrobots / Fatih Kocabas, Cemal Polat Avdar, Prithvi Venkatesh 他
日本語で読む → - 論文VLA画像認識
Cosmos 3: 物理AIのための全モーダル世界モデル
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
原題: Cosmos 3: Omnimodal World Models for Physical AI / NVIDIA, :, Aditi 他
日本語で読む → - 論文群制御ロボティクス
ロボットをトークンとして:協調マルチロボット軌道生成のための統一拡散トランスフォーマー
各ロボットをトークンとして扱う拡散トランスフォーマーを提案し、複数ロボットの軌道をフィードフォワードで直接生成する。個々の安全性と全体の接続性を満たす軌道を生成できる。
原題: Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation / Ruofei Bai, Jie Chen, Yuxin Cai 他
日本語で読む → - 論文量子最適化/マルチエージェント割り当てロボティクス
自然言語ガイドによるマルチドローン割り当てのための最適性保持分解を用いたスケーラブルQAOA
大規模なマルチドローンのゾーン割り当て問題を、LLMで自然言語をQUBO制約に変換し、量子近似最適化アルゴリズム(QAOA)で解くエンドツーエンドのフレームワークを提案した。制約を保持するグラフ分割と動的計画法による圧縮マージで量子ビット数を削減し、スケーラビリティを実現した。
原題: Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment / Junyeop Bang, Byongho Lee, Dohyun An 他
日本語で読む → - 論文圧縮/クラウドロボティクスeess.IV
SEAOTTER: センサー組み込みオートエンコーダとワンタイムトランスコードによる効率的な再構成
ロボットシステム向けに、学習ベースの潜在表現と標準JPEGの互換性を組み合わせた画像圧縮フレームワークを提案し、高圧縮率で高速な符号化・復号化と高い認識精度を実現した。
原題: SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction / Dan Jacobellis, Neeraja J. Yadwadkar
日本語で読む → - 論文SLAMロボティクス
時間を超えて:完全ガウス型の分散・連続時間SLAMフレームワーク
ガウス過程の運動事前分布とガウス信念伝播を組み合わせた、分散型の連続時間SLAMソルバーを提案し、ローリングシャッターカメラやマルチカメラ設定で有効性を示した。
原題: Breaking Time: A Fully Gaussian Framework for Distributed and Continuous-Time SLAM / Davide Ceriola, Simone Ferrari, Luca Di Giammarino 他
日本語で読む → - 論文共創/音楽ロボティクスロボティクス
Co-policy: 人間とロボットによる応答的な音楽共創のためのフレームワーク
音楽セマンティクスを物理的な演奏動作に結びつける、人間とロボットの音楽共創フレームワークを提案。意味理解、音楽変奏、視覚運動実行を分離し、低遅延で応答的な演奏を実現する。
原題: Co-policy: Responsive Human-Robot Co-Creation for Musical Performances / Xuetao Li, Wenke Huang, Mang Ye 他
日本語で読む →