論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文視覚場所認識画像認識
速さか強さか:重み付き集約とトークンプルーニングによる柔軟な視覚場所認識
視覚場所認識の性能と推論速度を両立するため、クラスタへの重み付き集約で識別性を高め、トークンプルーニングで特徴抽出コストを削減する手法を提案した。
原題: Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning / Zichao Zeng, June Moh Goo, Junwei Zheng 他
日本語で読む → - 論文経路計画ロボティクス
Dynamic-TD3: 動的障害物軌道予測を用いたUAV経路計画のための新規アルゴリズム
UAVナビゲーションの安全性と探索のジレンマを解決するため、物理的制約を組み込んだ強化学習フレームワークDynamic-TD3を提案し、動的障害物環境での衝突回避性能と飛行効率を向上させた。
原題: Dynamic-TD3: A Novel Algorithm for UAV Path Planning with Dynamic Obstacle Trajectory Prediction / Wentao Chen, Jingtang Chen, Mingjian Fu 他
日本語で読む → - 論文ナビゲーションロボティクス
アクションエージェント:エージェント型ビデオ生成とフロー制約拡散の融合
LLMによるビデオ生成とフロー制約拡散モデルを組み合わせ、複数のロボット形態でナビゲーションを実現する2段階フレームワークを提案した。
原題: Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion / Jeffrin Sam, Nguyen Khang, Yara Mahmoud 他
日本語で読む → - 論文制御/蒸留ロボティクス
拡散モデルを用いた動的ニューラルクープマン蒸留によるリアルタイムロボット制御
拡散モデルの反復ノイズ除去による遅延を解消するため、多段階推論を単一パスに蒸留しつつ多様性を保つフレームワークを提案し、D4RLベンチマークと実機で高速な閉ループ制御を実証した。
原題: Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models / Lei Zheng, Peiqi Yu, Zengqi Peng 他
日本語で読む → - 論文触覚/精密組立ロボティクス
到達から挿入へ:サブミリ公差下での触覚強化精密組立
模倣学習と強化学習を組み合わせた二段階手法で、精密挿入タスクを高成功率かつ低接触力で実現した。
原題: From Reach to Insert: Tactile-Augmented Precision Assembly under Sub-Millimeter Tolerances / Xinpan Meng, Siyao Huang, JingPu Yang 他
日本語で読む → - 論文群制御ロボティクス
マルチロボットシステムの分散制御のためのプロトタイピングフレームワーク
分散制御アルゴリズムを単一コンピュータ上で模擬実行できるプロトタイピングフレームワークを提案し、4台のクアッドローターの位置交換タスクで実証した。
原題: A Prototyping Framework for Distributed Control of Multi-Robot Systems / Junaid Ahmed Memon, Allan Andre Do Nascimento, Kostas Margellos 他
日本語で読む → - 論文歩行ロボティクス
ギャップを埋める:高性能脚式移動のためのSoft Actor-Criticの実現
PPOに劣っていたSACを、ポリシー初期化やタイムアウト対応の批評家ターゲット、多段階リターン推定などの改良で大規模並列学習でも安定させ、PPOと同等の性能を達成した。
原題: Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion / Gianluca Sabatini, Chenhao Li, Marco Hutter
日本語で読む → - 論文マニピュレーションロボティクス
反復作業を含む建設活動のための操作計画
VR環境での単一デモンストレーションから建設作業の操作スキルを獲得し、スクリュー運動の幾何学を用いて反復的な建設タスクをロボットで実行する手法を提案した。
原題: Manipulation Planning for Construction Activities with Repetitive Tasks / Wangyi Liu, Dasharadhan Mahalingam, Fanru Gao 他
日本語で読む → - 論文ナビゲーションロボティクス
言語から論理へ:VLMに基づく安全ナビゲーションのための理論的アーキテクチャ
自然言語の安全規則をSignal Temporal Logic (STL)仕様に変換し、Vision-Language Models (VLMs)を用いて屋外環境での自律ナビゲーションを安全に導く理論的アーキテクチャを提案した。
原題: From Language to Logic: A Theoretical Architecture for VLM-Grounded Safe Navigation / Kristy Sakano, Kalonji Harrington, Mumu Xu
日本語で読む → - 論文運動最適化ロボティクス
多リンクシステムにおける高次時間微分を考慮した運動最適化のための構造化ヤコビアン構築
多リンクシステムの運動最適化において、高次時間微分を含む物理量のヤコビアンを解析的に導出する構造化フレームワークを提案し、計算効率と数値安定性を向上させた。
原題: Structured Jacobian Construction for Motion Optimization with High-Order Time Derivatives in Multi-Link Systems / Taiki Ishigaki, Ko Ayusawa, Eiichi Yoshida
日本語で読む → - 論文具現化AI/安全性/実世界展開ロボティクス
具現化AIの実践:SAEワールドコングレス2026から見る安全性、信頼、ロボティクス、実世界展開への洞察
SAEワールドコングレス2026のパネル討論から、自動運転やロボットなどの具現化AIを安全かつ信頼できる形で実世界に展開するための課題と提言をまとめたホワイトペーパー。
原題: Embodied AI in Action: Insights from SAE World Congress 2026 on Safety, Trust, Robotics, and Real-World Deployment / Jan-Mou Li, Paul Schmitt, Wei Tong 他
日本語で読む → - 論文3Dアフォーダンス検出画像認識
VoxAfford: オープンボキャブラリ3Dアフォーダンス検出のためのマルチスケールボクセルトークン融合
3D点群上のオープンボキャブラリアフォーダンス検出において、MLLMの出力トークンに事前学習済み3D VQVAEのマルチスケール幾何特徴を融合する手法を提案し、mIoUを約8%向上させた。
原題: VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection / Haowen Sun, Shaolong Zhang, Mingyang Li 他
日本語で読む → - 論文自動運転/リスクマップロボティクス
部分観測環境における自動運転のための統合リスクマップ学習
自動運転における遮蔽によるリスクを、交通流リスクと衝突リスクを統合したリスクマップとしてモデル化・学習し、拡散モデルによる敵対的シナリオ生成も組み合わせて、部分観測下でのリスク認識計画を実現した。
原題: Learning A Unified Risk Map for Autonomous Driving in Partially Observable Environments / Jie Jia, Yaofeng Su, Zeyu Bao 他
日本語で読む → - 論文キャラクタ制御cs.GR
NaP-Control: 拡散事前分布を操る高速・多用途キャラクタ制御
強化学習で拡散ポリシーのノイズを操作し、タスクに応じた動作を高速・高精度に生成するキャラクタ制御手法を提案した。
原題: NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control / Chia-Wen Chen, Yan Wu, Korrawe Karunratanakul 他
日本語で読む → - 論文空中操作/制御ロボティクス
クワッドローターによるケーブル吊り下げ荷物の敏捷な輸送のためのセンサレス状態推定と制御
UAVによるケーブル吊り下げ荷物の輸送において、Udwadia-Kalaba法を用いてケーブルの幾何学的制約を明示的にモデル化し、センサレスで荷物の状態を推定しつつNMPCに統合する手法を提案した。実機実験で軌道追従誤差が低減することを示した。
原題: Sensorless State Estimation and Control for Agile Cable-Suspended Payload Transport by Quadrotors / Ana Maria Nascimento, Augusto Sales, Antonio Marcus Lima 他
日本語で読む → - 論文VLAロボティクス
WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデル
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
原題: WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation / Baining Zhao, Jiacheng Xu, Weicheng Feng 他
日本語で読む → - 論文3次元復元画像認識
TriP: 三角形パズルによる頑健な並進平均化手法
カメラ位置復元のための並進平均化問題に対し、三角形の幾何から局所スケールを推定し、対数領域で同期させることで、外れ値に頑健で高精度な解法を提案した。
原題: TriP: A Triangle Puzzle Approach to Robust Translation Averaging / Zhekai Fan, Wanze Li, Jinxin Wang 他
日本語で読む → - 論文実験自動化AI
プロンプトからプロトコルへ:実験室自動化のためのAIエージェント
大規模言語モデルと実験室オーケストレーションを統合し、自然言語で実験プロトコルの作成・監視・分析を可能にするAIエージェントを提案。シミュレーション実験で97%の成功率と操作削減を達成。
原題: From Prompts to Protocols: An AI Agent for Laboratory Automation / Angelos Angelopoulos, James F. Cahoon, Ron Alterovitz
日本語で読む → - 論文経路計画ロボティクス
制約環境下での3次元ナビゲーションのためのセル分割に基づく経路計画手法
占有グリッドを隣接セル間で相互可視性を保証するセルに分割し、その枠組みでSOCPやMISOCPによる経路最適化を可能にし、さらにYenのk最短経路とSOCPを組み合わせたKSP-SOCP法を提案した。都市様の環境で評価し、大規模問題に適した性能を示した。
原題: A cell-decomposition based path planner for 3D navigation in constrained workspaces / João P. L. Morais, Luciano C. A. Pimenta, Marcelo A. Santos 他
日本語で読む → - 論文モーションプランニングロボティクス
オープンモーションプランニングライブラリ 2.0
サンプリングベースのモーションプランニングアルゴリズムを多数実装したライブラリOMPLのメジャーアップデート版を紹介し、ハードウェア加速によるリアルタイムプランニングとAI研究ワークフローとの統合を目指す。
原題: The Open Motion Planning Library 2.0 / Weihang Guo, Theodoros Tyrovouzis, Emiliano Flores 他
日本語で読む → - 論文模倣学習/データ生成ロボティクス
模倣学習のための高忠実度合成デモンストレーション生成の原理的アプローチ
3Dガウススプラッティングと動的運動プリミティブを組み合わせ、専門家の軌道構造を保ちつつ多様な合成デモを生成するフレームワークを提案。障害物回避も考慮し、接触を伴う操作タスクの学習に有効なデータを生成する。
原題: A Principled Approach for Creating High-fidelity Synthetic Demonstrations for Imitation Learning / Moniruzzaman Akash, Momotaz Begum
日本語で読む → - 論文自動運転画像認識
C-CoT: 安全な自動運転のための視覚言語モデルを用いた反事実的思考連鎖
自動運転の安全な意思決定のために、視覚言語モデルを用いて反事実的思考連鎖(C-CoT)を導入し、シーン記述から最終行動計画までの5段階でリスクを推論するフレームワークを提案した。
原題: C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving / Kefei Tian, Yuansheng Lian, Kai Yang 他
日本語で読む → - 論文群制御math.OC
安全集合に基づく非線形マルチエージェント衝突回避のための分散型緊急時MPC
エージェント間で軌道情報を共有しない非線形マルチエージェントシステムに対し、各エージェントが局所最適化と安全集合の更新により衝突回避を保証する分散型MPCフレームワークを提案した。
原題: Decentralized Contingency MPC based on Safe Sets for Nonlinear Multi-agent Collision Avoidance / Max Studt, Georg Schildbach
日本語で読む → - 論文遠隔操作/VLAデータ収集ロボティクス
Phone2Act: スケーラブルなVLAデータ収集のための低コストでハードウェア非依存の遠隔操作システム
スマートフォンをARCoreで6自由度ロボットコントローラに変え、ROS 2ベースのモジュール構成で様々なロボットに対応する低コスト遠隔操作フレームワークを提案。収集データはLeRobot形式で出力され、実機で90%の成功率を達成。
原題: Phone2Act: A Low-Cost, Hardware-Agnostic Teleoperation System for Scalable VLA Data Collection / Om Mandhane, Bipin Yadav, Sangeetha Prasanna Ram 他
日本語で読む → - 論文自動運転/シミュレーションロボティクス
車両と歩行者の相互作用における現実的な安全臨界シナリオの生成
実世界データとシミュレーションを組み合わせた3段階フレームワークを提案し、歩行者との危険な相互作用を再現する現実的な安全臨界シナリオを大規模に生成した。
原題: Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions / Qingwen Pu, Kun Xie, Yuan Zhu 他
日本語で読む → - 論文安全性ロボティクス
実行するか否か:デモから学習した視覚運動ポリシーの安全性の確保
模倣学習で学習した視覚運動ポリシーに対し、状態空間内の特定領域から実行保証を提供する安全指標を提案し、Nagumoの条件を用いて安全性を検証する手法を実証した。
原題: To Do or Not to Do: Ensuring the Safety of Visuomotor Policies Learned from Demonstrations / Riad Ahmed, Moniruzzaman Akash, Momotaz Begum
日本語で読む → - 論文VLAロボティクス
故障認識型ロボット制御のためのヘルス条件付き視覚言語行動モデル
ロボットの物理的な劣化(関節の劣化やアクチュエータ故障など)に対応するため、健康状態ベクトルを入力として受け取り、劣化した関節でもタスクを完了できるように適応する視覚言語行動(VLA)モデルを提案した。
原題: Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control / Hüseyin Arslan, Özgür Erkent
日本語で読む → - 論文群制御ロボティクス
シミュレーション情報を活用した拡散モデルによる分散型マルチロボット動作計画
各ロボットが局所観測から衝突回避軌道を生成する分散型マルチロボット動作計画において、隣接ロボットの将来軌道を拡散モデルで予測し、その予測を安全制約として自身の軌道計画に活用する新しいフレームワークを提案した。
原題: Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning / Jinhao Liang, Sven Koenig, Ferdinando Fioretto
日本語で読む → - 論文データ生成/移動操作ロボティクス
HumanoidMimicGen: 全身計画による移動操作のためのデータ生成
ヒューマノイドの移動と操作を模倣学習で訓練するためのデータを自動生成する手法を提案。少数の実演から全身スキルを適応させ、多様なシーンで安定したデータを生成し、実データのみで訓練した場合より20%性能が向上した。
原題: HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning / Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett 他
日本語で読む → - 論文3D物体検出画像認識
TriBand-BEV: 高さ認識BEVと高解像度特徴融合によるリアルタイムLiDARのみの3D歩行者検出
LiDAR点群を3つの高さ帯域を持つ軽量な2D BEV表現に変換し、2D検出として3D物体検出を解くリアルタイム手法を提案。KITTIで高速かつ高精度を達成。
原題: TriBand-BEV: Real-Time LiDAR-Only 3D Pedestrian Detection via Height-Aware BEV and High-Resolution Feature Fusion / Mohammad Khoshkdahan, Alexey Vinel
日本語で読む →