論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マニピュレーションロボティクス
ハンド・イン・ザ・ループ:シームレスな手と腕の介入による巧みな操作のためのVLAポリシー改善
高自由度ロボットハンドの巧みな操作において、人間の介入時に発生する「ジェスチャージャンプ」を防ぐため、人間の修正意図と自律ポリシー実行をブレンドする介入手法HandITLを提案し、介入ジッタや把持失敗を大幅に低減した。
原題: Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention / Zhuohang Li, Liqun Huang, Wei Xu 他
日本語で読む → - 論文運動計画ロボティクス
凸集合グラフによる信号時相論理運動計画
信号時相論理仕様を満たす滑らかなロボット軌道を生成するため、タイムドオートマトンと凸集合グラフを組み合わせた効率的なフレームワークを提案した。
原題: Signal Temporal Logic Motion Planning via Graphs of Convex Sets / Yu Chen, Ancheng Hou, Mingyang Feng 他
日本語で読む → - 論文ナビゲーションロボティクス
Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーション
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
原題: Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation / Hongyu Ding, Sizhuo Zhang, Ziming Xu 他
日本語で読む → - 論文自動運転/強化学習機械学習
CRAFT: 運転ポリシーのための反事実からインタラクティブへの強化学習ファインチューニング
閉ループ運転ポリシーの事後学習を、反事実的利点をプロキシとして使い、実閉ループ利点との残差補正で整合させるオン方策強化学習フレームワークを提案した。
原題: CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies / Keyu Chen, Nanfei Ye, Yida Wang 他
日本語で読む → - 論文移動・操作統合ロボットロボティクス
WiXus: 環境を活用するワイヤ駆動を統合した車輪脚ロボットによる移動と操作の融合
車輪脚ロボットにワイヤ駆動機構を加え、外部環境を利用して脚を移動から解放し、崖登りや物体操作・道具使用を可能にする新しいロボットWiXusを開発した。
原題: WiXus: A Wheeled-Legged Robot with Wire-Driven Environmental Utilizing to Integrate Mobility and Manipulation / Shintaro Inoue, Kento Kawaharazuka, Temma Suzuki 他
日本語で読む → - 論文強化学習ロボティクス
階層的マクロ行動量子化による強化学習エージェントの人間らしさ向上
人間のデモンストレーションを階層的なベクトル量子化でマクロ行動に符号化し、報酬を最大化しつつ人間らしい行動系列を予測する強化学習フレームワークHiMAQを提案した。
原題: Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization / Usman Nizamani, M. Shaheer Luqman, Fawad Javed Fateh 他
日本語で読む → - 論文プランニングロボティクス
秩序あるカオスの利点:テーブルトップのスタック再配置における転倒動作を用いたプランニング
テーブル上の積み重ねられた物体の再配置において、物体を転倒させる動作をプランニングに組み込み、ピックアンドプレースのみの場合より高速な実行を実現する手法を提案した。
原題: Virtues of Ordered Chaos: Planning with Topple Actions in Tabletop Stack Rearrangement / Hao Lu, Rahul Shome
日本語で読む → - 論文自律探索ロボティクス
OPAL: 全方位経路効率的な空中3次元探索
分岐点での360度ヨー回転を活用し、計算負荷を抑えつつ移動距離を短縮する空中ロボットの自律探索フレームワークを提案した。
原題: OPAL: Omnidirectional Path-efficient Aerial 3D expLoration / Yoga Satwik Chappidi, Avideh Zakhor
日本語で読む → - 論文システム/デプロイロボティクス
ICAN-Deploy: 安全性が重要な具現化エージェントのためのアイデンティティ安定カナリアデプロイ
カナリアデプロイ中にシステムの暗号アイデンティティが変化する問題を解決するため、能力名とバージョンを分離してアイデンティティ不変性を保つミドルウェアを提案し、ロボット制御システムで検証した。
原題: ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents / Xue Qin, Simin Luan, John See 他
日本語で読む → - 論文データセット画像認識
HumanNet:100万時間の人間中心ビデオ学習のスケーリング
人間の身体活動を大規模に捉えた100万時間のビデオコーパスを構築し、データキュレーション手法と視覚言語行動モデルの継続学習による有効性を示した論文。
原題: HumanNet: Scaling Human-centric Video Learning to One Million Hours / Yufan Deng, Daquan Zhou
日本語で読む → - 論文VLA/推論高速化ロボティクス
Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワーク
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
原題: Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs / Jiahui Niu, Kefan Gu, Yucheng Zhao 他
日本語で読む → - 論文VLAロボティクス
HARP-VLA: 人間とロボットの視覚表現を整合させる視覚言語行動モデル学習
人間の動画とロボットのデータを共同学習する際、視覚表現のずれを埋めるため、限られたペアデータを橋渡しにし、大規模な非ペア動画から整合的な表現を学習するフレームワークを提案した。
原題: HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model / Xiang Zhu, Puzhen Yuan, Yichen Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
D-CLING: ナビゲーション基盤モデルのための事前知識を保持する深度条件付きファインチューニング
ナビゲーション基盤モデルを新しい環境やカメラ設定に適応させる際、事前学習の知識を保ちながら効率的に学習するファインチューニング手法を提案した。ControlNetに着想を得て、ゼロ初期化の残差経路を持つ学習可能なバックボーンを追加し、深度情報を活用することで、衝突や人間の介入を減らしつつ長期的なナビゲーションを実現した。
原題: D-CLING: Prior-Preserving Depth-Conditioned Fine-Tuning for Navigation Foundation Models / Shintaro Nakaoka, Takayuki Kanai, Kazuhito Tanaka
日本語で読む → - 論文マニピュレーションロボティクス
予測対応ガウススプラッティングによる言語誘導ピックアンドプレース操作のための予測的3D表現
言語指示に基づくロボット操作において、タスク完了状態を明示的に予測する3D表現フレームワークを提案し、実世界のピックアンドプレースタスクで成功率を向上させた。
原題: Forecast-aware Gaussian Splatting for Predictive 3D Representation in Language-Guided Pick-and-Place Manipulation / Kaixin Jia, Jiacheng Xu
日本語で読む → - 論文ナビゲーションロボティクス
進化する学習:動的環境における堅牢な人型ロボットナビゲーションのためのマルチモーダル対話フィールド
人型ロボットの操作ナビゲーション向けに、歩行による視覚歪みや環境変化に頑健なマルチモーダル対話フィールド(MIF)を提案し、実機で再配置成功率を大幅に向上させた。
原題: Learning to Evolve: Multi-modal Interactive Fields for Robust Humanoid Navigation in Dynamic Environments / Peifeng Jiang, Hong Liu, Jin Jin 他
日本語で読む → - 論文物体検出画像認識
海事高解像度画像向けDETRの効率化
海事画像の物体検出を効率化するため、Vision Mambaバックボーンとトークンプルーニングを導入し、高解像度処理の計算負荷を削減する手法を提案した。
原題: Increasing the Efficiency of DETR for Maritime High-Resolution Images / Tinsae Yehuala, Hao Cheng, Ville Lehtola
日本語で読む → - 論文群制御ロボティクス
オクルージョンに基づく小型ロボット群による障害物回避物体輸送
群ロボットが障害物で遮られた目標への物体輸送を、サブゴール形成により可能にする分散型戦略を提案し、シミュレーションでその有効性を示した。
原題: Occlusion-Based Object Transportation Around Obstacles With a Swarm of Miniature Robots / Breno Cunha Queiroz, Daniel MacRae
日本語で読む → - 論文モデル予測制御機械学習
Slot-MPC: オブジェクト中心表現を用いた目標条件付きモデル予測制御
オブジェクト中心の世界モデルを学習し、勾配ベースのMPCで行動計画を行うことで、ロボット操作タスクの性能と計画効率を向上させた。
原題: Slot-MPC: Goal-Conditioned Model Predictive Control with Object-Centric Representations / Jonathan Spieler, Angel Villar-Corrales, Sven Behnke
日本語で読む → - 論文VLM/ベンチマーク画像認識
SceneFunRI: タスク駆動型機能物体位置特定のための不可視領域推論
実世界では対象物体が隠れて見えないことがあるが、人間は文脈と常識で位置を推測できる。本論文は、この「不可視領域の推論」をVLMsに課すベンチマークSceneFunRIを構築し、既存モデルの性能が低いことを示した。
原題: SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization / Posheng Chen, Powen Cheng, Gueter Josmy Faure 他
日本語で読む → - 論文強化学習/制御ロボティクス
滑らかな連続制御のための暗黙的アクションチャンキング
強化学習の高周波振動制御問題を解決するため、実行ウィンドウと価値ウィンドウの二重設計による暗黙的アクションチャンキング手法DWSを提案し、滑らかで安全な制御を実現した。
原題: Implicit Action Chunking for Smooth Continuous Control / Bosun Liang, Shuo Pei, Zirui Chen 他
日本語で読む → - 論文マニピュレーションロボティクス
多リンク柔軟マニピュレータのモジュラーリー代数PDE制御
任意数のリンクを持つ直列柔軟マニピュレータに対し、空間離散化やモード打ち切りなしに弾性変形PDEを扱う適応制御フレームワークを提案し、指数収束を証明した。
原題: Modular Lie Algebraic PDE Control of Multibody Flexible Manipulators / Sadeq Yaqubi, Jouni Mattila
日本語で読む → - 論文運動計画ロボティクス
マニピュレータ搭載型連続体ロボットのためのサンプリングベース追従運動計画
連続体ロボットをマニピュレータに搭載した際の追従運動計画を、ベース位置を閉形式で求めることで効率的に解く手法を提案した。
原題: Sampling-Based Follow-the-Leader Motion Planning for Manipulator-Mounted Continuum Robots / Chengnan Shentu, Nicholas Baldassini, Oluwagbotemi D. Iseoluwa 他
日本語で読む → - 論文農業ロボティクス画像認識
YOLO26-RipeLoc Lite: 温室ロボット収穫のためのトマト熟度検出と摘み取り点位置推定の軽量アーキテクチャ
温室トマトの収穫ロボット向けに、熟度分類と摘み取り点の中心位置推定を同時に行う軽量な深層学習モデルYOLO26-RipeLoc Liteを提案した。
原題: YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting / Rajmeet Singh, Manveen Kaur, Shahpour Alirezaee 他
日本語で読む → - 論文ナビゲーションロボティクス
CaMeRL: 衝突認識と記憶強化によるマルチスケール障害物環境でのUAVナビゲーション強化学習
UAVの障害物回避ナビゲーションにおいて、障害物のスケール変化に着目し、衝突リスクを考慮した潜在表現と時間的記憶モジュールを導入した強化学習フレームワークCaMeRLを提案した。
原題: CaMeRL: Collision-Aware and Memory-Enhanced Reinforcement Learning for UAV Navigation in Multi-Scale Obstacle Environments / Hong Hong, Feiyu Liao, Yongheng Liang 他
日本語で読む → - 論文3Dシーングラフロボティクス
FOUND-IT: 基盤モデル優先のタスク駆動型3Dシーングラフと要求に応じた粒度
単眼カメラからリアルタイムに階層的なタスク駆動型3Dシーングラフを構築する手法を提案し、タスクに応じてオブジェクトや領域の粒度を動的に調整する。
原題: FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand / Dominic Maggio, Nicolas Gorlo, Kris Hauser 他
日本語で読む → - 論文軌道計画ロボティクス
学習加速型最適化に基づく空中・地上協調ハンドオーバー軌道計画
UAVとUGVの協調ハンドオーバー任務において、LSTMによるニューラル予測を最適化の初期解として用いることで、計算を3倍以上高速化し成功率100%を達成した軌道計画手法を提案した。
原題: Learning-Accelerated Optimization-based Trajectory Planning for Cooperative Aerial-Ground Handover Missions / Jingshan Chen, Bochen Yu, Henrik Ebel 他
日本語で読む → - 論文歩行ロボティクス
MUJICA: 車輪付き脚ロボットのためのマルチスキル統合制御アーキテクチャ
車輪付き脚ロボット向けに、全方位移動・高所乗り越え・転倒回復などの多様な低レベルスキルを単一ポリシーに統合し、高レベルセレクタが proprioception のみで最適スキルを動的選択する制御フレームワークを提案。シミュレーションと実機で適応性とタスク成功率を向上させた。
原題: MUJICA: Multi-skill Unified Joint Integration of Control Architecture for Wheeled-Legged Robots / Yuqi Li, Peng Zhai, Yueqi Zhang 他
日本語で読む → - 論文軌道予測画像認識
JACoP: 協調的なマルチエージェント予測のための関節アライメント
生成モデルによる歩行者軌道予測で、個々の精度は高いが社会的衝突や環境違反を起こす問題を解決するため、MRFに基づく関節選択でシーン全体の整合性を保証する多段階フレームワークJACoPを提案した。
原題: JACoP: Joint Alignment for Compliant Multi-Agent Prediction / Qingze Liu, Alen Mrdovic, Danrui Li 他
日本語で読む → - 論文視覚慣性初期化ロボティクス
フィードフォワード3Dモデルを用いた単眼視覚慣性システムの効率的な特徴点フリー初期化
単眼VINSの初期化を、視覚特徴追跡を使わずにフィードフォワード3Dモデルが予測する点群を利用して行う手法を提案し、成功率90%以上・データ所要時間1.2秒未満を達成した。
原題: Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model / Yuantai Zhang, Jiaqi Yang, Huajian Zeng 他
日本語で読む → - 論文四足歩行ロボティクス
駆動脊椎を備えたアジャイル四足歩行の評価
四足ロボットに駆動脊椎を追加することで、高速走行や階段・斜面・障害物の克服などアジャイルな動きが向上するかをシミュレーションで検証した論文。
原題: Evaluation of an Actuated Spine in Agile Quadruped Locomotion / Nico Bohlinger, Piotr Kicki, Davide Tateo 他
日本語で読む →