論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文データ生成ロボティクス
FlyMirage:生成的世界モデルによる多様でスケーラブルなUAV飛行データの完全自動生成パイプライン
大規模言語モデルと生成的世界モデルを組み合わせ、高忠実度の3DGSシーンを自動生成し、UAVの飛行軌道を計画することで、多様で現実的な空中VLNデータセットを自動構築するパイプラインを提案した。
原題: FlyMirage: A Fully Automated Generation Pipeline for Diverse and Scalable UAV Flight Data via Generative World Model / Jinhan Li, Xijie Huang, Zhaoqi Wang 他
日本語で読む → - 論文群制御ロボティクス
多様な空中タスクのための自己組織化モジュール型空中ロボット
飛行中に自己組織化して協調操作を行う再構成可能なモジュール型空中ロボットLEGIONを提案し、機敏な飛行と頑健な空中操作のトレードオフを解消する。
原題: Self-assembling Modular Aerial Robot for Versatile Aerial Tasks / Junichiro Sugihara, Masaki Kitagawa, Jinjie Li 他
日本語で読む → - 論文ナビゲーション/VLAロボティクス
ウェイポイントを超えて:クロスエンボディメント意味的ナビゲーションのためのデュアルヒートマップ接地
オープンエンドな意味的指示を物理的に実行可能な局所目標に変換する際、単一点回帰の代わりに到達可能領域と向き制約を表すデュアルヒートマップを予測するVLAフレームワークを提案し、多様なロボットでの性能向上を示した。
原題: Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation / Kaijie Yun, Yue Chen
日本語で読む → - 論文VLAロボティクス
PAPO-VLA: 計画を考慮した視覚言語行動モデルのポリシー最適化
VLAモデルの実行を計画と実行の二役に分解し、計画アクションを特定して重要度を推定し、GRPOの利点推定に組み込むことで、タスク成功に重要な行動を重点的に最適化する手法を提案した。
原題: PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models / Peizheng Guo, Jingyao Wang, Changwen Zheng 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
身体が動く前に:言語条件付きヒューマノイド制御のための予測的関節意図の学習
言語指示に基づくヒューマノイドの全身制御において、将来の接触変化やバランス準備を明示的に予測する階層的フレームワークDAJIを提案し、予測的関節意図を学習することで追従性能と生成品質を向上させた。
原題: Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control / Haozhe Jia, Honglei Jin, Yuan Zhang 他
日本語で読む → - 論文姿勢推定ロボティクス
SmoCap: プロキシ写像と信頼領域QPによるスケール・姿勢の統一的標準化
スケール推定と逆運動学を分離せず、信頼領域QP内で形態と姿勢を同時推定する漏れ耐性のある標準化フレームワークを提案し、膝関節屈曲誤差2.9度などを達成した。
原題: SmoCap: Unified Scale-Pose Canonicalization with Proxy-Mapped Trust-Region QP / Shihao Li, Naohiko Sugita
日本語で読む → - 論文3Dレイアウト生成画像認識
R$^3$L: 相対空間関係からの3Dレイアウト推論
3Dレイアウト生成における相対空間推論の信頼性と一貫性を向上させるフレームワークを提案。多段階推論での誤差蓄積を防ぐため、不変空間分解と一貫性のある空間想像を導入し、物理的に実現可能で意味的に一貫したレイアウトを生成する。
原題: R$^3$L: Reasoning 3D Layouts from Relative Spatial Relations / Zhifeng Gu, Yuqi Wang, Bing Wang
日本語で読む → - 論文地理的定位画像認識
プロトタイプベースの意味的部分発見による天候ロバストなクロスビュー地理的定位
ドローン視点と衛星画像を照合するクロスビュー地理的定位において、天候や高度変化に頑健な軽量ヘッドSkyPartを提案し、最先端の精度を達成した。
原題: Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery / Chi-Nguyen Tran, Dao Sy Duy Minh, Huynh Trung Kiet 他
日本語で読む → - 論文物理シミュレーション/ニューラルワールドモデル画像認識
DeformMaster: ビデオから変形物体のための対話型物理ニューラルワールドモデル
実ビデオから変形物体の物理ダイナミクスと外観を学習し、新しい操作や視点での未来予測とレンダリングを可能にする統一モデルを提案。
原題: DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos / Can Li, Zhoujian Li, Ren Li 他
日本語で読む → - 論文sim2realロボティクス
変形マイクロファイバ形状制御のための閉ループsim-to-real強化学習
摩擦のない簡略化シミュレータで学習した強化学習ポリシーを、実機の二把持マイクロマニピュレーションシステムに直接転用し、視覚フィードバックで未モデル化の表面相互作用を補正しながら、シルクマイクロファイバの形状をサブミリ精度で制御する手法を提案した。
原題: Closed-Loop Sim-to-Real Reinforcement Learning for Deformable Microfiber Shape Control / Alessandro Amici, Houari Bettahar, Veeti Jaakkola 他
日本語で読む → - 論文VLA/幾何理解画像認識
幾何基盤モデルが視覚言語行動モデルに与える影響の理解
視覚言語行動モデル(VLA)と3D再構成のための幾何基盤モデル(GFM)の統合について、VLAの幾何理解の欠如を線形プロービングで定量化し、幾何情報を注入する3つのアーキテクチャを比較、さらに非アーキテクチャ的選択の影響を分析した。
原題: Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models / Yurou Yang, Muyuan Lin, Roberto Martin-Martin 他
日本語で読む → - 論文物理シミュレーション/ロボット操作機械学習
MoSA: 運動制約付き応力適応による連続体力学の実機-シミュレーションギャップ緩和 - 残差異方性学習を通じて
実世界の連続体の動力学を視覚観測から学習する際、等方性モデルを物理事前知識として使い、残差応力演算子を学習して軽度の異方性・不均一性を捉えることで、実機とシミュレーションのギャップをさらに縮小するフレームワークを提案した。
原題: MoSA: Motion-constrained Stress Adaptation for Mitigating Real-to-Sim Gap in Continuum Dynamics via Learning Residual Anisotropy / Jiaxu Wang, Junhao He, Jingkai Sun 他
日本語で読む → - 論文触覚インタラクションロボティクス
ポケットサイズロボティクスによる落ち着きの誘発:手持ち触覚インタラクションによる子どもの動きと心拍数の低減
手持ち型の触覚デバイスを使ったリズム合わせゲームが、子どもの心拍数と全身の動きを有意に減少させ、落ち着きを促すことを示した研究。
原題: Inducing Calmness With Pocket-Sized Robotics: Reducing Movement and Heart Rate in Children through Hand-Held Tactile Interactions / Morten Roed Frederiksen, Kasper Støy, Maja Matarić
日本語で読む → - 論文HRI/感情表現ロボティクス
低自由度ロボットにおける感情表現:Reachy Miniを用いた知覚評価
低自由度で非人間的な表現しかできないロボットReachy Miniの感情表現を、オンライン実験で100人がどう知覚するかを調べた論文。正確な感情認識は限定的だが、覚醒度や感情価などの感情の大まかな意味は伝わり、社会的評価にも影響することが示された。
原題: Emotional Expression in Low-Degrees-of-Freedom Robots: Assessing Perception with Reachy Mini / Amit Rogel, Elmira Yadollahi, Guy Laban
日本語で読む → - 論文マニピュレーションロボティクス
SID: 分布への滑り込みによるロバストな少数デモ操作
少数のデモンストレーションから物体中心の運動場を学習し、システムをデモ分布へ滑り込ませて外れ値実行を防ぐことで、ポーズや視点の変化に対してロバストな操作を実現するフレームワークを提案。
原題: SID: Sliding into Distribution for Robust Few-Demonstration Manipulation / Yicheng Ma, Wei Yu, Zhian Su 他
日本語で読む → - 論文探索計画ロボティクス
一般化された運動場における漸近最適エルゴード被覆
時間変化する流れ場での探索をエルゴード被覆問題として定式化し、領域の進化を考慮した流れ適応型の被覆指標を提案した。これにより、非駆動や開ループ計画でも効果的な探索が可能になることを実験で示した。
原題: Asymptotically Optimal Ergodic Coverage on Generalized Motion Fields / Christian Hughes, Yilang Liu, Yanis Lahrach 他
日本語で読む → - 論文運動計画ロボティクス
AURA: 運動学的システムのための漸近最適な不確実性ロバスト再計画アルゴリズム
運動学的運動計画において、実行中に軌道を継続的に改善し、不確実性下での追従誤差を低減する漸近最適なメタプランナーフレームワークを提案した。
原題: AURA: Asymptotically Optimal Uncertainty-Robust Replanning Algorithm for Kinodynamic Systems / Seyedali Golestaneh, Zhuoyun Zhong, Donghyung Lee 他
日本語で読む → - 論文ナビゲーションロボティクス
HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
原題: HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation / Haoxuan Xu, Tianfu Li, Wenbo Chen 他
日本語で読む → - 論文自動運転シミュレーションロボティクス
自動運転車両のシナリオベーステストのためのオープンシミュレーションアーキテクチャへのエージェントモデル統合
自動運転システムの安全性評価に必要なシミュレーション環境間で、交通エージェントモデルを標準化された方法で統合するためのアーキテクチャを提案し、3つの異なるシミュレータで一貫した動作を実証した。
原題: Integration of an Agent Model into an Open Simulation Architecture for Scenario-Based Testing of Automated Vehicles / Christian Geller, Daniel Becker, Jobst Beckmann 他
日本語で読む → - 論文ロボット適応/組立ロボティクス
CoRMA: 接触リッチなメタ適応のための対照的RMA
力支配の組立作業向けに、シミュレータのみの意味的接触文脈を推定する適応フレームワークCoRMAを提案し、実機での成功率を向上させた。
原題: CoRMA: Contrastive RMA for Contact-Rich Meta-Adaptation / Wentian Wang, Chutong Wen, Hongxu Ma 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワーク
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
原題: Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs / Jiahui Niu, Kefan Gu, Yucheng Zhao 他
日本語で読む → - 論文ドローン/強化学習ロボティクス
強化学習による視覚誘導の屋外飛行と障害物回避
ステレオ深度と視覚慣性オドメトリを用いて、未知環境で障害物を回避しながら目標点へ自律飛行するセンサモータポリシーを提案。シミュレーションで訓練し、実機へゼロショット転送に成功した。
原題: Vision-Guided Outdoor Flight and Obstacle Evasion via Reinforcement Learning / Shiladitya Dutta, Aayush Gupta, Varun Saran 他
日本語で読む → - 論文ロボット学習基盤ロボティクス
RIO: クロスエンボディメントロボット学習のための柔軟なリアルタイムロボットI/O
多様なロボットハードウェアと形態に対応した、柔軟で軽量なロボット制御・遠隔操作・データ整形・センサ設定・ポリシー展開のためのオープンソースPythonフレームワークを提案し、VLAモデルの展開と微調整を実証した。
原題: RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning / Pablo Ortega-Kral, Eliot Xing, Arthur Bucker 他
日本語で読む → - 論文SLAMロボティクス
低動的環境におけるマルチセッション地表面テクスチャSLAM
地表面テクスチャのみを特徴とする環境で、マルチセッションSLAMの軌跡推定精度を向上させる手法を比較し、KLダイバージェンスを用いた類似度スコアとループ閉じ込み信頼度へのバイアスが最も効果的であることを示した。また、セッション間で地面が変化するマルチセッション画像と高精度な姿勢情報を含むデータセットを公開した。
原題: Multi-Session Ground Texture SLAM in Low-Dynamic Environments / Kyle M. Hart, Brendan Englot
日本語で読む → - 論文模倣学習ロボティクス
キーポイント模倣学習の汎化能力、設計選択、および限界について
RGBベースの模倣学習の汎化を改善するため、視覚基盤モデルによるキーポイント表現を用いた模倣学習(KIL)の設計選択を検討し、実機2000回以上の試行で評価。KILはRGBベースライン(47%)を上回る75%の成功率を達成し、S2拡散モデルと同等の性能を示した。
原題: On the Generalization Capabilities, Design Choices and Limitations of Keypoint Imitation Learning / Thomas Lips, Marco Moletta, Michael C. Welle 他
日本語で読む → - 論文安全性ロボティクス
実行するか否か:デモから学習した視覚運動ポリシーの安全性の確保
模倣学習で学習した視覚運動ポリシーに対し、状態空間内の特定領域から実行保証を提供する安全指標を提案し、Nagumoの条件を用いて安全性を検証する手法を実証した。
原題: To Do or Not to Do: Ensuring the Safety of Visuomotor Policies Learned from Demonstrations / Riad Ahmed, Moniruzzaman Akash, Momotaz Begum
日本語で読む → - 論文セマンティックセグメンテーションロボティクス
オフロード環境におけるセマンティックセグメンテーションの分布シフト緩和法
オフロード環境でのセマンティックセグメンテーションの精度低下を招く分布シフトに対し、スタイル拡張とテクスチャ正則化を用いたフレームワークST-Segを提案し、既存手法を上回る性能を実証した。
原題: How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments / Ji-Hoon Hwang, Daeyoung Kim, Hyung-Suk Yoon 他
日本語で読む → - 論文世界モデル画像認識
DiLA: 分離された潜在アクション世界モデル
未ラベル動画から世界モデルを学習する際の、アクション抽象化と生成忠実度のトレードオフを、コンテンツと構造の分離によって解決する新しい潜在アクションモデルを提案した。
原題: DiLA: Disentangled Latent Action World Models / Tianqiu Zhang, Muyang Lyu, Yufan Zhang 他
日本語で読む → - 論文V2X通信ロボティクス
複数LED送信機とイベントカメラを用いた車両可視光通信の実環境レイテンシ解析
イベントカメラをVLC受信機として用い、複数LEDからの同時受信と実車両環境でのエンドツーエンド遅延を評価し、協調認識要件を満たすことを示した論文。
原題: Real-world Latency Analysis of Vehicular Visible Light Communication with Multiple LED Transmitters and an Event-Based Camera / Ryota Soga, Tsukasa Shimizu, Shintaro Shiba 他
日本語で読む → - 論文マニピュレーションロボティクス
MSACT: 安定した低遅延精密操作のための多段階空間位置合わせ
双腕精密操作において、限られたデータでも視覚的なドリフトを抑えつつ低遅延で安定した動作を実現するため、多段階空間アテンションモジュールと時間的位置合わせ損失を導入したACTベースの手法を提案した。
原題: MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation / Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa 他
日本語で読む →