論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文最適輸送/制御理論math.OC
ガウス分布に対する非均衡最適輸送と密度制御の大域的最適解法
ガウス分布を参照測度とする非均衡最適輸送とその動的拡張である密度制御問題を、有限次元最適化とSDPに帰着させて大域的に解く手法を提案した。
原題: Globally Solving Unbalanced Optimal Transport and Density Control for Gaussian Distributions / Haruto Nakashima, Siddhartha Ganguly, Kenji Kashima
日本語で読む → - 論文モデルベースRL/視覚制御機械学習
ELVIS: 長期的視覚MPCのためのアンサンブル校正潜在想像
モデルベース強化学習による視覚制御の長期計画を実用的にするため、ガウス混合MPPIと不確実性を考慮したラムダリターンを用いた潜在モデル予測制御器ELVISを提案し、シミュレーションと実世界のタスクで性能を向上させた。
原題: ELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPC / Yurui Du, Pinhao Song, Yutong Hu 他
日本語で読む → - 論文ナビゲーションロボティクス
専門化を超えて:手続き的マップ生成によるロバストな強化学習ナビゲーション
強化学習ナビゲーションの汎化性能を、多様な手続き的マップ生成器を組み合わせて訓練することで向上させる手法を提案し、シミュレーションと実機で検証した。
原題: Beyond Specialization: Robust Reinforcement Learning Navigation via Procedural Map Generators / Christian Jestel, Nicolas Bach, Marvin Wiedemann 他
日本語で読む → - 論文センサ読み出しロボティクス
シフトレジスタ多重化による高速・スケーラブルな器用ロボットハンド用センサ読み出し
器用なロボットハンド向けに、シフトレジスタ原理に基づくスケーラブルなアナログセンサ読み出しアーキテクチャを提案し、腱駆動ハンドで20チャネルを1kHzで読み出すことを実証した。
原題: High-Speed, Scalable Sensor Readout for Dexterous Robotic Hands via Shift-Register Multiplexing / Jaehoon Kim, Lazaros Christoforidis, Michalis Papadakis 他
日本語で読む → - 論文VLA画像認識
StableVLA: 追加データなしで堅牢な視覚言語行動モデルを実現
視覚障害に対するVLAモデルの脆弱性を調査し、情報理論に基づく軽量アダプタ(IB-Adapter)を提案。追加データや拡張なしで平均30%の性能向上を達成し、パラメータ増加は10M未満。
原題: StableVLA: Towards Robust Vision-Language-Action Models without Extra Data / Yiyang Fu, Chubin Zhang, Shukai Gong 他
日本語で読む → - 論文モデル予測制御機械学習
ユークリッド近接を超えて:地平線一致軌道到達可能性メトリクスによる潜在世界モデルの修復
潜在世界モデルにおける終端コストの誤ったランキングを修正するため、軌道到達可能性メトリクス(TRM)を提案し、固定された潜在モデルに対して後付けで学習する手法を実証した。
原題: Beyond Euclidean Proximity: Repairing Latent World Models with Horizon-Matched Trajectory Reachability Metrics / Liangyu Li, Shengzhi Wang, Qingwen Liu
日本語で読む → - 論文物体検出画像認識
省エネルギーなスパイキングニューラルネットワークを用いたニューロモーフィックLiDAR鳥瞰図物体検出
LiDAR点群の鳥瞰図表現から物体検出を行う、エンドツーエンドのスパイキングエンコーダ・デコーダネットワークを提案し、KITTIベンチマークで高い精度を達成した。
原題: Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks / Sambit Mohapatra, Senthil Yogamani, Heinrich Gotzig 他
日本語で読む → - 論文VLA/幾何理解画像認識
幾何基盤モデルが視覚言語行動モデルに与える影響の理解
視覚言語行動モデル(VLA)と3D再構成のための幾何基盤モデル(GFM)の統合について、VLAの幾何理解の欠如を線形プロービングで定量化し、幾何情報を注入する3つのアーキテクチャを比較、さらに非アーキテクチャ的選択の影響を分析した。
原題: Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models / Yurou Yang, Muyuan Lin, Roberto Martin-Martin 他
日本語で読む → - 論文自動運転ロボティクス
自動運転のための軽量な信頼度認識言語モデルによる意思決定
大規模言語モデルの推論能力を軽量モデルに蒸留し、信頼度付きの意思決定を高速に行う自動運転フレームワークを提案した。
原題: Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving / Ruoyu Yao, Ruiguo Zhong, Pei Liu 他
日本語で読む → - 論文歩行ロボティクス
OCELOT: 脚式ロボットのためのオドメトリと接触推定
脚式ロボットの自己位置推定を、IMU・関節エンコーダ・力センサのみを用いて行うパイプラインを提案。接触検出と滑り検出を融合し、不確実性を考慮した推定を実現した。
原題: OCELOT: Odometry and Contact Estimation for Legged Robots / Emre Girgin, Cagri Kilic
日本語で読む → - 論文sim2realロボティクス
変形マイクロファイバ形状制御のための閉ループsim-to-real強化学習
摩擦のない簡略化シミュレータで学習した強化学習ポリシーを、実機の二把持マイクロマニピュレーションシステムに直接転用し、視覚フィードバックで未モデル化の表面相互作用を補正しながら、シルクマイクロファイバの形状をサブミリ精度で制御する手法を提案した。
原題: Closed-Loop Sim-to-Real Reinforcement Learning for Deformable Microfiber Shape Control / Alessandro Amici, Houari Bettahar, Veeti Jaakkola 他
日本語で読む → - 論文物理シミュレーション/ニューラルワールドモデル画像認識
DeformMaster: ビデオから変形物体のための対話型物理ニューラルワールドモデル
実ビデオから変形物体の物理ダイナミクスと外観を学習し、新しい操作や視点での未来予測とレンダリングを可能にする統一モデルを提案。
原題: DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos / Can Li, Zhoujian Li, Ren Li 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
身体が動く前に:言語条件付きヒューマノイド制御のための予測的関節意図の学習
言語指示に基づくヒューマノイドの全身制御において、将来の接触変化やバランス準備を明示的に予測する階層的フレームワークDAJIを提案し、予測的関節意図を学習することで追従性能と生成品質を向上させた。
原題: Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control / Haozhe Jia, Honglei Jin, Yuan Zhang 他
日本語で読む → - 論文自動運転画像認識
実データと合成データの共学習のための閉ループ動的データ混合
自動運転のエンドツーエンド学習において、実データと合成データを効率的に混合するための自動化された閉ループデータエンジン「AutoScale」を提案し、評価フィードバックに基づいてデータ混合を動的に最適化することで、少ない合成データで性能を向上させる。
原題: Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training / Hongzhi Ruan, Pei Liu, Weiliang Ma 他
日本語で読む → - 論文タスク割り当て/スキル予測ロボティクス
選ぶか選ばないか、それが問題だ:ロボットスキル予測の小規模アンサンブルへの蒸留
自然言語のタスク記述から必要なロボットの物理能力(飛行、車輪、脚など)を予測するモデルを、LLM生成の合成データで訓練した小規模アンサンブルが、巨大な汎用LLMを上回る精度を達成したことを示した論文。
原題: To Select or not to Select, that is the Question: Distilling Robot Skill Prediction into a Small Ensemble / Haechan Mark Bong, Simon Roy, Euhid Aman 他
日本語で読む → - 論文器用操作ロボティクス
関節センサと固有感覚トランスフォーマーによる堅牢な器用な手内操作の学習
腱駆動の器用な手で、関節センサのみを用いて立方体を連続回転させる手法を提案。教師ポリシーから蒸留したトランスフォーマーが関節履歴から物体状態を抽出し、実機で高速回転を達成した。
原題: Learning Robust Dexterous In-Hand Manipulation from Joint Sensors with Proprioceptive Transformer / Senlan Yao, Chenyu Yang, Jaehoon Kim 他
日本語で読む → - 論文タスク計画/長期タスクロボティクス
ContextFlow: 長期的な身体性エージェントのための階層的タスク状態整合
長期的なタスクを実行する身体性エージェントにおいて、プランナーと実行者の間でタスク状態がずれる問題を扱い、明示的な契約と証拠パケットに基づくスコープ付き更新で整合を取るフレームワークContextFlowを提案した。
原題: ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents / Shuhan Guo, Kun Zhang, Haifei Liu 他
日本語で読む → - 論文自動運転ロボティクス
因果関係を考慮した自己中心型シーン共同モデリングによるエンドツーエンド自動運転
自動運転の軌道予測において、自車と周辺エージェントの因果的相互依存を捉えるフレームワークCaADを提案し、閉ループ計画性能を向上させた。
原題: Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling / Seokha Moon, Minseung Lee, Joon Seo 他
日本語で読む → - 論文シミュレーション環境生成ロボティクス
SR-Platform: 自然言語駆動のロボットシミュレーション環境合成のためのエージェントパイプライン
自然言語の記述から物理的に有効なMuJoCoシミュレーション環境を自動生成するエージェントシステムを提案し、実運用データでその性能を評価した。
原題: SR-Platform: An Agentic Pipeline for Natural Language-Driven Robot Simulation Environment Synthesis / Ben Wei Lim, Minh Duc Le, Thang Truong 他
日本語で読む → - 論文VLAロボティクス
PAPO-VLA: 計画を考慮した視覚言語行動モデルのポリシー最適化
VLAモデルの実行を計画と実行の二役に分解し、計画アクションを特定して重要度を推定し、GRPOの利点推定に組み込むことで、タスク成功に重要な行動を重点的に最適化する手法を提案した。
原題: PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models / Peizheng Guo, Jingyao Wang, Changwen Zheng 他
日本語で読む → - 論文ナビゲーション/VLAロボティクス
ウェイポイントを超えて:クロスエンボディメント意味的ナビゲーションのためのデュアルヒートマップ接地
オープンエンドな意味的指示を物理的に実行可能な局所目標に変換する際、単一点回帰の代わりに到達可能領域と向き制約を表すデュアルヒートマップを予測するVLAフレームワークを提案し、多様なロボットでの性能向上を示した。
原題: Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation / Kaijie Yun, Yue Chen
日本語で読む → - 論文地理的定位画像認識
プロトタイプベースの意味的部分発見による天候ロバストなクロスビュー地理的定位
ドローン視点と衛星画像を照合するクロスビュー地理的定位において、天候や高度変化に頑健な軽量ヘッドSkyPartを提案し、最先端の精度を達成した。
原題: Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery / Chi-Nguyen Tran, Dao Sy Duy Minh, Huynh Trung Kiet 他
日本語で読む → - 論文群制御ロボティクス
多様な空中タスクのための自己組織化モジュール型空中ロボット
飛行中に自己組織化して協調操作を行う再構成可能なモジュール型空中ロボットLEGIONを提案し、機敏な飛行と頑健な空中操作のトレードオフを解消する。
原題: Self-assembling Modular Aerial Robot for Versatile Aerial Tasks / Junichiro Sugihara, Masaki Kitagawa, Jinjie Li 他
日本語で読む → - 論文データ生成ロボティクス
FlyMirage:生成的世界モデルによる多様でスケーラブルなUAV飛行データの完全自動生成パイプライン
大規模言語モデルと生成的世界モデルを組み合わせ、高忠実度の3DGSシーンを自動生成し、UAVの飛行軌道を計画することで、多様で現実的な空中VLNデータセットを自動構築するパイプラインを提案した。
原題: FlyMirage: A Fully Automated Generation Pipeline for Diverse and Scalable UAV Flight Data via Generative World Model / Jinhan Li, Xijie Huang, Zhaoqi Wang 他
日本語で読む → - 論文3Dレイアウト生成画像認識
R$^3$L: 相対空間関係からの3Dレイアウト推論
3Dレイアウト生成における相対空間推論の信頼性と一貫性を向上させるフレームワークを提案。多段階推論での誤差蓄積を防ぐため、不変空間分解と一貫性のある空間想像を導入し、物理的に実現可能で意味的に一貫したレイアウトを生成する。
原題: R$^3$L: Reasoning 3D Layouts from Relative Spatial Relations / Zhifeng Gu, Yuqi Wang, Bing Wang
日本語で読む → - 論文姿勢推定ロボティクス
SmoCap: プロキシ写像と信頼領域QPによるスケール・姿勢の統一的標準化
スケール推定と逆運動学を分離せず、信頼領域QP内で形態と姿勢を同時推定する漏れ耐性のある標準化フレームワークを提案し、膝関節屈曲誤差2.9度などを達成した。
原題: SmoCap: Unified Scale-Pose Canonicalization with Proxy-Mapped Trust-Region QP / Shihao Li, Naohiko Sugita
日本語で読む → - 論文接触状態推定ロボティクス
接触モードとスパース則回復のためのサポート安全な変分ハイブリッドフィルタリング
接触を伴うロボットのハイブリッドダイナミクスにおいて、観測が複数の接触状態に対応する場合でも分岐を失わないよう、学習した提案分布と実行可能な遷移則を混合する変分フィルタVHYDROを提案した。
原題: Support-Safe Variational Hybrid Filtering for Contact-Mode and Sparse-Law Recovery / Marios Papamichalis, Regina Ruane
日本語で読む → - 論文データセット/UAV追跡ロボティクス
CosFly-Track: マルチ制約軌道最適化によるUAV視覚追跡のための大規模マルチモーダルデータセット
UAVが動く目標を追跡するための大規模マルチモーダルデータセットと生成パイプラインを提案し、連続3次元空間での多制約最適化により高品質な軌道を生成する。
原題: CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization / Xiangyue Wang, Hanxuan Chen, Songsheng Cheng 他
日本語で読む → - 論文変形操作ロボティクス
視覚的彫塑:長期的ロボット粘土彫刻のための視覚整合プランニング表現
粘土彫刻を形状マッチング問題として捉え、視覚的特徴を捉えたダイナミクスモデルとプランニング手法を提案。複数の変形材料とエンドエフェクタで長期的彫刻を実証した。
原題: Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting / Peter Schaldenbrand, Jean Oh
日本語で読む → - 論文センサフュージョンeess.SP
拡散生成学習によるMEMS IMUの性能限界克服
低コストIMUの測定値から高精度な仮想IMUデータを生成する拡散モデルを提案し、ナビゲーション精度を向上させた。
原題: Overcoming the Intrinsic Performance Limitations of MEMS IMU via Diffusion-Based Generative Learning / Jiarui Lv, Feng Zhu, Xiaohong Zhang
日本語で読む →