論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文階層的計画ロボティクス
ギャップに注意:LeWorldModelにおける階層的計画の約束と落とし穴
階層的計画が長期的な目標条件付き制御でLeWorldModelを改善できるかを調査し、高レベル計画を追加したHi-LeWMを提案。階層化は自動的に性能を向上させず、高レベルサブゴール生成がボトルネックであることを示し、適切な制約で性能が向上することを実証した。
原題: Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel / Niccolò Caselli, Francesco Massafra, Samuele Punzo 他
日本語で読む → - 論文VLA画像認識
時間的比率によるビデオ行動汎化ギャップの理解と緩和
ビデオ基盤モデルをロボット行動データで微調整すると構成的一般化能力が失われる問題を分析し、注意機構に基づく指標「時間的比率」を導入してその原因を解明し、推論時に適応的にガイドする手法を提案した。
原題: Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio / Utkarsh A. Mishra, Yongxin Chen, Danfei Xu 他
日本語で読む → - 論文操作学習ロボティクス
UR-VC: 時間由来の進捗指標に対する教師なしロボット価値補正
デモンストレーションの時間正規化を進捗ラベルとして使う際のノイズを、他エピソードの類似状態から補正する教師なし・学習不要の手法を提案した。
原題: UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies / Lirui Zhao, Modi Shi, Li Chen 他
日本語で読む → - 論文VLAロボティクス
再帰補正・周波数一貫性・対比的フローマッチングによる高忠実度ワンステップ生成型視覚運動ポリシー
拡散モデルやフローマッチングによる生成型ロボットポリシーの多段サンプリングによる推論遅延を解消するため、再帰補正、周波数一貫性、対比的フローマッチングを組み合わせた高忠実度のワンステップ生成フレームワークを提案した。
原題: High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching / Yuran Chen, Xinye Cai, Zhonglin Gong 他
日本語で読む → - 論文VLAロボティクス
FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いる
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
原題: FlowWAM: Optical Flow as a Unified Action Representation for World Action Models / Yixiang Chen, Peiyan Li, Yuan Xu 他
日本語で読む → - 論文VLAロボティクス
GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
原題: GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch / GigaWorld Team, Angen Ye, Angyuan Ma 他
日本語で読む → - 論文制御AI
汎用AI制御:多目的適応アルゴリズムへの道
異なる次数や動特性を持つ多様なシステムを単一のニューラルネットワークで制御する汎用コントローラを提案し、システム固有のLQIコントローラと同等の性能を達成した。
原題: Generalist AI Control: Towards Multi-purpose Adaptive Algorithms / Klinsmann Agyei, Pouria Sarhadi
日本語で読む → - 論文自動運転/センサ融合AI
DeeperRadar: 自動運転知覚のためのエンドツーエンドMIMOレーダ設計とマルチモーダル融合
レーダの受信アンテナ選択を融合モデルと共に学習し、少ない受信機で同等以上の性能を実現するレーダ設計手法を提案した論文。
原題: DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception / Eli Goldenshluger, Barak Pinkovich, Chaim Baskin
日本語で読む → - 論文模倣学習ロボティクス
半人型ロボットNICOによる腕のジェスチャ模倣
RGBカメラ映像からMediaPipeで人体のランドマークを取得し、幾何学的計算で関節角度を求めて半人型ロボットNICOの腕のジェスチャを模倣させるシステムを開発した。
原題: Imitation of Arm Gestures by the Semi-Humanoid Robot NICO / Anastasiya Ihnatovich, Igor Farkaš
日本語で読む → - 論文エッジAI/画像処理画像認識
MiLSD: リソース制約デバイス向けマイクロ線分検出器
MCUレベルのメモリ制約下で高精度な線分検出を実現するため、サブメガバイト予算で動作する検出器MiLSDを提案し、出力表現や量子化の影響を系統的に評価した。
原題: MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices / Parsa Hassani Shariat Panahi, Amir Hossein Jalilvand, M. Hassan Najafi
日本語で読む → - 論文ナビゲーションロボティクス
NavVerse: 屋内から屋外への連続ロボットシミュレーションにおける具現化ナビゲーションのベンチマーク
屋内から屋外への連続的なナビゲーションを評価する物理シミュレーションベースのベンチマークを提案し、既存手法の性能と適応の課題を明らかにした。
原題: NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation / Junzhe Wu, Yue Hu, Zeyu Han 他
日本語で読む → - 論文ナビゲーションロボティクス
ロボストラル・ナビゲート:単眼RGBのみで動作するスケーラブルな視覚言語ナビゲーションモデル
単眼RGB画像のみを入力とし、画像空間上でウェイポイントを予測することで、様々なロボット形態に再較正なしで適用可能な8B視覚言語モデルを提案。大規模シミュレーションデータと効率的な学習手法により、実世界データへの依存を低減しつつ高性能を実現した。
原題: Robostral Navigate / Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra 他
日本語で読む → - 論文マニピュレーションロボティクス
一度試せば最適化:クロスエピソード探索償却のための冗長性除去手順メモリ
隠れた内部状態を持つ物体の操作において、一度解いたインスタンスを再び遭遇した際に再探索せず、物体の特徴に基づいて手順を記憶し再利用するフレームワークを提案。
原題: Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization / Haizhou Ge, Haochen Ouyang, Zhixing Chen 他
日本語で読む → - 論文マニピュレーションロボティクス
Seg2Grasp: ビンピッキングにおける堅牢なモジュール式吸着把持
ビンピッキングのためのモジュール式パイプラインSeg2Graspを提案。セグメンテーション、把持点計算、分類の3段階で構成し、未知の物体や複雑な環境でも高い把持成功率を実現する。
原題: Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking / Hye-Jung Yoon, Juno Kim, Yesol Park 他
日本語で読む → - 論文VLA機械学習
WorldDiT: 世界モデルと行動生成を統合する拡散アーキテクチャ
大規模な事前学習済みVLMを使わずに、単一の拡散トランスフォーマーが行動生成と未来フレームの視覚予測を同時に行うロボットポリシーを提案し、LIBEROベンチマークでパラメータ数と成功率のトレードオフが良好であることを示した。
原題: WorldDiT: A Unified Diffusion Architecture for World and Action Modeling / Sen Wang, R. Gnana Praveen, Bidhan Roy 他
日本語で読む → - 論文歩行ロボティクス
四足歩行のためのトルク駆動強化学習に向けて
重い高トルク四足ロボット向けに、速度推定を必要としないトルク制御ベースの強化学習フレームワークを提案し、シミュレーションで階段昇降や高速歩行を実現した。
原題: Towards Torque-Driven Reinforcement Learning for Quadruped Locomotion / Jordan Dowdy, Jean Chagas Vaz
日本語で読む → - 論文ドローン制御ロボティクス
物理的インタラクションのためのFLOATドローン:横方向気流の低減、ワイヤーレンチモデリング、適応制御
同軸二重ローターとサーボ駆動の制御面を持つ完全駆動UAVを提案し、近接物理的インタラクションのための6自由度ワイヤーレンチ生成と横方向気流低減を実現した。非線形空力モデルを同定し、適応制御により引き出し操作などのタスクを実証した。
原題: FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control / Junxiao Lin, Kehan Zhou, Shuhang Ji 他
日本語で読む → - 論文VLA/操作ロボティクス
SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデル
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
原題: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models / Zonghe Liu, Shanyuan Jie, Xiaoquan Sun 他
日本語で読む → - 論文信頼性評価ロボティクス
信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
原題: Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels / Xinyu Yang, Tianxing Chen, Honghao Su 他
日本語で読む → - 論文ナビゲーションロボティクス
差分に基づく関係学習によるゼロショット物体目標視覚ナビゲーションと直接的なシミュレーションから実機への転移
物体の見た目やカメラ視野角の違いによるシミュレーションと実環境のギャップを克服するため、差分特徴抽出と時間的バッファを組み合わせたT-DRNを提案し、AI2-THORと実機ロボットでゼロショット転移の性能を検証した。
原題: Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer / Guolei Qi, Feitian Zhang
日本語で読む → - 論文模倣学習/転移学習ロボティクス
EgoWAM: 実世界の自己中心視点データによるピクセルを超えた世界行動モデル
自己中心視点の人間データからロボット操作を学習する際、世界の変化を予測する「世界行動モデル」の訓練信号として、ピクセルではなくDINO特徴や3Dフローを用いることで、人間からロボットへの転移性能が向上することを示した。
原題: EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data / Baoyu Li, Xinchen Yin, Mengying Lin 他
日本語で読む → - 論文自動運転ロボティクス
GeoWorldAD: 自動運転のための幾何学的世界アクションモデル
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
原題: GeoWorldAD: Geometry World Action Model for Autonomous Driving / Songyan Zhang, Jinyuan Tian, Hanbing Li 他
日本語で読む → - 論文VLAロボティクス
解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデル
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
原題: Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models / Mingyang Sun, Jiude Wei, Xiujian Liang 他
日本語で読む → - 論文義足制御ロボティクス
リプレイ制約付きシミュレーションフレームワークによるパワード膝-足首義足コントローラの個人化
記録された歩行データを再生するMuJoCoベースのシミュレータを用いて、深層強化学習により義足のインピーダンスパラメータを個人化し、実機での有効性を実証した。
原題: A Replay-Constrained Simulation Framework for Personalization of Powered Knee--Ankle Prosthesis Controllers / Duong Le, Ryan Posh, Shihao Cheng 他
日本語で読む → - 論文最適化/分散推定ロボティクス
行列リー群上の分散因子グラフ最適化のための適応ソルバー学習
分散因子グラフ最適化のための学習型フレームワークDeepCORDを提案し、リーマン最適化器を展開して自己教師ありでソルバーパラメータを適応的に調整する。実データでのSE(3)ポーズグラフ最適化とSL(4)サブマップ整列で既存手法より低い目的値を達成した。
原題: Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups / Jaeho Shin, Maani Ghaffari, Yulun Tian
日本語で読む → - 論文世界モデル/計画ロボティクス
ActSWM: オープンワールドゲームにおける長期的計画のための行動感応型世界モデル
潜在世界モデルが長期的な行動計画で失敗する「コンテキスト崩壊」問題を特定し、行動感応性を制約として課す新しい世界モデルActSWMを提案した。Minecraftでの長期的計画やクロスゲームでの行動復元で性能を向上させた。
原題: ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games / Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng 他
日本語で読む → - 論文操作ロボティクス
練習が方策を生む:人間のデモンストレーションなしでロボット能力をブートストラップし強化する
本論文は、人間のデモンストレーションなしでロボットが自律的に経験を蓄積し、再利用可能な行動を経て効率的な視覚運動ポリシーへと能力を進化させる自己改善型の階層的エージェントHEROを提案する。
原題: Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations / Jialiang Li, Yuhan Wang, Haojun Li 他
日本語で読む → - 論文手術ロボット/故障検出/世界モデルロボティクス
手術ロボット模倣ポリシーのフローマッチング世界モデルによる故障検出
手術ロボットの模倣学習における安全な展開のため、フローマッチング世界モデルを用いて視覚と動作の不整合を検出する故障検出手法FoMo-FDを提案した。故障デモなしで窓単位の検出を実現し、dVRKでの実験で高い検出率を示した。
原題: Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling / Zhefeng Huang, Yilin Cai, Ankit Patel 他
日本語で読む → - 論文世界モデル機械学習
QQWorld: 分位数-分位数マッチングによる世界モデル正則化
潜在世界モデルの正則化に用いられるEpps-Pulley目的関数が裾野で勾配消失する問題を指摘し、分位数-分位数マッチングに置き換えたQQWorldを提案。さらに過去バッチのサンプルを利用するクロスバッチQQでランキングプールを拡大し、制御環境で計画成功率と潜在分布のガウス性を改善した。
原題: QQWorld: Quantile-Quantile Matching for World Model Regularization / Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
日本語で読む → - 論文VLAロボティクス
FibVLA: フィボナッチサンプリングによる効率的な時間的視覚言語行動モデル
長文脈の履歴を効率的に捉えるため、フィボナッチサンプリングを用いた時間的VLAモデルを提案し、行動の滑らかさと成功率を向上させた。
原題: FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling / Li Lin, Wujun Xu, Weiwei Meng 他
日本語で読む →