論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いる
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
原題: FlowWAM: Optical Flow as a Unified Action Representation for World Action Models / Yixiang Chen, Peiyan Li, Yuan Xu 他
日本語で読む → - 論文VLAロボティクス
GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
原題: GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch / GigaWorld Team, Angen Ye, Angyuan Ma 他
日本語で読む → - 論文自己教師あり学習/3D認識画像認識
TOLiD: 視覚基盤モデルからLiDAR事前学習へのアーキテクチャギャップをトークンリフティング蒸留で橋渡しする手法
視覚基盤モデル(VFM)の特徴をLiDARバックボーンへ蒸留する自己教師あり事前学習法TOLiDを提案。点群をパッチトークン化し、トークン単位の蒸留と可視性マスクでモダリティ・アーキテクチャのギャップを解消する。
原題: TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation / Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy 他
日本語で読む → - 論文制御AI
汎用AI制御:多目的適応アルゴリズムへの道
異なる次数や動特性を持つ多様なシステムを単一のニューラルネットワークで制御する汎用コントローラを提案し、システム固有のLQIコントローラと同等の性能を達成した。
原題: Generalist AI Control: Towards Multi-purpose Adaptive Algorithms / Klinsmann Agyei, Pouria Sarhadi
日本語で読む → - 論文群制御ロボティクス
EFLUX: エージェント型LLMによる弾力的なマルチロボット隊列ナビゲーションと適応
閉塞環境で隊列を変形・再構成しながらナビゲーションするマルチロボットシステムを、LLMを用いて幾何学的に制御するフレームワークを提案した。
原題: EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs / Jinyuan Zhang, Yuwei Wu, Guangyao Shi 他
日本語で読む → - 論文自動運転/センサ融合AI
DeeperRadar: 自動運転知覚のためのエンドツーエンドMIMOレーダ設計とマルチモーダル融合
レーダの受信アンテナ選択を融合モデルと共に学習し、少ない受信機で同等以上の性能を実現するレーダ設計手法を提案した論文。
原題: DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception / Eli Goldenshluger, Barak Pinkovich, Chaim Baskin
日本語で読む → - 論文模倣学習ロボティクス
半人型ロボットNICOによる腕のジェスチャ模倣
RGBカメラ映像からMediaPipeで人体のランドマークを取得し、幾何学的計算で関節角度を求めて半人型ロボットNICOの腕のジェスチャを模倣させるシステムを開発した。
原題: Imitation of Arm Gestures by the Semi-Humanoid Robot NICO / Anastasiya Ihnatovich, Igor Farkaš
日本語で読む → - 論文歩行機械学習
模倣学習に基づく再利用可能なハイブリッド動作プリミティブによる人型ロボット歩行
人型ロボットの歩行制御を、モーションキャプチャの模倣学習で得たスキルを再利用可能な動作プリミティブに変換し、様々なタスクに適用する手法を提案した。
原題: Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation / Valerio Belli, Valerio Modugno, Enrico Mingo Hoffman 他
日本語で読む → - 論文ナビゲーションロボティクス
NavVerse: 屋内から屋外への連続ロボットシミュレーションにおける具現化ナビゲーションのベンチマーク
屋内から屋外への連続的なナビゲーションを評価する物理シミュレーションベースのベンチマークを提案し、既存手法の性能と適応の課題を明らかにした。
原題: NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation / Junzhe Wu, Yue Hu, Zeyu Han 他
日本語で読む → - 論文ナビゲーションロボティクス
ロボストラル・ナビゲート:単眼RGBのみで動作するスケーラブルな視覚言語ナビゲーションモデル
単眼RGB画像のみを入力とし、画像空間上でウェイポイントを予測することで、様々なロボット形態に再較正なしで適用可能な8B視覚言語モデルを提案。大規模シミュレーションデータと効率的な学習手法により、実世界データへの依存を低減しつつ高性能を実現した。
原題: Robostral Navigate / Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra 他
日本語で読む → - 論文マニピュレーションロボティクス
一度試せば最適化:クロスエピソード探索償却のための冗長性除去手順メモリ
隠れた内部状態を持つ物体の操作において、一度解いたインスタンスを再び遭遇した際に再探索せず、物体の特徴に基づいて手順を記憶し再利用するフレームワークを提案。
原題: Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization / Haizhou Ge, Haochen Ouyang, Zhixing Chen 他
日本語で読む → - 論文VLA機械学習
WorldDiT: 世界モデルと行動生成を統合する拡散アーキテクチャ
大規模な事前学習済みVLMを使わずに、単一の拡散トランスフォーマーが行動生成と未来フレームの視覚予測を同時に行うロボットポリシーを提案し、LIBEROベンチマークでパラメータ数と成功率のトレードオフが良好であることを示した。
原題: WorldDiT: A Unified Diffusion Architecture for World and Action Modeling / Sen Wang, R. Gnana Praveen, Bidhan Roy 他
日本語で読む → - 論文ナビゲーションロボティクス
MAMMOTH: モダリティ欠損に頑健なオフロード移動のためのマルチモーダルエンドツーエンドポリシー
RGB、熱画像、3D点群、自己速度などのマルチモーダル観測を融合し、モダリティ欠損に頑健なオフロード自律ナビゲーションポリシーを提案した。拡散ポリシーを用いて物理的に妥当な軌道と走行可能性ヒューリスティックを学習する。
原題: MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality / Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram
日本語で読む → - 論文自動運転・車線変更ロボティクス
移行期自動運転車による車線変更の制御実験:データセットと行動洞察
本論文は、移行期自動運転車(tAV)の必須車線変更行動を定量化するための制御実験データセット(NC-tALC)を提供し、車線変更中のリード・ラグギャップの進化と衝突リスクの発生を分析した。
原題: Controlled Experiments on Lane Changing by Transitional Autonomous Vehicle: Dataset and Behavioral Insights / Abhinav Sharma, Md Abdullah Al Hasan, Danjue Chen 他
日本語で読む → - 論文VLA/操作ロボティクス
SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデル
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
原題: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models / Zonghe Liu, Shanyuan Jie, Xiaoquan Sun 他
日本語で読む → - 論文信頼性評価ロボティクス
信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
原題: Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels / Xinyu Yang, Tianxing Chen, Honghao Su 他
日本語で読む → - 論文VLAロボティクス
解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデル
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
原題: Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models / Mingyang Sun, Jiude Wei, Xiujian Liang 他
日本語で読む → - 論文世界モデル/計画ロボティクス
ActSWM: オープンワールドゲームにおける長期的計画のための行動感応型世界モデル
潜在世界モデルが長期的な行動計画で失敗する「コンテキスト崩壊」問題を特定し、行動感応性を制約として課す新しい世界モデルActSWMを提案した。Minecraftでの長期的計画やクロスゲームでの行動復元で性能を向上させた。
原題: ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games / Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng 他
日本語で読む → - 論文操作ロボティクス
練習が方策を生む:人間のデモンストレーションなしでロボット能力をブートストラップし強化する
本論文は、人間のデモンストレーションなしでロボットが自律的に経験を蓄積し、再利用可能な行動を経て効率的な視覚運動ポリシーへと能力を進化させる自己改善型の階層的エージェントHEROを提案する。
原題: Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations / Jialiang Li, Yuhan Wang, Haojun Li 他
日本語で読む → - 論文手術ロボット/故障検出/世界モデルロボティクス
手術ロボット模倣ポリシーのフローマッチング世界モデルによる故障検出
手術ロボットの模倣学習における安全な展開のため、フローマッチング世界モデルを用いて視覚と動作の不整合を検出する故障検出手法FoMo-FDを提案した。故障デモなしで窓単位の検出を実現し、dVRKでの実験で高い検出率を示した。
原題: Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling / Zhefeng Huang, Yilin Cai, Ankit Patel 他
日本語で読む → - 論文世界モデル機械学習
QQWorld: 分位数-分位数マッチングによる世界モデル正則化
潜在世界モデルの正則化に用いられるEpps-Pulley目的関数が裾野で勾配消失する問題を指摘し、分位数-分位数マッチングに置き換えたQQWorldを提案。さらに過去バッチのサンプルを利用するクロスバッチQQでランキングプールを拡大し、制御環境で計画成功率と潜在分布のガウス性を改善した。
原題: QQWorld: Quantile-Quantile Matching for World Model Regularization / Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
日本語で読む → - 論文VLAロボティクス
FibVLA: フィボナッチサンプリングによる効率的な時間的視覚言語行動モデル
長文脈の履歴を効率的に捉えるため、フィボナッチサンプリングを用いた時間的VLAモデルを提案し、行動の滑らかさと成功率を向上させた。
原題: FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling / Li Lin, Wujun Xu, Weiwei Meng 他
日本語で読む → - 論文模倣学習ロボティクス
RayViT: 視点変動に頑健な模倣学習のためのレイ条件付き視覚表現
カメラの幾何情報を事前学習済みViTに注入する軽量アーキテクチャRayViTを提案し、カメラの摂動に対する模倣学習の頑健性を向上させた。
原題: RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning / Qian Wang, Longrui Chen, Peiran Sun 他
日本語で読む → - 論文性格認識自然言語
理論非依存型適応メトリック整合によるプロトタイプネットワークを用いた性格認識における大規模言語モデル審査員
性格認識において、事前定義された理論に依存せず、共有される潜在的な心理構造を発見する理論非依存型フレームワークJAMを提案。注意プール型グラフプロトタイプネットワークとLLM審査員機構を用いて、異種データセットを統合し、汎化可能な心理表現を学習する。
原題: Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition / Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng 他
日本語で読む → - 論文模倣学習/転移学習ロボティクス
EgoWAM: 実世界の自己中心視点データによるピクセルを超えた世界行動モデル
自己中心視点の人間データからロボット操作を学習する際、世界の変化を予測する「世界行動モデル」の訓練信号として、ピクセルではなくDINO特徴や3Dフローを用いることで、人間からロボットへの転移性能が向上することを示した。
原題: EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data / Baoyu Li, Xinchen Yin, Mengying Lin 他
日本語で読む → - 論文歩行ロボティクス
四足歩行のためのトルク駆動強化学習に向けて
重い高トルク四足ロボット向けに、速度推定を必要としないトルク制御ベースの強化学習フレームワークを提案し、シミュレーションで階段昇降や高速歩行を実現した。
原題: Towards Torque-Driven Reinforcement Learning for Quadruped Locomotion / Jordan Dowdy, Jean Chagas Vaz
日本語で読む → - 論文把握検出/マルチモーダルロボティクス
Speech2Grasp: ヒューマノイドロボットにおけるテキスト条件付き把握検出の音声へのデータ効率的転移
テキスト条件付き把握検出モデルを音声入力に効率的に転移するフレームワークを提案し、実機ヒューマノイドでASRパイプラインより高性能かつ低遅延であることを示した。
原題: Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots / Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu 他
日本語で読む → - 論文制御/LLMエージェントAI
ルール整合型小型言語モデルとマルチエージェント自己補正による閉ループ制御
小型言語モデルを強化学習で制御推論用に調整し、デジタルツイン検証と再プロンプトエージェントを組み合わせた閉ループ制御フレームワークを提案。ランダム熱制御シミュレーションで高い整合精度と低遅延を実証した。
原題: Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction / Yuchen Wang, Javal Vyas, Tong Liu 他
日本語で読む → - 論文ドローン制御ロボティクス
物理的インタラクションのためのFLOATドローン:横方向気流の低減、ワイヤーレンチモデリング、適応制御
同軸二重ローターとサーボ駆動の制御面を持つ完全駆動UAVを提案し、近接物理的インタラクションのための6自由度ワイヤーレンチ生成と横方向気流低減を実現した。非線形空力モデルを同定し、適応制御により引き出し操作などのタスクを実証した。
原題: FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control / Junxiao Lin, Kehan Zhou, Shuhang Ji 他
日本語で読む → - 論文ヒューマノイド/接触制御ロボティクス
ContactMimic: 接触制御によるヒューマノイドの物体インタラクション
キーポイント追跡だけでは不十分な物体インタラクション(椅子に座る、黒板を拭くなど)に対し、接触コマンドを明示的に追跡する学習フレームワークを提案。接触追従報酬と軌道拡張により接触行動をキーポイント幾何から分離し、実世界で接触制御を実現した。
原題: ContactMimic: Humanoid Object Interaction via Contact Control / Xinyao Li, Xialin He, Runpei Dong 他
日本語で読む →