論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文シミュレーションロボティクス
BWM: ロボット学習のための低コスト高忠実度ワールドシミュレータ
ロボット操作学習のための、初期環境ガイダンスと動的視覚履歴、行動条件付けを組み合わせたアクション条件付きワールドモデルを提案し、模倣学習のデータ拡張とポリシー評価に活用する。
原題: BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning / BWM Team
日本語で読む → - 論文フローマッピングロボティクス
曖昧なセンシングと位置ずれ下での安全なフロー場マッピング
ロボットが局所的な流れの推定をグローバルマップに書き込む際、観測の曖昧さや位置ずれによる誤った更新を防ぐため、マップ参照を考慮した保守的な融合フレームワークを提案し、ゴースト構造の混入を大幅に削減した。
原題: Write-Safe Flow Field Mapping under Ambiguous Onboard Sensing and Localization Drift / Linhao Jin, Qimin Feng, Peter Gunnarson 他
日本語で読む → - 論文群制御ロボティクス
分散ISAC対応車両協調のための目標指向型セマンティック通信
無信号交差点での車両協調において、センシングと通信を統合し、交通スループット向上に重要な情報のみを送信する目標指向型セマンティック通信フレームワークを提案した。
原題: Goal-Oriented Semantic Communication for Distributed ISAC-Enabled Vehicle Coordination / Wenjie Liu, Yansha Deng
日本語で読む → - 論文VLA/安全性ロボティクス
バリア強化フローマッチングによる安全な視覚言語行動モデル
フローマッチング生成モデルに制御バリア関数の安全性保証を統合し、モデル内部のノイズ除去過程を変更することで安全な軌道を生成する手法を提案。外部フィルタ不要で、操作タスクとナビゲーションで安全性と成功率を両立。
原題: Safe Vision Language Action Models via Barrier Enhanced Flow Matching / Kasra Sinaei, Hung-Chieh Wu, Donald Ebeigbe
日本語で読む → - 論文VLA/高速化ロボティクス
ActionCache: アクションキャッシュとリファインメントによる視覚言語行動モデルの学習不要高速化
フローベースの視覚言語行動モデルにおける反復的ノイズ除去の計算ボトルネックを、過去の中間アクションを再利用する外部キャッシュで解消し、推論遅延を大幅に削減する手法を提案した。
原題: ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement / Ryuji Oi, Hikari Otsuka, Kosuke Matsushima 他
日本語で読む → - 論文歩行ロボティクス
低コスト四足ロボットハードウェアにおける強化学習
低コスト四足ロボットの遅延やノイズを考慮し、時間認識ニューラルネットワークと平均遅延モデルを用いてsim-to-realギャップを縮小し、堅牢な歩行を実現した。
原題: Reinforcement Learning on Cost-Constrained Quadrupedal Hardware / Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus
日本語で読む → - 論文群制御ロボティクス
曲率制約と等速条件下でのマルチロボット同時到着分散制御
固定翼UAVなど曲率制約と等速条件を持つマルチロボットに対し、最大コンセンサスプロトコルに基づく分散スイッチング制御で同時到着を実現する手法を提案した。
原題: Curvature-Constrained and Constant-Speed Distributed Simultaneous Arrival Control for Multi-Robot Systems / Zhouru Xiao, Yang Lu, Weijia Yao 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルを用いたトークンベースのアフォーダンス接地
大規模視覚言語モデルの出力トークンの注意マップを活用し、外部教師なしで行動関連領域を特定するゼロショットのアフォーダンス接地フレームワークを提案した。
原題: Token-Based Affordance Grounding with Large Vision-Language Models / Seung Il Lee, Qinqian Lei, Daguang Xu 他
日本語で読む → - 論文軌道予測ロボティクス
IMR: マルチエージェント軌道予測のための反復モードワールド重み付き回帰
自動運転車の周囲車両の意図理解を目的に、モード崩壊を防ぎつつ予測精度を高める新しい損失関数と反復デコーダを提案し、Argoverse 2ベンチマークで最高性能を達成した。
原題: IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction / Honglin Wang, Shiyao Pan, Yun-Fu Liu
日本語で読む → - 論文ロボット基盤モデルロボティクス
ロボット基盤モデルにおける近道学習を軽減する人工中心窩知覚
ロボット基盤モデルがシーン内の無関係な相関に依存する「近道学習」を起こす問題を指摘し、タスク関連領域に注意を向けるマスクを生成する軽量モジュール(AFP)を提案。微調整時の補助信号として用いることで、モデルの性能とロバスト性を向上させる。
原題: Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models / Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete 他
日本語で読む → - 論文軌道予測画像認識
メトリクス非依存の軌道予測に向けて
軌道予測モデルの訓練をメトリクス非依存の確率的目標に変更し、メトリクス最適化を下流タスクとして扱う新しいパラダイムを提案。WaymoベンチマークでSOTAを達成。
原題: Towards Metric-Agnostic Trajectory Forecasting / Markus Knoche, Daan de Geus, Bastian Leibe
日本語で読む → - 論文世界モデル機械学習
ODEWorld: 物理時間の流れに基づく連続予測アーキテクチャ
物理世界の連続的な時間を捉えるため、常微分方程式(ODE)を用いた連続時間の潜在世界モデルを提案し、離散時間モデルの限界を克服した。
原題: ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow / Dongxiu Liu, Haoyi Niu, Peng Cheng 他
日本語で読む → - 論文自動運転/VLAロボティクス
S-squared-VLA: 自動運転のための視覚言語行動モデルにおける意味ストリームと空間ストリームの分離
自動運転向けの視覚言語行動モデルにおいて、意味情報と空間情報のストリームを分離し、空間表現の崩壊を防ぐことで、高精度な制御を実現する新しいアーキテクチャを提案した。
原題: S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving / Jianguo Yu, Rukang Wang, Duanfeng Chu 他
日本語で読む → - 論文VLA画像認識
VLAFlow: 共学習と未来潜在整合による視覚-言語-行動モデルの統合学習フレームワーク
ロボット操作のための視覚-言語-行動モデル(VLA)の学習手法を統一フレームワークで比較し、言語教師あり学習と未来潜在整合を組み合わせることで、異種データに対する転移性能が最も安定することを示した論文。
原題: VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment / Guoyang Xia, Fengfa Li, Hongjin Ji 他
日本語で読む → - 論文タスク計画ロボティクス
礼儀正しい先読み:持続的共有環境における長期タスク計画の改善
共有環境でロボットが順次タスクを与えられる際、将来のタスクや他ロボットへの影響を考慮して計画を立てる手法を提案し、長期的なコストを削減した。
原題: Courteous Anticipation: Improving Long-Lived Task Planning in Persistent Shared Environments / Md Ridwan Hossain Talukder, Roshan Dhakal, Elizabeth Phillips 他
日本語で読む → - 論文ワールドモデルロボティクス
ロボット描画によるロボット因子化ワールドモデル
ロボットの動作をワールドモデルから分離し、ロボットの軌道をURDFで描画して視覚入力に組み込むことで、物体の応答予測に特化した新しいワールドモデルを提案した。
原題: Robot-Factored World Models via Robot Rendering / Byungjun Kim, Taeksoo Kim, Hyunsoo Cha 他
日本語で読む → - 論文マニピュレーションロボティクス
戦略的スケールアップ:バイアス認識評価とデータ収集によるロボット操作の構成的汎化学習
事前学習済みポリシーが指示の一部の要素(色など)に過剰に依存する「指示因子バイアス」を定量化する診断フレームワークを提案し、その結果に基づいてデータ収集を再配分することで、少ないデモ数で汎化性能を向上させる手法を示した。
原題: Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation / Yu Qi, Zhang Ye, Xinyi Xu 他
日本語で読む → - 論文位置推定/センサ融合ロボティクス
NGPS: GPS非依存の航空機地理的位置推定と2.5D再構成 - 深層衛星画像マッチングとマルチレートセンサ融合による実現
GPSが使えない環境で、UAVの下方カメラ画像と衛星画像を深層特徴でマッチングし、絶対位置を推定するシステムを提案。VIOやIMUと融合し、リアルタイムで2.5Dオルソモザイク再構成も行う。
原題: NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion / Sanket Sharma
日本語で読む → - 論文航法/地形マッピングロボティクス
PRISM: 不整地環境におけるローバー航法のためのマルチモーダル地形マッピング
RGB・深度・熱画像を統合し、視覚変換器ベースのネットワークで地形をセグメンテーションして走行可能性マップを生成する、ローバー航法用のマルチモーダル認識システムを提案した。
原題: PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments / Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes 他
日本語で読む → - 論文協調認識/V2X/シミュレーションロボティクス
協調認識を検証するための展開型ハイブリッド車両インザループプラットフォーム
実車両とCARLAデジタルツインをV2Xで接続し、協調認識モジュールの性能を実証するハイブリッド車両インザループプラットフォームを構築・評価した。
原題: A Deployed Hybrid Vehicle-in-the-Loop Platform for Validating Cooperative Perception / Anastasia Bolovinou, Giorgos Hadjipavlis, Markos Antonopoulos 他
日本語で読む → - 論文身体化タスク計画ロボティクス
UniETP: 汎用身体化タスク計画のための環境統合
4つのシミュレータを統合した統一インターフェースを提案し、身体化タスク計画の評価と学習データの多様性を向上させる。
原題: UniETP: Unifying Environments for Generalizable Embodied Task Planning / Peiran Xu, Jiaqi Zheng, Ziyou Wang 他
日本語で読む → - 論文ロボット操作ロボティクス
逐次ロボットタスクにおける構成的一般化の診断
逐次ロボット操作タスクで、指示の組み合わせに対する一般化の失敗原因を分解し、訓練データのカバレッジ構造が重要であることを示した論文。
原題: Diagnosing Compositional Generalization in Sequential Robot Tasks / Yixiao Wang, Cheng-En Wu, Lingfeng Sun 他
日本語で読む → - 論文触覚/操作ロボティクス
N0-TWAM: 接触を伴う操作のための触覚ネイティブな世界行動モデルの大規模化
触覚情報を活用し、将来の視覚と接触を予測する世界行動モデルを大規模に事前学習し、接触を伴う操作タスクでの性能を実証した。
原題: $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation / NeoteAI Team, Fudan TEAI Team
日本語で読む → - 論文把持/コンプライアンス/ハイブリッドモデルロボティクス
解析モデルを組み込んだニューラルネットワークによるロボットハンドの把持コンプライアンス予測
力強い道具使用時の把持コンプライアンスを予測するため、解析力学モデルとデータ駆動学習を組み合わせたハイブリッドモデルAMINNを提案し、3指の劣駆動ハンドで評価した。
原題: Predicting Grasping Compliance in Robotic Hands through Analytical-Model-Informed Neural Networks / Qianwen Zhao, Long Wang
日本語で読む → - 論文ワールドモデル画像認識
深度正則化JEPAワールドモデルによる実屋外ロボットデータからの転移可能な表現学習
実ロボットの屋外映像から学習するJEPAベースのワールドモデルに、深度を幾何学的先行知識として導入し、潜在表現の等方性を促す正則化を組み合わせることで、タスク非依存で多様かつ高エントロピーな表現を獲得し、視覚オドメトリ誤差の低減や異常検知性能の向上を実現した。
原題: Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data / Usman M. Khan
日本語で読む → - 論文VLAロボティクス
VLAモデルのテスト時モダリティ適応のための因果性を考慮した推論-診断-精緻化フレームワーク
視覚と言語と行動を統合するVLAモデルにおいて、テスト時に視覚情報の重要度を因果効果として推定し、行動予測を動的に調整するフレームワークを提案した。
原題: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models / Haoyu Zhang, Yuwei Wu, Jin Chen 他
日本語で読む → - 論文操作ロボティクス
WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
原題: WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory / Haisheng Su, Zongdai Liu, Xin Jin 他
日本語で読む → - 論文ナビゲーションロボティクス
Transformerを超えて:オープンボキャブラリ物体目標ナビゲーションのための線形注意ポリシー
オープンボキャブラリ物体目標ナビゲーションにおいて、Transformerベースのポリシーが文脈長に対して性能がスケールしないことを示し、線形注意を採用したLANavを提案。状態更新を構造化することで性能が向上し、特にWSLA機構により平均成功率が36.4%に達した。
原題: Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation / Jiahong Zhang, Yifan Lin, Yandong Zhang 他
日本語で読む → - 論文LLM検証AI
LLMを検証器として使う:汎用検証フレームワーク
LLMの検証能力を新たなスケーリング軸として捉え、追加学習なしでエージェントタスクにきめ細かいフィードバックを与える汎用検証フレームワークを提案した。スコアの粒度拡大や繰り返し評価、基準分解により検証精度を向上させ、複数のベンチマークで最高性能を達成した。
原題: LLM-as-a-Verifier: A General-Purpose Verification Framework / Jacky Kwok, Shulu Li, Pranav Atreya 他
日本語で読む → - 論文SLAMロボティクス
クロス視差に基づく物体レベル運動推定と幾何フィルタリングを用いたステレオ視覚SLAMシステム
動的環境で頑健なステレオ視覚SLAMを提案。視差とクロス視差の差を用いて動的特徴点を検出し、3D物体検出とカルマンフィルタで物体の動きを分類することで、静的・動的要素を分離して高精度な軌跡推定を実現した。
原題: A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity / Sujan Kumar Dhali, Bhaskar Dasgupta
日本語で読む →