論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/6 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文シーン理解画像認識
移動ロボットのための物理・地理空間に基づくシーン解釈
事前学習済みのVLMの出力に、OpenStreetMapの建物・道路情報とセンサから得た位置・時間・距離情報をLLMで統合し、物理・地理空間に基づく自然言語のシーン記述を生成する手法を提案した。大学構内での実験で建物接地F1=0.83、路面接地F1=0.64を達成した。
原題: Physico-Geospatial Grounded Scene Interpretation for Mobile Robotics / Nicolas Schuler, Janik Kurtz, Lea Dewald 他
日本語で読む → - 論文音響/ワールドモデルcs.SD
BinauralVAE: ワールドモデルのための空間音響再構成
視覚に依存しがちな既存のワールドモデルに対し、空間音響に着目し、ロボットのナビゲーション行動と音響結果の因果関係を学習するためのパイプラインを提案。様々なVAEアーキテクチャを評価し、バイノーラル信号の潜在表現を獲得する。
原題: BinauralVAE: Spatial Audio Reconstruction For World Models / Luis Vitor Zerkowski, Luiz Velho
日本語で読む → - 論文制御ロボティクス
幾何学的分布制御:部分的な構造知識を用いた学習進捗
既知の幾何学や制約を活用しつつ、未知のタスク進捗方向を学習する制御手法を提案。実時間制御の中間領域(モデルベースと強化学習の間)を対象とし、進捗重み付きデータから局所的な価値勾配を学習する。
原題: Geometric Distributional Control: Learning Progress with Partial Structural Knowledge / Tong Wu
日本語で読む → - 論文3Dマッピングロボティクス
SHIFT: 表面認識型高速TSDF統合
3Dマッピングの計算コストを削減するため、平面領域を圧縮し勾配を凍結する新しいTSDF統合フレームワークを提案。RGB-DとLiDARデータで最大4倍の高速化とメモリ削減を実現。
原題: SHIFT: Surface-aware High-speed Integration For TSDFs / Ayaan Choudhury, Lokender Tiwari
日本語で読む → - 論文空中ロボット/探査/拡散ポリシーロボティクス
CAVEAT: 地図なし空中探査のためのリカレント多モーダル拡散プランニング
この論文は、UAVの探査経路生成を、グローバルマップを保持せずに、LiDAR・視覚・姿勢の多モーダル観測と固定次元のリカレント内部状態から行う拡散ポリシーCAVEATを提案している。シミュレーションと実機実験で有効性を示した。
原題: CAVEAT: Recurrent Multimodal Diffusion Planning for Mapless Aerial Exploration / Steven Visch, Nicolò Botteghi, Antonio Franchi 他
日本語で読む → - 論文VLAロボティクス
身体性を持つSLMにおける幾何条件付け:0.8Bハイブリッドモデルでの訓練制御とロバスト性診断
0.8Bのハイブリッド言語モデルを操作タスクに適応させ、幾何学的入力の条件付けが性能に与える影響を評価した。訓練時の幾何学的整合性による明確な優位性は見られず、座標不変性と物理的配置の汎化のギャップを示した。
原題: Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model / Hao Li, Haofei Sun, Lin He
日本語で読む → - 論文継続学習画像認識
アプリケーションストリーム上の継続的GUIエージェント学習のための選択的知識制御
GUIエージェントの継続学習において、ニューロン単位の勾配操作により過去の知識を保護しつつ新しいアプリケーションに適応する軽量な選択的知識保持手法を提案した。
原題: Selective Knowledge Control for Continual GUI Agent Learning over Application Streams / Zirui Shang, Xin Shu, Yang Liu 他
日本語で読む → - 論文医用画像/セグメンテーション/連合学習画像認識
連合学習環境下におけるX線透視画像でのカテーテル・ガイドワイヤセグメンテーションの新規手法
X線透視画像におけるカテーテルとガイドワイヤのセグメンテーションを、構造認識型の連合学習フレームワークを用いて改善した論文。
原題: Novel Methods for Catheter and Guidewire Segmentation in X-ray Fluoroscopy under a Federated Learning Setting / Chayun Kongtongvattana
日本語で読む → - 論文ナビゲーション画像認識
一つのMLLM、一回の呼び出し:空間認識ウェイポイントによる効率的なゼロショット視覚言語ナビゲーション
連続環境での視覚言語ナビゲーション(VLN-CE)において、各意思決定ステップで単一の大規模モデルを一度だけ呼び出す効率的なゼロショットナビゲーションフレームワークO2C-Navを提案。訓練不要のウェイポイント生成器と抽象表現を用いてRGB画像上に候補ウェイポイントを可視化し、MLLMが選択した目標をFMMプランナーで衝突回避経路に変換する。
原題: One MLLM, One Call: Efficient Zero-Shot Vision-and-Language Navigation via Spatial-Aware Waypoints / Shiqi Pan, Qi Zheng, Hanqin Sun 他
日本語で読む → - 論文操作学習/クロスエンボディ転移ロボティクス
A4A: 人間のデモからの行動指向4Dアフォーダンスのクロスエンボディ転移
人間のデモから行動指向の4Dアフォーダンス(相互作用点の将来軌跡)を学習し、ロボットポリシーの事前学習に利用することで、多様なVLAポリシーの操作性能を向上させる手法を提案した。
原題: A4A: Cross-Embodiment Transfer of Action-Oriented 4D Affordances from Human Demonstrations / Yifan Han, Litao Liu, Yuqi Gu 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
GLoRI: グローバル・ローカル参照相互作用によるヒューマノイド移動操作のための閉ループ全身追跡
ヒューマノイドの全身動作追跡を高精度化するため、グローバルな位置補正とローカルな動作構造を融合する閉ループ制御器GLoRIを提案し、シミュレーションから実機への転移でも高い精度と汎化を実証した。
原題: GLoRI: Closed-Loop Whole-Body Tracking with Global-Local Reference Interaction for Humanoid Loco-Manipulation / Qingyao Xu, Sheng Yin, Zibo Zhou 他
日本語で読む → - 論文4D再構成画像認識
PASTEL: 単眼4Dシーン再構成のためのパノラマ位置合わせ
単眼ビデオから可視領域の再構成と不可視領域の生成を組み合わせた4Dシーン合成手法を提案。視点計画を2次元方向探索に変換するパノラマ位置合わせにより、観測範囲外のシーンを効率的に生成し、再構成性能も向上させる。
原題: PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction / Yuankun Yang, Yi Wei, Bo Bai 他
日本語で読む → - 論文強化学習ロボティクス
SCoCaT: 成功条件付き制約強化学習による宇宙機ドッキング
終端ナビゲーションタスクにおける制約付き強化学習の「実現可能性崩壊」問題を特定し、補助価値批判による成功信号の追加で解決する手法を提案・実証した。
原題: SCoCaT: Success Conditioned Constrained Reinforcement Learning for Spacecraft Docking / Aman Arora, Ricard Marsal I Castan, Matteo El-Hariry 他
日本語で読む → - 論文画像検出画像認識
FACT: ツール使用軌跡をコンパイルしたAI生成画像検出のためのフォレンジックエージェント
AI生成画像を検出するために、画像に応じてフォレンジックツールを選択・実行するエージェントを学習する手法を提案。固定検出器ではなく、証拠が十分になるまでツールを呼び出し、進化・蒸留・洗練のパイプラインで高性能を達成した。
原題: FACT: A Forensic Agent with Compiled Tool-Use Trajectories for AI-Generated Image Detection / Jiaoyang Chen, Bin Hu, Jingyu Hu 他
日本語で読む → - 論文VLAロボティクス
失敗境界学習によるロバストな視覚言語行動モデル
専門家デモの模倣だけでは失敗境界が不明なため、デジタルツインでのロールアウトとセマンティック進捗定位を用いて失敗境界を発見・整形し、ロバストなVLAモデルを実現する手法DLSを提案。
原題: Where Success Breaks: Failure-Boundary Learning for Robust Vision-Language-Action Models / Yanzhe Chen, Zhijun Cao, Mike Zheng Shou
日本語で読む → - 論文VLA/力覚制御ロボティクス
CR-VLA-Force: 制御認識型コンプライアンスVLAモデルによる頑健な接触豊富なロボット操作の学習
力覚認識を統合したVLAモデルが精密な力追従と迅速な調整に弱い問題を解決するため、マルチモーダルMoEと多段階訓練、適応コンプライアンス制御を備えたCC-VLAフレームワークを提案し、実機実験で有効性を示した。
原題: CR-VLA-Force: Learning Control-aware Compliance VLA Model for Robust Contact-rich Robotic Manipulation / Zhaohong Mai, Chao Wang, Chao Zeng 他
日本語で読む → - 論文SLAMロボティクス
最適化ベースSLAMのためのモーメントマッチング確率データ関連付け
最適化ベースのSLAMに確率データ関連付けを統合し、複数の測定値を確率的にランドマークへ関連付けて仮想測定を生成する手法を提案。誤検出・未検出がある環境で従来法より位置推定精度が向上することを示した。
原題: Moment-Matching Probabilistic Data Association for Optimization-Based SLAM / Khoa Nguyen, Mitchell Turton, Florian Meyer
日本語で読む → - 論文群制御ロボティクス
通信劣化下での分散型マルチロボットタスク割り当てにおけるバンドル長のトレードオフ
マルチロボットタスク割り当てにおけるバンドル長の影響を、理想通信とパケット損失下で系統的に評価し、通信劣化時には最適なバンドル長が変わることを示した。
原題: Bundle Length Tradeoffs in Decentralized Multi-Robot Task Allocation Under Degraded Communications / James Lott, Vahraz Honary
日本語で読む → - 論文自動運転ロボティクス
クロスビュー変換器による鳥瞰図マップの閉ループ評価:行動クローニング方策への入力として
自動運転の行動クローニングにおいて、カメラ予測による鳥瞰図(BEV)マップを入力として用いた際の閉ループ性能をCARLAシミュレータで評価し、カーネル密度推定による重み付けが運転性能を向上させることを示した論文。
原題: Closed-Loop Evaluation of Bird's-Eye-View Maps from Cross-View Transformers as Inputs to Behavior-Cloning Policies / Felipe Carlos dos Santos, Eric Antonelo, Gustavo Claudio Karl Couto
日本語で読む → - 論文VLA画像認識
MobileVLA-R1 2.0: モバイルロボット制御のための強化学習強化推論
モバイルロボットのVLAシステムにおいて、言語指示を実行可能な行動に変換する課題に対し、構造化された推論と強化学習を組み合わせたフレームワークを提案し、ナビゲーションや操作タスクで評価した。
原題: MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control / Ting Huang, Yue Huang, Zeyu Zhang 他
日本語で読む → - 論文シミュレーション/飛行制御ロボティクス
FALCON-S: 固定翼地面効果空力シミュレータと飛行制御学習スイート
固定翼航空ロボットの地面近くでの飛行制御開発・評価のための高忠実度シミュレーションフレームワークを提案。6自由度物理、地面効果空力、センサノイズ等をモデル化し、RL学習や最適制御の並列実行を可能にする。
原題: FALCON-S: Fixed-wing ground-effect Aerodynamics Simulator and Flight Control Learning Suite / Matteo El Hariry, Pedro Lima, Andrej Orsula 他
日本語で読む → - 論文マニピュレーションロボティクス
GloVLA: 幾何学的移動と局所VLAの相互作用による非構造環境での頑健な物体中心操作
物体中心操作を幾何学的な移動制御と局所的なVLAポリシーに分離するハイブリッドフレームワークを提案し、非構造環境での成功率と推論コストを改善した。
原題: GloVLA: Let Geometry Move and Local VLA Interact for Robust Object-Centric Manipulation in Unstructured Environments / Truong Thanh Nguyen, Huy Hoang Nguyen, Ha Anh Nguyen 他
日本語で読む → - 論文マニピュレーションロボティクス
RefGuard: 対象・基準・フレームの同時接地による同一性認識型言語誘導ロボット操作
言語指示が指す物体を、対象・基準・参照フレームの3変数の同時事後分布で推定し、実行・確認・再観察・中止を判断する同一性認識型の接地フレームワークを提案。実機で同一性スイッチをゼロにしつつ、曖昧な場面でも90%の成功率を達成した。
原題: RefGuard: Identity-Aware Language-Guided Robot Manipulation via Joint Target-Anchor-Frame Grounding / Lan Wei, Kangyi Lu, Yongchen Wang 他
日本語で読む → - 論文世界モデル/計画AI
部分観測下での身体化推論のための反事実世界モデルの学習
視覚的に尤もらしい未来を予測するが介入の違いを区別できない「反事実崩壊」という失敗モードを特定し、それを防ぐ対比的学習を取り入れた反事実潜在世界モデル(CLWM)を提案した。遮蔽操作やエイリアス化ナビゲーションなどのタスクで計画成功率を向上させた。
原題: Learning Counterfactual World Models for Embodied Reasoning under Partial Observability / Todd Y. Zhou, Daniel Zhang
日本語で読む → - 論文UIデザイン/SVG編集HCI
MM-SVGEdit: マルチモーダル駆動によるUIデザイン向けSVG編集
UIデザイン向けのSVG編集を、自然言語指示と直接操作の両方をサポートするマルチモーダル駆動の手法で実現し、精度とユーザー制御性を向上させた。
原題: MM-SVGEdit: A Multimodal-Driven SVG Editing for UI Design / Shibo Yang, Yuqing Gao, Zipeng Liu
日本語で読む → - 論文視覚追跡画像認識
CST-WM: 因果構造を持つ世界モデルによる身体化視覚追跡
ロボットの視覚追跡において、行動と観測の因果関係を正しくモデル化した世界モデルを提案し、追跡と再捕捉を統一的に計画する。
原題: CST-WM: A Causally Structured World Model for Embodied Visual Tracking / Junyi Hu, Shuaihang Yuan, Yi Fang
日本語で読む → - 論文歩行者軌道予測機械学習
EgoNeMo: 自己中心型LiDARスキャンによる歩行者ダイナミクスの転移可能なマップ
自己中心型3D LiDAR点群のみを用いて、未知環境でも適用可能な歩行者運動特性のマップ(MoD)を推定するフレームワークを提案した。
原題: EgoNeMo: Transferable Map of Pedestrian Dynamics via Egocentric LiDAR Scan / Azusa Sawada, Allan Wang, Hideo Saito 他
日本語で読む → - 論文データ生成ロボティクス
IM-ENGINE: 具現化データ生成のための画像編集
画像編集を中間表現として用い、シミュレータで物理検証されたロボット実行可能なデータを生成するパイプラインを提案。器用な把持合成とゴール状態生成に応用し、意味的に意味があり物理的に実行可能な教師データをスケーラブルに生成する。
原題: IM-ENGINE: Image Editing for Embodied Data Generation / Yian Wang, Junyi Cao, Xiaowen Qiu 他
日本語で読む → - 論文制御理論ロボティクス
認証権限のための観測設計:射影・推定可能性の分離とアクティブフェイス等価性
安全な実行許可ゲートが認証できる行動を最大化する観測設計を理論的に解析し、制約法線の分解による分離定理と、最適設計が特定のフェイス集合で特徴づけられる等価定理を導出した。
原題: Observation Design for Certified Control Authority: Projection--Estimability Separation and Active-Face Equivalence / Guangxi Wan, Hualong Du, Yuqi Liu 他
日本語で読む → - 論文操作ロボティクス
人間が避ける行動からどう学ぶか?介入認識型ワールドモデルと実世界RLによる器用な操作
人間の介入を単なる修正ではなく、将来のリスク予測信号として活用する安全重視のRLフレームワークWHIRLを提案し、多指ロボットハンドでの複雑な把持・操作タスクで成功率向上と介入削減を実証した。
原題: How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation / Jiaju Yin, Zhenhui Zhang, Lixin Xu 他
日本語で読む →