論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文Visual SLAM画像認識
Know-Your-Scene (KYS)-SLAM: ステレオ視覚SLAMにおける特徴マッチングのための階層的意味・運動事前分布
ORB-SLAM3を拡張し、意味・パノプティック・運動の事前分布を階層的に統合して特徴マッチングの対応コストを連続的に調整するSLAM手法を提案。動的物体上の特徴を除外せず減衰させることで、バンドル調整に必要な幾何的対応を保持する。
原題: Know-Your-Scene (KYS)-SLAM: Hierarchical Semantic-Motion Priors for Feature Matching in Stereo Visual SLAM / Preeti Chatterjee, Jin Lu, Jin Sun 他
日本語で読む → - 論文マニピュレーション画像認識
DeltaWAM: 双腕マニピュレーションのためのデルタ世界行動モデル
映像の変化分(デルタ)と行動を同時に予測する世界行動モデルを提案し、双腕ロボット操作の成功率と推論速度を向上させた。
原題: DeltaWAM: Delta World Action Models for Bimanual Manipulation / Han Yan, Zishang Xiang, Haokai Jiang 他
日本語で読む → - 論文ビジュアルサーボロボティクス
VGM-VS: 高精度ビジュアルサーボのための視覚幾何モデルの再考
大規模事前学習済みの視覚幾何モデルを活用し、目標画像との相対カメラ姿勢を推定して閉ループ型ビジュアルサーボを行う手法。シーン固有のメトリック適応によりスケール曖昧性を解消し、USB-CやRAM挿入などの高精度組立タスクでサブミリ精度を達成。
原題: VGM-VS: Rethinking Visual Geometry Model for High-Precision Visual Servoing / Yimin Pan, Sen Wang, You Zhou 他
日本語で読む → - 論文VLA画像認識
潜在進化型ワールドアクションモデル
JEPAエンコーダの予測埋め込みを活用し、ビデオ拡散バックボーンに依存せずに行動生成と環境進化をモデル化するLeWAMを提案。さらにオフライン選好改善手法DemoDPOを導入した。
原題: Latent evolving World Action Model / Xueji Fang, Boqiang Duan, Hua Wu 他
日本語で読む → - 論文ナビゲーションロボティクス
DUGM-R: 不確実性を考慮した動的グリッドマッピングとリスクトリガ型リカバリによる学習ベース局所ナビゲーション
混雑環境での局所ナビゲーション向けに、障害物の動きとその不確実性を統合した動的グリッドマップと、衝突リスクを予測してリカバリ方策を起動する学習フレームワークを提案し、シミュレーションと実機TurtleBot3で有効性を示した。
原題: DUGM-R: Uncertainty-Aware Dynamic Grid Mapping and Risk-Triggered Recovery for Learned Local Navigation / Haoyun Feng, Adrian Rubio-Solis, Zhaodong Guo 他
日本語で読む → - 論文マッピングロボティクス
確率的占有グリッドの階層的情報圧縮のためのサンプルベース手法
大規模な確率的占有グリッドを、MCTSに着想を得たサンプルベースの手法で階層的に圧縮し、いつでも計算を打ち切って有効な表現を得られるようにした。
原題: A Sample-Based Approach for Hierarchical Information-Theoretic Compression of Probabilistic Occupancy Grids / Zhenyu Jin, Daniel T. Larsson
日本語で読む → - 論文医療ロボティクス画像認識
BronchoTop: RGB画像のみによる気管支鏡のトポロジカル位置推定
患者固有のCTや外部センサを使わず、通常の気管支鏡映像のみから気管支内の位置をリアルタイムに推定するフレームワークを提案し、実データで既存手法を20%以上上回る精度を示した。
原題: BronchoTop: Bronchoscopy Navigation via RGB-Only Topological Localization / Clara Tomasini, Ana Cristina Murillo, Luis Riazuelo
日本語で読む → - 論文VLAロボティクス
CoRe-WAM: 対応整合型時間差分によるワールドアクションモデル
物体追跡の対応関係を用いて過去の視覚特徴を現在位置に移動させ、その差分を軽量アダプタでポリシーに組み込むことで、ロボットマニピュレーションの成功率を向上させた研究。
原題: CoRe-WAM: Correspondence-Aligned Temporal Residuals for World Action Models / Bin Zhou, Jialong Liu, Jianan Wang 他
日本語で読む → - 論文移動マニピュレーションロボティクス
地図認識型視覚運動ポリシーによる移動マニピュレーション
テレオペ実演から地図を構築し、ベース姿勢を明示的に予測・追従させることで移動マニピュレーションの成功率を高める枠組みMAVPを提案。
原題: MAVP: Map-Aware Visuomotor Policies for Mobile Manipulation / Jinhe Tang, Ruixiao Dai, Weiming Zhi
日本語で読む → - 論文VLAロボティクス
RouteRLT: VLAポリシーを制御すべきRL専門家をいつ・どれにするか学習する
汎用VLAモデルと精密作業に特化したRL専門家を切り替えるルーティング手法を提案し、接続器挿入やケーブル操作などの実タスクで有効性を示した。
原題: RouteRLT: Learning When and Which RL Specialist Should Control a Vision-Language-Action Policy / Chongyu Zhu, Jaden Hinds, Hyegang Kim 他
日本語で読む → - 論文自動運転ロボティクス
NavSafe-∞:フォトリアル環境における閉ループ運転安全性のベンチマーク
280のシナリオからなるフォトリアルな閉ループ運転ベンチマークを提案し、20のE2Eポリシーを評価して、開ループ性能が閉ループ安全性に必ずしも移行しないことを示した。
原題: NavSafe-$\infty$: Benchmarking Closed-Loop Driving Safety in Photorealistic Environments / Yuxin Bao, Hongwei Ruan, Luobin Wang 他
日本語で読む → - 論文VLAロボティクス
行動は1パッチに値する:PatchWAMによる統合的世界-行動モデリング
連続行動を固定マッピングでパッチとして表現し、専用の行動ヘッドや専門家なしに単一の生成モデルで視覚予測と行動生成を同時に行うPatchWAMを提案。LIBERO-Plusで91.8%、RoboTwin 2.0で96.12%の成功率を達成。
原題: An Action Is Worth One Patch: Unified World-Action Modeling with PatchWAM / Tianheng Wang, Zhou Xie, Heng Jia 他
日本語で読む → - 論文シーン再構成ロボティクス
CODA: 単一RGB-D画像からの深度整合シーン補完と物体分解
単一のRGB-D画像からシーン全体の形状を生成し、環境と可動物体に分解する手法。観測点群との整合性を保つ3Dグラウンディング機構により、物体検出に依存せず高精度な再構成を実現する。
原題: CODA: Depth-Aligned Scene Completion and Object Decomposition from a Single RGB-D Image / Dongwon Son, Junhyek Han, Yoontae Cho 他
日本語で読む → - 論文SLAMロボティクス
2D点群レジストレーションのための符号なし距離マップ
2D点群レジストレーションにおいて、符号なし距離マップを事前計算し、SE(2)多様体上でガウス・ニュートン最適化を行うことで、反復的な最近傍探索を不要にした手法を提案。
原題: Unsigned Distance Maps on 2D Point Cloud Registration / Ricardo B. Sousa, Giorgio Grisetti, Héber Miguel Sobreira 他
日本語で読む → - 論文顔匿名化画像認識
HYDRO: 高忠実度ハイブリッド拡散とターゲット指向アプローチによる非可逆的な顔匿名化
ターゲット指向の顔匿名化に拡散モデルを組み合わせ、復元攻撃を防ぐ非可逆的な匿名化手法を提案。
原題: HYDRO: Towards Non-Reversible Face De-Identification Using a High-Fidelity Hybrid Diffusion and Target-Oriented Approach / Felix Rosberg, Vitomir Štruc, Cristofer Englund 他
日本語で読む → - 論文状態推定eess.SP
リスク対応オンライン等角状態プロービング
状態予測モデルを利用し、最悪ケースの信頼性を保証しながらプロービングの頻度を最小化するオンライン等角状態プロービング(OCSP)を提案。既存の制御ポリシーに再学習なしで適用可能。
原題: Risk-Aware Online Conformal State Probing / Pietro Talli, Petar Popovski, Osvaldo Simeone
日本語で読む → - 論文軌道予測ロボティクス
有限集合マルチモーダル軌道予測における目的地サポート復元
歩行者周辺で動作するロボットの軌道予測において、オンライン更新で偏った目的地サンプルを再調整し、限られた予測候補集合の多様性を保つ手法DSRを提案。再学習なしで予測精度を改善。
原題: Destination Support Restoration for Finite-Set Multimodal Trajectory Prediction / Fengrui Liu, Jiajun Peng, Duo Peng 他
日本語で読む → - 論文多タスク最適化機械学習
インコンテキスト誘導:数値基盤モデルによるタスク間相乗効果の学習と少数ショット多タスク最適化
数値基盤モデルをインコンテキスト学習で活用し、少数評価予算下での多タスク最適化におけるタスク間関係推定を改善するICG-MTOを提案。ベイズ最適化とMFEA-IIに適用し、ロボットアーム制御でも有効性を示した。
原題: In-Context Guidance: Learning Inter-Task Synergies via Numerical Foundational Models for Few-Shot Multitask Optimization / Tingyang Wei, Haofeng Wu, Jiao Liu 他
日本語で読む → - 論文強化学習/エージェントAI
サブタスク分解による強化学習
マルチターンの軌跡報酬をサブタスクごとに分解し、各サブタスクのグループ相対アドバンテージを計算してトークン単位でクレジットを配分するRLDSを提案。エージェント系ベンチマークで有効性を示す。
原題: Reinforcement Learning with Decomposed Subtasks / Mattie Terzolo, Mikolaj Sacha, Ayan Sinha 他
日本語で読む → - 論文テキストtoモーションロボティクス
サンプル・シミュレート・セレクト:学習なしで実現するヒューマノイドの物理シミュレーション・イン・ザ・ループ型テキストtoモーション
学習済みテキストtoモーション生成モデルから複数候補を生成し、物理シミュレータ上で追従制御ポリシーにより実行して最良のものを選ぶことで、追加学習なしにヒューマノイドの動作生成精度を向上させる手法を提案。
原題: Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training / Raphael Memmesheimer, Sven Behnke
日本語で読む → - 論文VLAロボティクス
再構成誤差を超えて:自己回帰型視覚-言語-行動モデルのための解析的・データ駆動型行動トークン化
自己回帰型VLAモデルにおける行動トークン化を、再構成誤差だけでなく閉ループ制御性能の観点から比較し、再構成忠実度だけでは行動表現を選べないことを示した研究。
原題: Beyond Reconstruction Error: Analytical and Data-Driven Action Tokenization for Autoregressive Vision-Language-Action Models / Yuxin Yang, Gaohan He, Changxue Guan 他
日本語で読む → - 論文空中-地上協調/能動知覚ロボティクス
グローバル状態に依存しない空中-地上協調のためのロバスト能動知覚制御
単軸ジンバルでカメラ光軸を機体姿勢から分離し、TCNによるUGV運動予測とMPCを組み合わせることで、グローバル自己位置推定なしにUAVが移動するUGVを継続的に追従できる能動知覚フレームワークを提案した。
原題: Robust Active-Perception Control for Global-State-Free Aerial-Ground Cooperation / Mingxuan Zhang, Jiajun Yu, Baozhe Zhang 他
日本語で読む → - 論文マニピュレーションロボティクス
エンドタスク成功を超えて:ロボティクスにおける視覚経験検索の監査手法
ロボットが過去の経験を再利用する際の選択ルールを、全経験を全シーンで実行して監査する手法を提案し、視覚類似度による選択が特定経験に偏りライブラリ品質に依存することを示した。
原題: Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics / Eshika Pathak, Leela Krishna
日本語で読む → - 論文VLAロボティクス
VisForce: 目標条件付き巧みな操作のための現在力と目標力の視覚的接地
指先位置に現在力と目標力を視覚的に重畳し、目標条件付きクロスアテンションで力認識動作を生成するVLA手法を提案し、実機で把持・操作タスクを評価した。
原題: VisForce: Visual Grounding of Current and Desired Forces for Goal-Conditioned Dexterous Manipulation / Jung-Woo Lee, Soo-Chul Lim
日本語で読む → - 論文自動運転VLAロボティクス
走ってから歩け:VLM自動運転のためのRun-then-Walkスケジューリング戦略
VLMベースの自動運転プランナー向けに、進捗探索を優先する「Run」段階と安全性を修復する「Walk」段階を分けた2段階GRPO報酬スケジューリングを提案し、性能と収束速度を両立させた。
原題: Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving / Yuqi Ye, Shangkun Sun, Junhong Lin 他
日本語で読む → - 論文sim2realロボティクス
φ-RIE: フォトリアリスティック再構成からインタラクティブ環境へ
3Dガウススプラッティングで再構成したシーンから、選択した物体をシミュレータで動かせるアセットに変換し、背景も補完してインタラクティブ環境を構築するパイプラインを提案。
原題: φ-RIE: From Photorealistic Reconstruction to Interactive Environments / Runyi Yang, Deheng Zhang, Xiaoye Wang 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
MATES: 凍結した単一エージェント方策の観測変換によるマルチエージェント相互作用の学習
マルチエージェント環境の観測を、凍結した単一エージェント方策が扱える形式に変換する小さなアダプタを学習することで、方策を再学習せずに協調行動を実現する手法。
原題: MATES: Learning Multi-Agent Interactions by Transforming Observations for Frozen Single-Agent Policies / Elie Abboud, Oren Gal
日本語で読む → - 論文遠隔操作ロボティクス
手首の微細制御は手術遠隔操作の熟練度指標となる
手術ロボット遠隔操作において、熟練者は初心者よりも手首の動きを安定させ、肩と肘の可動域を保ちながら作業を速く完了することを明らかにした研究。
原題: Fine Wrist Control as a Marker of Surgical Teleoperation Expertise / Mary Kate Gale, Shujiro Shobayashi, Sangeet Satpathy 他
日本語で読む → - 論文姿勢推定画像認識
合成データのみで訓練した視覚基盤モデルによる宇宙機の単眼姿勢推定
DINOv3をLoRAで適応し合成データのみで訓練することで、宇宙機の単眼姿勢推定精度を従来手法より大幅に改善し、Jetson Orin NX上での組み込み推論の実現可能性も示した。
原題: Vision Foundation Models with Synthetic-Only Training for Monocular Spacecraft Pose Estimation / John Church, Vazghen Nikolian
日本語で読む → - 論文ロコモーションロボティクス
ムカデの水面遊泳とそのロボフィジカルモデル
ムカデが直接波で水面を泳ぐことを発見し、多脚ロボットモデルで脚の形態と剛性、体波方向、脚の協調が遊泳性能に与える影響を解析した。
原題: Water Surface Swimming in a Centipede and its Robophysical ModeL / Zhaochen J. Xu, Delfin Aydin, Abdullah Mustafa 他
日本語で読む →