論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/VLAロボティクス
SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
原題: SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios / Tian Gao, Celine Tan, Catherine Glossop 他
日本語で読む → - 論文宇宙ランデブー誘導ロボティクス
近距離ランデブー軌道設計と誘導のための自律型エンドツーエンド凸最適化フレームワーク:ハードウェアテストベッドによる検証
深層学習による知覚と凸最適化に基づく軌道設計・誘導を統合し、センサ故障やエンジン故障にも対応する近距離ランデブー自律フレームワークCORTEXを提案し、シミュレーションとハードウェア実験で検証した。
原題: An Autonomous, End-to-End, Convex-Based Framework for Close-Range Rendezvous Trajectory Design and Guidance with Hardware Testbed Validation / Minduli C. Wijayatunga, Julian Guinane, Nathan D. Wallace 他
日本語で読む → - 論文ナビゲーション画像認識
MerNav: ゼロショット物体目標ナビゲーションのための高汎化メモリ・実行・レビューフレームワーク
メモリ・実行・レビューの3モジュールからなるフレームワークを提案し、ゼロショット物体目標ナビゲーションにおいて成功率と汎化性能を両立させ、実機ヒューマノイドでも検証した。
原題: MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation / Dekang Qi, Shuang Zeng, Xinyuan Chang 他
日本語で読む → - 論文VLAロボティクス
RISE: 構成可能な世界モデルによる自己改善ロボット方策
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
原題: RISE: Self-Improving Robot Policy with Compositional World Model / Jiazhi Yang, Kunyang Lin, Jinwei Li 他
日本語で読む → - 論文自動運転/オフローディングロボティクス
コネクテッド自動運転車向けの汎用サービス指向ファンクションオフローディングフレームワーク
自動運転車の計算タスクを位置情報に基づいてローカルまたはMECサーバへ振り分ける汎用オフローディング枠組みを提案し、軌道計画への適用で有効性を実証した。
原題: A Generic Service-Oriented Function Offloading Framework for Connected Automated Vehicles / Robin Dehler, Michael Buchholz
日本語で読む → - 論文VLAロボティクス
注意が裏切るとき:視覚トークン再構成によるロボットポリシーのバックドア攻撃消去
VLAモデルのバックドアが深層注意を乗っ取る仕組みを解明し、テスト時に異常トークンを検出・マスクしてトリガー除去画像を再構成することで、再学習なしに攻撃を無効化する防御手法Beraを提案した。
原題: When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens / Xuetao Li, Pinhan Fu, Wenke Huang 他
日本語で読む → - 論文位置推定ロボティクス
TreeLoc: 森林における樹木間幾何マッチングによる6自由度LiDARグローバル位置推定
森林環境でLiDARを用いて樹木の幹と胸高直径を手がかりに場所認識と6自由度姿勢推定を行うグローバル位置推定フレームワークを提案し、多様な森林ベンチマークで高精度を達成した。
原題: TreeLoc: 6-DoF LiDAR Global Localization in Forests via Inter-Tree Geometric Matching / Minwoo Jung, Nived Chebrolu, Lucas Carvalho de Lima 他
日本語で読む → - 論文プランニング機械学習
世界モデルのための並列確率的勾配ベースプランニング
学習した世界モデルの微分可能性を活かし、状態を最適化変数として扱う並列化可能な確率的プランナーGRASPを提案。視覚入力からの長期制御タスクで既存手法を上回る。
原題: Parallel Stochastic Gradient-Based Planning for World Models / Michael Psenka, Michael Rabbat, Aditi Krishnapriyan 他
日本語で読む → - 論文ワールドモデル画像認識
DISK: ワールドモデル向け動的推論スキップ
自動回帰型ワールドモデルにおいて、動画と自己軌跡の拡散トランスフォーマーを二重分岐制御器で協調させ、再学習なしに適応的に推論をスキップする手法を提案。運転シナリオで品質を保ちつつ最大2倍の高速化を実現。
原題: DISK: Dynamic Inference SKipping for World Models / Anugunj Naman, Gaibo Zhang, Ayushman Singh 他
日本語で読む → - 論文VLAAI
CRL-VLA:継続的視覚-言語-行動学習
VLAモデルの継続的な強化学習微調整において、安定性と可塑性のトレードオフを非対称な制御と二重クリティック構造で解決するフレームワークを提案。
原題: CRL-VLA: Continual Vision-Language-Action Learning / Qixin Zeng, Shuo Zhang, Hongyin Zhang 他
日本語で読む → - 論文群制御cs.MA
マルチエージェント探索のための反事実的条件付き尤度報酬
各エージェントの探索貢献をチーム全体の探索に対する独自の寄与として評価する反事実的条件付き尤度報酬を提案し、疎な報酬の協調タスクでの学習を加速させる。
原題: Counterfactual Conditional Likelihood Rewards for Multiagent Exploration / Ayhan Alp Aydeniz, Robert Loftin, Kagan Tumer
日本語で読む → - 論文VLA画像認識
VISTA: 視覚条件付けを強化する追従選好最適化によるVLAモデル
VLAモデルが視覚状態に弱く依存してしまう問題に対し、追従タスクでの選好最適化と潜在蒸留で視覚条件付けを強化し、タスク性能を向上させた。
原題: VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models / Yiye Chen, Yanan Jian, Xiaoyi Dong 他
日本語で読む → - 論文マニピュレーションロボティクス
SERNF: 正規化フローとアクションチャンク批評家によるサンプル効率の高い実世界器用把持ポリシーのファインチューニング
正規化フローで多峰性のある行動チャンクの正確な尤度を計算し、チャンク単位の批評家で価値推定を行うことで、実機ロボットの器用な操作ポリシーを少ない試行回数で安定にファインチューニングする手法を提案。
原題: SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows / Chenyu Yang, Denis Tarasov, Davide Liconti 他
日本語で読む → - 論文人間-ロボット協調機械学習
オフポリシー評価による人間-ロボット協調のための強化学習の定式化
実環境や人間のフィードバックなしに、記録済みの対話データのみを用いてオフポリシー評価で状態表現と報酬関数を選択する強化学習フレームワークを提案し、Lunar LanderとNASA-MATB-IIで検証した。
原題: Formulating Reinforcement Learning for Human-Robot Collaboration through Off-Policy Evaluation / Saurav Singh, Rodney Sanchez, Alexander Ororbia 他
日本語で読む → - 論文歩行ロボティクス
GrandTour: 実環境における脚式ロボットのマルチモーダル知覚と状態推定のためのデータセット
ANYmal-D四脚ロボットにLiDAR・カメラ・固有感覚センサを搭載し、山岳から都市・廃墟まで多様な屋内外環境で収集した大規模マルチモーダルデータセットを公開。RTK-GNSSとトータルステーションによる高精度な正解軌道も含み、SLAMや状態推定、マルチモーダル学習の評価基盤を提供する。
原題: GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation / Turcan Tuna, Jonas Frey, Frank Fu 他
日本語で読む → - 論文マルチタスクRL/世界モデル機械学習
世界モデルの混合:モジュール型潜在ダイナミクスによるマルチタスク強化学習のスケーリング
タスクごとにモジュール化したVAEと専門家混合型Transformerで世界モデルを構成し、Atari 100kとMeta-Worldで高効率・高性能なマルチタスク強化学習を実現した。
原題: Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics / Boxuan Zhang, Weipu Zhang, Zhaohan Feng 他
日本語で読む → - 論文食事支援ロボットロボティクス
ロボット支援による社会的食事のホワイトグローブサービス化
障害者の社会的食事を支援するロボットの設計に向け、当事者参加型デザインで理想的なシナリオを抽出し、ホワイトグローブサービスとしての要件を明らかにした。
原題: Robot-Assisted Social Dining as a White Glove Service / Atharva S Kashyap, Ugne Aleksandra Morkute, Patricia Alves-Oliveira
日本語で読む → - 論文自動運転/軌道生成画像認識
MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
原題: MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving / Junli Wang, Yinan Zheng, Xueyi Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
OVerSeeC: 衛星画像と自然言語からのオープンボキャブラリ・コストマップ生成
衛星画像と自然言語の指示から、LLMとオープンボキャブラリ・セグメンテーションを組み合わせて、未知の地形やミッション固有の走行ルールに対応した実行可能なコストマップをゼロショットで生成するフレームワーク。
原題: OVerSeeC: Open-Vocabulary Costmap Generation from Satellite Images and Natural Language / Rwik Rana, Jesse Quattrociocchi, Dongmyeong Lee 他
日本語で読む → - 論文安全探索ロボティクス
安全確率的探索器:確率的環境における安全な目標駆動型探索と未知物体との安全な相互作用
ガウス過程で未知の安全関数をオンライン学習し、予測不確実性を活用して確率的環境下でも安全に目標探索と未知物体との相互作用を行うフレームワークを提案。
原題: Safe Stochastic Explorer: Enabling Safe Goal Driven Exploration in Stochastic Environments and Safe Interaction with Unknown Objects / Nikhil Uday Shinde, Dylan Hirsch, Michael C. Yip 他
日本語で読む → - 論文sim2realロボティクス
シンプルなモデルで実現する遊泳:腱駆動水中ロボットのデジタルツイン
腱駆動の魚型ロボットをMuJoCo上で簡易な無状態流体モデルにより再現し、実機の遊泳軌道から5つの流体パラメータを同定することで、未見の駆動条件にも汎化するデジタルツインを構築した。強化学習による目標追従で93%の成功率を達成した。
原題: Simple Models, Real Swimming: Digital Twins for Tendon-Driven Underwater Robots / Mike Y. Michelis, Nana Obayashi, Josie Hughes 他
日本語で読む → - 論文データ収集画像認識
AoE: 身体性AIのための常時オンの一人称視点人間動画収集システム
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
原題: AoE: Always-on Egocentric Human Video Collection for Embodied AI / Bowen Yang, Zishuo Li, Yang Sun 他
日本語で読む → - 論文ニューロモーフィックハードウェアロボティクス
多いほど良い:ロボット制御のための複数ニューロモーフィックコンポーネントのオンチップ実行
スパイキングニューラルステートマシンを用いて複数のニューラルネットワークをニューロモーフィックハードウェア上でオーケストレーションし、視覚ベースのロボット制御パイプラインをオンチップで実行できることを示した。
原題: The More the Merrier: Running Multiple Neuromorphic Components On-Chip for Robotic Control / Evan Eames, Priyadarshini Kannan, Ronan Sangouard 他
日本語で読む → - 論文歩行者予測画像認識
車両情報を条件とした3D歩行者姿勢予測のための歩行者-車両相互作用モデリング
周囲の車両情報を明示的に取り込み、歩行者の3D姿勢を予測するフレームワークを提案。Waymo-3DSkelMoに車両バウンディングボックスを追加し、車両エンコーダと歩行者-車両クロスアテンションで予測精度を向上させた。
原題: Modeling 3D Pedestrian-Vehicle Interactions for Vehicle-Conditioned Pose Forecasting / Guangxun Zhu, Xuan Liu, Nicolas Pugeault 他
日本語で読む → - 論文VLAAI
対照的世界モデル:身体エージェントパイプラインにおける行動実行可能性学習
大規模言語モデルを対照学習で微調整し、意味的に似ているが物理的に不可能な行動を識別する行動スコアラーを提案。ScienceWorldベンチマークでSFTより高精度を達成。
原題: CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines / Chayan Banerjee
日本語で読む → - 論文マルチエージェント経路計画ロボティクス
エレベーター付きマルチエージェント経路探索のための競合ベース探索
複数階にまたがるエージェントの経路計画において、エレベーターの利用を考慮した競合ベース探索手法を提案し、エレベーター起因の競合と状態空間の拡大に対処する。
原題: Conflict-Based Search for Multi-Agent Path Finding with Elevators / Haitong He, Xuemian Wu, Shizhe Zhao 他
日本語で読む → - 論文到達可能性解析ロボティクス
V-MORALS: 学習された潜在空間における吸引領域の視覚的モースグラフ支援推定
画像ベースの軌道データから潜在空間を学習し、モースグラフを用いて吸引領域を推定する手法を提案。状態情報なしでセンサデータのみから到達可能性解析を可能にした。
原題: V-MORALS: Visual Morse Graph-Aided Estimation of Regions of Attraction in a Learned Latent Space / Faiz Aladin, Ashwin Balasubramanian, Lars Lindemann 他
日本語で読む → - 論文NeRF/イベントカメラ画像認識
イベントカメラ支援による高速飛行ドローンのための鮮明な放射輝度場再構成
高速飛行するドローンの運動ぼけ画像とイベントストリームを融合し、NeRF最適化と自己運動推定を同時に精錬することで、高精度な3D放射輝度場とカメラ軌跡を教師なしで復元する手法を提案。
原題: Event-Aided Sharp Radiance Field Reconstruction for Fast-Flying Drones / Rong Zou, Marco Cannici, Davide Scaramuzza
日本語で読む → - 論文動画推論画像認識
超大規模動画推論スイート
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
原題: A Very Big Video Reasoning Suite / Maijunxian Wang, Ruisi Wang, Juyi Lin 他
日本語で読む → - 論文イベントカメラ画像認識
動きを考慮したイベントカメラのイベント抑制
イベントカメラのストリームから自己運動と独立移動物体によるイベントをリアルタイムに分離・抑制する軽量フレームワークを提案し、セグメンテーション精度と推論速度を大幅に向上させた。
原題: Motion-aware Event Suppression for Event Cameras / Roberto Pellerito, Nico Messikommer, Giovanni Cioffi 他
日本語で読む →