論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/15 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ワールドモデルロボティクス
学習済みワールドモデルにおける反実仮想ロールアウトのための低ランク動的実効潜在キャリア
学習済みワールドモデルの隠れ状態に小さな低ランク修正を加えることで、将来の観測や教師なしで反実仮想の未来を自律的に生成できることを示した論文。
原題: Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models / Yang Liu, Yuming Chen
日本語で読む → - 論文VLAロボティクス
ForceU-VLA: 力覚を考慮した身体化超音波スキャンのための視覚・言語・行動モデル
超音波スキャン中に力信号と超音波画像を融合し、スキャン段階に応じて適応的に特徴を調整する新しいVLAモデルを提案し、実世界の力覚対応データセットも構築した。
原題: ForceU-VLA: A Force-Aware Vision-Language-Action Model for Embodied Ultrasound Scanning / Xingzheng Wu, Cheng Zhang, Guihao Yan 他
日本語で読む → - 論文強化学習ロボティクス
Max-Q選択的模倣による人間参加型オンラインロボット学習
人間の介入を活用したオンライン強化学習において、介入軌道を直接評価するMC Q-chunk批判と、現在のポリシーとバッファサンプルのうち高いQ値を持つ方を模倣するmax-Q選択的模倣を組み合わせ、介入学習と自己改善を自動的に切り替える手法を提案した。実機のUSB挿入タスクで99%の成功率を30分で達成した。
原題: Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning / Zihang Wang, Yishan Wang
日本語で読む → - 論文遠隔操作/意図推論ロボティクス
GUIDER: 実ロボットデータを用いた遠隔操作における目標非依存の人間意図推論の評価
本論文は、ロボットアームの遠隔操作中に人間の意図を確率的に推論するフレームワークGUIDERを実データで評価し、全シナリオで正しい把持候補を推定できたことを示した。
原題: GUIDER: Evaluating Goal-Free Human Intent Inference for Teleoperated Manipulation on Real-Robot Data / Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo 他
日本語で読む → - 論文動作計画ロボティクス
凸集合グラフのニューラル予測による混合離散連続動作計画の高速化
動作計画を凸集合グラフ(GCS)で定式化し、高コストな凸緩和をグラフ注意ネットワークによる候補経路予測と軽量ランキングで置き換え、早期探索終了で高速化する手法を提案。3Dクアッドロータや7自由度マニピュレータ、平面押し操作で最大2桁の高速化を達成。
原題: Accelerating Mixed Discrete-Continuous Motion Planning via Neural Graphs of Convex Sets / Ananya Trivedi, Sarvesh Prajapati, Mohamed Khalid M Jaffar 他
日本語で読む → - 論文ROS 2 / 通信cs.NI
Adaptive Bridge: ROS 2におけるDDSバックプレッシャーを緩和するプロキシベースの分離層
ROS 2のDDSで、遅い購読者が原因で発生するバックプレッシャーが他の購読者に悪影響を与える問題を解決するため、プロキシを介して重要購読者と非重要購読者を分離し、適応的なレート制御を行う手法を提案した。
原題: Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2 / Kaushalraj Puwar
日本語で読む → - 論文ナビゲーションロボティクス
LAPF: UAVScenesデータセットを用いたLLMエージェントベースの経路探索
UAVの自律ナビゲーションのため、LLMエージェントに知覚・記憶・計画・行動を統合した閉ループ認知アーキテクチャを提案し、市街地規模の環境で経路長を短縮することを実証した。
原題: LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset / Yousef Emami, Mohammadhossein Homaei, Hao Zhou 他
日本語で読む → - 論文ビデオワールドモデルAI
SCOPE: ビデオワールドモデルのためのスコア分離型エージェント最適化
推論時に凍結されたビデオワールドモデルを監査可能な形で適応させるフレームワークSCOPEを提案し、Physics-IQベンチマークで性能向上を実証した。
原題: SCOPE: Score-Isolated Agentic Optimization for Video World Models / Yuhua Jiang, Jiaming Wang, Qingbin Liu 他
日本語で読む → - 論文自動運転/認識ロボティクス
MM-BEV: 重要度に応じた計算で即時性を向上
マルチモーダルBEV認識において、安全上重要な領域に計算リソースを集中させることで、精度を保ちながら推論遅延を大幅に削減するシステムを提案した。
原題: MM-BEV: Enhancing Timeliness by Computing Where and When it Matters / Liangkai Liu, Kang G. Shin
日本語で読む → - 論文UAVナビゲーションロボティクス
形状適合領域による閉鎖・劣化環境での飛行
UAVが洞窟や崩落構造物などの閉鎖環境で安全に飛行するため、知覚誤差を吸収する非凸の進入禁止領域を符号付き距離場に基づいて生成する手法を提案。実データで凸型ベースラインより多くの自由空間を確保しつつ、同等の保証付きカバレッジを達成。
原題: SCORE: Shape-Conforming Regions for Flight in Enclosed, Degraded Environments / Eric Minwoo Kim, Jong-Kook Kim
日本語で読む → - 論文VLAロボティクス
VTInstructor: 連続環境におけるナビゲーション指示生成のための視覚的軌跡プロンプティング
連続環境でのRGB映像からナビゲーション指示を生成する初のフレームワークを提案し、軌跡の幾何学を視覚的プロンプトに変換して指示生成の精度を大幅に向上させた。
原題: VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments / Haolin Yang, Yuxing Long, Zihan Yang 他
日本語で読む → - 論文VLA/強化学習ロボティクス
StructRL: フローベースVLAのための構造化アクション空間探索
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
原題: StructRL: Structured Action-Space Exploration for Flow-Based VLAs / Jiarui Yang, Bin Zhu, Jingjing Chen 他
日本語で読む → - 論文触覚画像認識
EgoTac: 自己中心視覚からの実環境触覚予測
自己中心視覚映像から触覚情報を予測するモデルEgoTacを提案し、570万以上の画像-触覚ペアで学習して高精度な触覚予測を実現した。
原題: EgoTac: In-the-wild Tactile Prediction from Egocentric Vision / Wenkang Zhang, Chengbo Yuan, Zicheng Zhang 他
日本語で読む → - 論文SLAMロボティクス
MotionGS-SLAM: イベント変調ガウススプラッティングによるモーションブラー耐性SLAM
モーションブラーを除去するのではなく、ブラー生成過程をレンダリングパイプラインに組み込むことで、イベントカメラの時間分解能を活用し、高運動条件下でも高精度な軌跡推定と地図構築を実現するSLAMシステムを提案した。
原題: MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM / Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
日本語で読む → - 論文ロボット学習ロボティクス
ロボットポリシー訓練における凍結視覚エンコーダのNPUオフロード
ロボットポリシー訓練時に凍結した視覚エンコーダの計算を低消費電力のNPUにオフロードし、GPUの消費エネルギーを削減する手法を提案・評価した。
原題: NPU Offloading of a Frozen Visual Encoder for Robot Policy Training / Hyojun Yun, Seungjae Won, Hyungpil Moon
日本語で読む → - 論文セグメンテーション画像認識
SOS!:モデルフリーセグメンテーションのための合理化されたオブジェクト条件付きトランスフォーマー
3Dモデルを必要とせず、参照画像1枚だけで未知物体を正確にセグメンテーションする新しい手法を提案。オブジェクト条件付きトランスフォーマーにより、マスク生成と対象特定を単一のフィードフォワードで統合し、効率と精度を両立した。
原題: SOS! : A Streamlined Object-Conditional Transformer for Model-free Segmentation / Jiaqi Hu, Junwen Huang, Hongli Xu 他
日本語で読む → - 論文SLAMロボティクス
HP2-SLAM: 適応型ハイブリッドICPによる堅牢で効率的なLiDAR SLAM
平面性を考慮した適応閾値で点対平面と点対点の残差を動的に切り替えるハイブリッドICPを提案し、構造化・退化環境の両方で安定したLiDAR SLAMを実現した。
原題: HP2-SLAM: Adaptive Hybrid ICP for Robust and Efficient LiDAR SLAM / Nam Tran, Thu Tran, Hieu Phan 他
日本語で読む → - 論文長期操作/空間記憶ロボティクス
GaussMemory: タスク駆動型3Dガウスシーン記憶による長期ロボット操作
ロボットの空間記憶を受動的な記録からタスク駆動の能動的記憶へと転換し、3Dガウススプラッティングを基盤に記憶の更新と読み出しを統合したGaussMemoryを提案。LIBEROやVLABenchで既存手法を上回る性能を示した。
原題: GaussMemory: Task-Driven 3D Gaussian Scene Memory for Long-Horizon Robotic Manipulation / Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
日本語で読む → - 論文制御理論制御
非対称アクチュエータ制約を有する厳密フィードバック非線形システムのための許容性保存制御
アクチュエータの非対称制約や出力制約、レート制限を考慮した安全制御フレームワークを提案し、動的実現により制約を直接組み込むことで、代数クリッピングや飽和補償を不要にした。
原題: Admissibility-Preserving Control for Strict-Feedback Nonlinear Systems with Asymmetric Actuator Constraints / Saurabh Kumar, Shashi Ranjan Kumar, Abhinav Sinha
日本語で読む → - 論文VLM/ベンチマーク/エッジ推論cs.DC
洪水対応のためのエッジ推論セグメンテーションのベンチマーク
洪水対応のためのVLM推論セグメンテーションのベンチマークを提案し、実世界のシーンと応答関連ターゲットからなるデータセットを構築。エッジデバイスでの精度、遅延、エネルギー、通信のトレードオフを評価した。
原題: FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge / Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim 他
日本語で読む → - 論文VLA/パラメータ効率的ファインチューニングロボティクス
PhaseLoRA: 制御フェーズ条件付き低ランク適応による連続動作VLAポリシー
連続動作の操作タスクにおいて、制御フェーズ(接近、接触、把持など)に応じて適応を変化させる軽量なLoRAパラメータ化を提案し、LIBEROベンチマークで成功率を大幅に向上させた。
原題: PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies / Yufei Guo, Yinan Wu, Haoran Duan 他
日本語で読む → - 論文ビデオデブラリング画像認識
動き認識拡散モデルによるUAVビデオのデブラリング:堅牢なターゲット検出への道
UAV映像の動きぼけを除去するための効率的なビデオデブラリング手法を提案し、ターゲット検出精度を向上させる。
原題: UAV Video Deblurring via Motion-Aware Diffusion: A Path to Robust Target Detection / Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
日本語で読む → - 論文リスク知覚ロボティクス
不在の証拠:視覚が失われたときの世界モデル維持のためのクロスモーダル仮説的リスク知覚
視覚が遮られた際に、音響情報の欠如を手がかりに隠れた原因を推論し、リスク警告を発する手法を提案した。実際の隠れた接近場面で、視線が届く前に平均1.7秒の警告を実現した。
原題: Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails / Cong Xu, Ravi Sankar
日本語で読む → - 論文VLA/ベンチマーク画像認識
NumerosityVLM: 視覚言語モデルにおける数量表現の解釈のための認知に着想を得たベンチマーク
視覚言語モデルの数量知覚能力を評価するため、物体の大きさや配置などの視覚的要因を独立に操作した合成画像ベンチマークを構築し、モデル性能の要因分析と層別プロービングを行った。
原題: NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models / Yiming Fu, Fangjun Li, Xiujin Liu 他
日本語で読む → - 論文VLAロボティクス
BICPO-VLA: 行動識別による継続選好最適化を用いた滑らかな非同期視覚言語行動制御
ロボットの動作生成中に生じる要求から引き継ぎまでのギャップを、行動意図の識別、Haar部分空間による動作チャンク分解、参照相対Flow-DPOによる適応の3段階で解消する手法を提案した。
原題: BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control / Ming Shang, Yuchen Huang, Jiaoyang Chen 他
日本語で読む → - 論文安全性/都市モビリティロボティクス
ハザード情報に基づく合成エンベロープによる都市モビリティにおける物理AIの安全性確保
都市環境で多様なロボットが安全に動作するため、ハザード分析と実行時監視を統合した安全エンベロープの枠組みを提案し、シンボリック・空間・動的モデルを横断する安全性変換プロセスを示した。
原題: Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes / Alexei Odinokov, Rostislav Yavorskiy
日本語で読む → - 論文マニピュレーションロボティクス
FlatLab: 平板物体のロボット操作のための統一手法フレームワークとシミュレーションベースのベンチマーク
平板物体の操作を戦略生成と行動実行に分離する統一フレームワークを提案し、多様な物体に汎化する手法と、その評価のための高忠実シミュレーションベンチマークFlatLabを導入した。
原題: FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects / Xingyu Zhu, Wenshuo Han, Zhouyu Wang 他
日本語で読む → - 論文自律航法ロボティクス
連結車両の自律航法のための時空間チューブに基づく安全証明書
トラクタートレーラーなどの連結車両が狭い経路を安全に走行するための計画手法を提案。車両の運動学とスウェイ制約を考慮し、許容補正に基づく時空間チューブを修正して経路の安全証明書を提供する。
原題: Spatiotemporal Tube-Based Safety-Certificate for Autonomous Navigation of Articulated Vehicles / Mohd. Faizuddin Faruqui, Ratnangshu Das, Ravi Kumar L 他
日本語で読む → - 論文自動運転ロボティクス
CORAL: カリキュラム最適化による報酬適応を用いたLiDARベースの目標指向型都市運転
都市自動運転のための強化学習において、段階的なカリキュラムと報酬重みの適応を組み合わせることで、長距離の目標指向ナビゲーション性能を大幅に向上させる手法を提案した。
原題: CORAL: Curriculum-Optimized Reward Adaptation for LiDAR-Based Goal-Directed Urban Driving / Anisa Saleem, Duksu Kim
日本語で読む → - 論文ナビゲーションロボティクス
OccPlanner: 目標認識占有条件付き拡散プランナーによるピクセルゴールナビゲーション
カメラ画像のピクセルで指定された目標へのナビゲーションを、3D占有情報を条件とした拡散モデルで実現。モノクロ動画から3D占有アノテーションを生成する手法も提案し、シミュレーションと実機で高い成功率を達成した。
原題: OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation / Binling Huang, Nianjin Ye, Xi Yang 他
日本語で読む →