論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文セグメンテーション/ドメイン適応画像認識
視野を超えて:外挿型ドメイン適応パノラマセグメンテーション
局所視点画像で学習し、360度パノラマ画像でテストする外挿型ドメイン適応セグメンテーション手法を提案。視野の幾何学的ずれと未知クラスの意味的不確実性を扱う。
原題: Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation / Yuanfan Zheng, Kunyu Peng, Xu Zheng 他
日本語で読む → - 論文位置推定ロボティクス
ブドウ園におけるロボット位置推定のための意味的ランドマーク粒子フィルタ
ブドウ園の平行な列による見た目の類似性で位置推定が失敗する問題に対し、幹や柱の検出を意味的な壁として計測モデルに組み込んだ粒子フィルタを提案し、実地実験で精度を向上させた。
原題: Semantic Landmark Particle Filter for Robot Localisation in Vineyards / Rajitha de Silva, Jonathan Cox, James R. Heselden 他
日本語で読む → - 論文触覚/多脚ロボットロボティクス
多脚ロボットに触覚フィードバックを提供する頑健なアンテナ
多脚ロボット用の触覚アンテナを開発し、接触状態の推定に基づく制御で障害物環境での操縦とスタックからの回復を実現した。
原題: A Robust Antenna Provides Tactile Feedback in a Multi-legged Robot / Zhaochen J. Xu, Juntao He, Delfin Aydan 他
日本語で読む → - 論文軌道予測画像認識
エンドポイント認識モデリングによるリアルタイムストリーミング軌道予測
自動運転のための連続的な軌道予測手法を提案し、過去の予測情報を活用して精度を保ちつつ、推論遅延を大幅に削減した。
原題: Streaming Real-Time Trajectory Prediction Using Endpoint-Aware Modeling / Alexander Prutsch, David Schinagl, Horst Possegger
日本語で読む → - 論文VLA/行動生成/推論高速化ロボティクス
ProbeFlow: 学習不要の適応型フローマッチングによる視覚言語行動モデルの高速化
VLAモデルの行動生成に用いるフローマッチングの推論遅延を、軌道の複雑さに応じて積分ステップ数を動的に調整する学習不要のフレームワークで削減し、実機でも安定した高速動作を実現した。
原題: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models / Zhou Fang, Jiaqi Wang, Yi Zhou 他
日本語で読む → - 論文VLAロボティクス
StreamingVLA: アクションフローマッチングと適応的早期観察によるストリーミング型視覚言語行動モデル
VLAモデルの推論遅延を、アクション生成と実行、観察を非同期に並列化するストリーミング方式で削減し、実行の流暢性を向上させた。
原題: StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation / Yiran Shi, Dongqi Guo, Tianchen Zhao 他
日本語で読む → - 論文VLAロボティクス
VP-VLA: 視覚プロンプトをインターフェースとする視覚言語行動モデル
VLAモデルのブラックボックス的な制御を改善するため、高次推論と低次実行を分離し、視覚プロンプト(十字線やバウンディングボックス)を介して指示を伝える二重システムフレームワークを提案した。
原題: VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models / Zixuan Wang, Yuxin Chen, Yuqi Liu 他
日本語で読む → - 論文動作予測画像認識
SHARP: 短時間ウィンドウストリーミングによる動作予測の正確かつ堅牢な予測
動的交通環境での動作予測において、観測長の不均一性による性能劣化を解決するため、進化するシーンに焦点を当てたストリーミングベースの動作予測フレームワークを提案した。
原題: SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting / Alexander Prutsch, Christian Fruhwirth-Reisinger, David Schinagl 他
日本語で読む → - 論文操作ロボティクス
短期的視野を超えて:非マルコフ的シミュレーションベンチマークにおける頑健な長期操作のためのVQメモリ
非マルコフ的で長期的な操作タスクを評価する新しいベンチマーク「RuleSafe」を提案し、過去の状態を離散トークンに符号化するVQメモリ表現が、既存のVLAモデルの長期計画と汎化性能を向上させることを示した。
原題: Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks / Honghui Wang, Zhi Jing, Jicong Ao 他
日本語で読む → - 論文空中マニピュレーションロボティクス
AeroGrab: 混雑環境における空中把持のための統合フレームワーク
混雑環境での空中把持を実現するため、言語指示に基づく対象物の能動的探索と衝突を考慮した把持候補の評価を統合したエンドツーエンドのパイプラインを提案した。実環境実験でその有効性を示した。
原題: AeroGrab: A Unified Framework for Aerial Grasping in Cluttered Environments / Shivansh Pratap Singh, Naveen Sudheer Nair, Samaksh Ujjawal 他
日本語で読む → - 論文ナビゲーション画像認識
Context-Nav: 文脈駆動探索と視点対応3D空間推論によるインスタンスナビゲーション
テキスト指示に基づき、同じカテゴリの物体の中から正しいインスタンスへ到達するナビゲーション手法を提案。文脈全体を探索の事前情報として活用し、視点対応の3D空間検証で候補を確認する。
原題: Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation / Won Shik Jang, Ue-Hwan Kim
日本語で読む → - 論文ナビゲーションロボティクス
ImagiNav: 生成的視覚予測と逆動力学によるスケーラブルな身体化ナビゲーション
ロボットのナビゲーションを、言語指示を視覚的なサブゴールに分解し、生成ビデオモデルで未来の軌道を想像し、逆動力学モデルで軌道を抽出するというモジュール方式で実現。ロボットデータなしでゼロショット転移を達成する。
原題: ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics / Jie Chen, Yuxin Cai, Yizhuo Wang 他
日本語で読む → - 論文歩行ロボティクス
コスト整合モデル予測制御によるヒューマノイド歩行の効率的強化学習
MPCベースの強化学習フレームワークにおいて、MPCのコスト関数を行動価値関数に整合させることで、効率的な勾配学習を実現し、ヒューマノイド歩行性能とロバスト性を向上させた。
原題: Cost-Matching Model Predictive Control for Efficient Reinforcement Learning in Humanoid Locomotion / Wenqi Cai, Kyriakos G. Vamvoudakis, Sébastien Gros 他
日本語で読む → - 論文模倣学習/行動転移ロボティクス
OCRA: 3Dと触覚の事前知識を用いた物体中心学習による人間からロボットへの行動転移
人間のデモ動画からロボットの操作行動を学習する物体中心フレームワークOCRAを提案。3D点群と触覚情報を統合し、拡散ポリシーでロバストな操作を実現する。
原題: OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer / Kuanning Wang, Ke Fan, Yuqian Fu 他
日本語で読む → - 論文群制御ロボティクス
連結された四脚ロボットによる協調運搬タスクのためのマルチエージェント局所衝突回避学習
四脚ロボット2台が物体を連結して運搬する際、事前地図や経路計画なしにセンサ情報のみで障害物を回避しながら目標方向へ追従する強化学習ベースの階層的制御手法を提案した。
原題: Learning Multi-Agent Local Collision-Avoidance for Collaborative Carrying tasks with Coupled Quadrupedal Robots / Francesca Bray, Simone Tolomei, Andrei Cramariuc 他
日本語で読む → - 論文群制御ロボティクス
共有環境におけるフロー認識型マルチエージェント経路探索を用いた衝突緩和
動的な非制御エージェントと共有する環境で、その動きの学習パターンをMAPFに統合し、衝突を最大55%削減するフレームワークを提案した。
原題: Conflict Mitigation in Shared Environments using Flow-Aware Multi-Agent Path Finding / Lukas Heuer, Yufei Zhu, Luigi Palmieri 他
日本語で読む → - 論文歩行ロボティクス
RL強化MPCによる非周期的脚式・ハイブリッド移動の実現
高層RLエージェントが歩容とナビゲーション指令を生成し、低層MPCが接触タイミングを最適化する階層アーキテクチャを提案。シミュレーションで非周期的歩容を学習し、実機へのゼロショット転送を実証した。
原題: RL-Augmented MPC for Non-Gaited Legged and Hybrid Locomotion / Andrea Patrizi, Carlo Rizzardo, Arturo Laurenzi 他
日本語で読む → - 論文研削ロボティクス
DecompGrind: 切削面計画と接触力適応によるロボット研削の分解フレームワーク
ロボット研削を形状除去計画と接触力適応に分解し、学習を局所的な接触力適応に限定することで、少ないデモデータで異なる形状や硬さのワークを効率的に研削するフレームワークを提案した。
原題: DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation / Shunsuke Araki, Takumi Hachimine, Yuki Saito 他
日本語で読む → - 論文ロボット操作ロボティクス
学習ロボットポリシーの展開時信頼性
学習ベースのロボット操作ポリシーの実世界展開における信頼性向上を目指し、実行時監視、解釈可能性、長期タスク計画の3つの展開時メカニズムを提案した論文。
原題: Deployment-Time Reliability of Learned Robot Policies / Christopher Agia
日本語で読む → - 論文ナビゲーションロボティクス
ELLIPSE: ロバストなウェイポイントと不確実性のための証拠学習
移動ロボットのウェイポイント予測を、多変量深層証拠回帰と軽量なデータ拡張、および等調再較正を用いてロバスト化し、不確実性の信頼性を高める手法を提案した。
原題: ELLIPSE: Evidential Learning for Robust Waypoints and Uncertainties / Zihao Dong, Chanyoung Chung, Dong-Ki Kim 他
日本語で読む → - 論文群制御ロボティクス
SwiftBot: LLM駆動の連合ロボットタスク実行のための分散プラットフォーム
LLMによるタスク分解とDHTオーバーレイ上のコンテナオーケストレーションを統合し、中央制御なしでロボット群が協調してタスクを実行できる分散プラットフォームを提案した。
原題: SwiftBot: A Decentralized Platform for LLM-Powered Federated Robotic Task Execution / YueMing Zhang, Shuai Xu, Zhengxiong Li 他
日本語で読む → - 論文群制御ロボティクス
COHORT: 実時間制約下のマルチロボットシステムにおける大規模DNN推論のためのハイブリッド強化学習
マルチロボットシステムで大規模DNN推論を協調実行するため、オフライン強化学習とオンライン適応を組み合わせたハイブリッドRLフレームワークCOHORTを提案し、バッテリー消費削減とGPU利用効率向上を実証した。
原題: COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints / Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh 他
日本語で読む → - 論文オフロード走行/MPC/安全性ロボティクス
高速・全地形自律走行:機動限界での安全性確保
不整地を高速で走行する自律オフロード車両向けに、転倒を予測・回避しつつリアルタイム実行可能な新しいモデル予測制御(MPC)に基づく局所軌道プランナーを提案した。
原題: High-Speed, All-Terrain Autonomy: Ensuring Safety at the Limits of Mobility / James R. Baxter, Bogdan I. Epureanu, Paramsothy Jayakumar 他
日本語で読む → - 論文SLAMロボティクス
AIM-SLAM: 基礎モデルを用いた適応的かつ情報豊富なマルチビューキーフレーム優先選択による高密度単眼SLAM
幾何学基礎モデルを活用し、適応的なマルチビューキーフレーム選択と統合最適化により、単眼SLAMの高精度なポーズ推定と高密度再構成を実現した。
原題: AIM-SLAM: Dense Monocular SLAM via Adaptive and Informative Multi-View Keyframe Prioritization with Foundation Model / Jinwoo Jeon, Dong-Uk Seo, Eungchang Mason Lee 他
日本語で読む → - 論文操作/オフラインRLロボティクス
スピードアップパッチ:身体操作を加速するプラグアンドプレイ方策の学習
既存の身体操作ポリシーの実行速度が遅い問題に対し、オフラインデータのみで使える軽量な外部スケジューラを導入し、行動チャンクを適応的に間引いて実行を高速化するフレームワークを提案した。
原題: Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation / Zhichao Wu, Junyin Ye, Zhilong Zhang 他
日本語で読む → - 論文データセット/モーション生成/制御ロボティクス
QuadFM: テキスト駆動の四足歩行モーション生成と制御のための基盤データセット
四足歩行ロボット向けに、多様な動作と感情表現を含む大規模なモーションデータセットを構築し、テキストからモーションを生成・制御する統一フレームワークを提案した。
原題: QuadFM: Foundational Text-Driven Quadruped Motion Dataset for Generation and Control / Li Gao, Fuzhi Yang, Jianhui Chen 他
日本語で読む → - 論文VLAロボティクス
AnoleVLA: 深い状態空間モデルを用いたモバイル操作のための軽量視覚言語行動モデル
言語指示に基づくロボット操作のための軽量な視覚言語行動モデルを提案し、深い状態空間モデルを用いて効率的に動作させ、実機で高い成功率と高速な推論を達成した。
原題: AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation / Yusuke Takagi, Motonari Kambara, Daichi Yashima 他
日本語で読む → - 論文楽器ロボットHCI
半自動フルートロボットとその音響センシング
フルート演奏の指使いと低音域のエンブシュア制御を自動化する半自動ロボットを開発し、MIDI入力による自動運指とヘッドジョイント回転による低音域支援を実現した。音響解析により全音域での正確なピッチ生成と低音域での音色変化を確認した。
原題: Semi-Automatic Flute Robot and Its Acoustic Sensing / Hikari Kuriyama, Hiroaki Sonoda, Kouki Tomiyoshi 他
日本語で読む → - 論文ナビゲーションロボティクス
E-SocialNav: 言語モデルを用いた効率的な社会的規範準拠ナビゲーション
ロボットナビゲーションにおける社会的規範遵守を評価し、小型データセットで訓練した効率的な言語モデルE-SocialNavを提案。GPT-4o等の大規模モデルより高速で、社会的行動生成性能が高い。
原題: E-SocialNav: Efficient Socially Compliant Navigation with Language Models / Ling Xiao, Daeun Song, Xuesu Xiao 他
日本語で読む → - 論文VLAロボティクス
FocusVLA: 視覚言語行動モデルにおける視覚情報の焦点化
VLAモデルの性能が視覚表現の質ではなく視覚情報の活用方法に制限されることを示し、注意をタスク関連領域に集中させるFocusVLAを提案した。
原題: FocusVLA: Focused Visual Utilization for Vision-Language-Action Models / Yichi Zhang, Weihao Yuan, Yizhuo Zhang 他
日本語で読む →