論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文非把持操作ロボティクス
把持可能性フィールドの学習による把持指向の非把持操作
物体を特定の姿勢に整えるのではなく、把持成功率を最大化する姿勢へと導く非把持操作手法を提案。学習した把持可能性フィールドを報酬と終了条件に用いることで、シミュレーションと実機で物体を把持可能な状態へ安定して遷移させる。
原題: Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field / Licheng Zhong, Gim Hee Lee
日本語で読む → - 論文SLAMロボティクス
MoPe: 動的環境における堅牢な単眼ガウス写像のための運動永続性
動的物体の「動き」は瞬間的な見た目ではなく時間的な性質であると捉え、過去の動的推定を幾何学的に伝播させて現在の観測と融合する「運動永続性」の原理を導入し、単眼ガウス写像SLAMの動的領域の誤吸収によるゴーストアーティファクトを低減する手法を提案した。
原題: MoPe: Motion Permanence for Robust Monocular Gaussian Mapping in Dynamic Environments / Qixin Xiao
日本語で読む → - 論文異常検出ロボティクス
教師なしメモリ強化ビデオトランスフォーマー:自律農業ローバーの障害物検出
動的農業環境でのリアルタイム障害物検出のための、メモリモジュールを備えた完全教師なしトランスフォーマーモデルを提案し、菜種データセットで最先端性能を達成した。
原題: Unsupervised Memory-Enhanced Video Transformers: Obstacle Detection for Autonomous Agricultural Rover / Théo Biardeau, Anne-Sophie Capelle-Laizé, Salwan Alwan 他
日本語で読む → - 論文VLA画像認識
X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザー
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
原題: X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining / Miracle Kang, Lights Shi, Lucy Liang 他
日本語で読む → - 論文VLAロボティクス
UniFS: 視覚言語行動モデルのための統合高速-低速階層アーキテクチャ
人間の脳の多時間スケール処理に着想を得て、VLM層を更新頻度の異なるグループに階層化し、潜在ベクトル反転機構と多レベル監視戦略を導入することで、高速-低速の周波数ジレンマを解決する新しいVLAアーキテクチャを提案した。
原題: UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models / Lin Sun, Zhiwei Guan, Conglin Wang 他
日本語で読む → - 論文触覚/言語条件付けロボティクス
TacStyle: 構造化行動表現を用いた触覚ロボットポリシーの個人化
言語で好みを伝え、ロボットの動作スタイルを調整する手法を提案。行動の潜在表現を学習し、基盤モデルで解釈して所望の動作を選択する。
原題: TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations / Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai 他
日本語で読む → - 論文交通シミュレーションロボティクス
多交差点都市交通のためのコリドースケールCARLA-VISSIM共シミュレーションフレームワーク
都市部の連続交差点を含むコリドーを対象に、CARLAとVISSIMを双方向に同期させる共シミュレーションフレームワークを構築し、実証実験を行った。
原題: A Corridor-Scale CARLA-VISSIM Co-Simulation Framework for Multi-Intersection Urban Traffic / Sima Ashayer, Austin Haris, Mina Sartipi
日本語で読む → - 論文安全性解析ロボティクス
λ-Reachability: ヒューマノイド安全性のための幾何学的ホライズン安全ベルマン方程式
高次元ロボットシステムの安全性解析をスケーラブルに行うため、割引なしの到達可能性目標を学習できる新しい安全価値推定法λ-Reachabilityを提案し、実機ヒューマノイドで有効性を示した。
原題: $\lambda$-Reachability: Geometric-Horizon Safety Bellman Equations for Humanoid Safety / Rui Chen, Shangtao Li, Yifan Sun 他
日本語で読む → - 論文強化学習/人型ロボット/省エネルギーロボティクス
電力モデル同定に基づく深層強化学習による人型ロボットの省エネルギー腕到達動作
人型ロボットの腕到達動作を省エネルギー化するため、実測電力モデルとSAC強化学習を組み合わせた枠組みを提案し、シミュレーションと実機で検証した。
原題: Energy-Efficient Arm Reaching for a Humanoid Robot via Deep Reinforcement Learning with Identified Power Models / Nestor N. Deniz, Simon Parsons, Fernando Auat Cheein
日本語で読む → - 論文製造/デジタルツインロボティクス
ロボット衣料自動化における導入事例研究:デジタルツイン統合、相互運用性、労働力の有効活用
デニム製造におけるロボット縫製システムの導入事例を報告し、デジタルツインや相互運用性レイヤーによるシステム統合が実用化に重要であることを示した論文。
原題: A Deployment Case Study in Robotic Apparel Automation: Digital Twin Integration, Interoperability, and Workforce Enablement / Gokul Narayanan, Abhiroop Ajith, Jonathan Zornow 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
ReactiveBFM: 汎用ヒューマノイド全身制御に向けたリアクティブ閉ループ動作計画
既存の行動基盤モデルは事前定義された動作しか実行できず環境変化に弱いため、生成型プランナーと追跡制御を閉ループで統合し、曝露バイアスを軽減するリアクティブな全身制御フレームワークを提案した。
原題: ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control / Xiao Chen, Weishuai Zeng, Xiaojie Niu 他
日本語で読む → - 論文自動運転/対向訓練ロボティクス
攻撃からカリキュラムへ:安全な自動運転のための学習可能性ガイド付き対向訓練
自動運転の安全性向上のため、対向シナリオ生成を解決可能かつポリシーの能力に合わせたカリキュラムに変換する学習可能性ガイド付きフレームワークAlignADVを提案した。
原題: From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving / Yuewen Mei, Tong Nie, Jie Sun 他
日本語で読む → - 論文ナビゲーションロボティクス
模倣からアライメントへ:長距離歩道ナビゲーションのための人間の好みに基づくフローポリシー
単眼RGBカメラのみを用いた長距離歩道ナビゲーションのためのポリシーFlowPilotを提案し、模倣学習と人間の介入による選好学習を組み合わせて、複雑な歩道環境での成功率を向上させた。
原題: From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation / Honglin He, Zhizheng Liu, Yukai Ma 他
日本語で読む → - 論文センサ評価ロボティクス
医療用途向け市販深度センサの精度比較
豚骨・豚腹・シリコン腎臓ファントムを用いて、4種類の市販深度センサの精度を比較した論文。Zivid 2M+ 60が全対象で最良の性能を示した。
原題: Comparing Commercial Depth Sensor Accuracy for Medical Applications / Pit Henrich, Maximilian Weiherer, Franziska Hansen 他
日本語で読む → - 論文歩行ロボティクス
Stubborn: 堅牢なモーション追従と転倒回復のための合理化・統合強化学習フレームワーク
ヒューマノイドのモーション追従と転倒回復を単一の強化学習フレームワークで統合し、確率的終了機構とサンプリング分布の動的再形成により、転倒状態からの回復探索を促進する手法を提案した。
原題: Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids / Xiao Ren, Yuhui Yang, Zongbiao Weng 他
日本語で読む → - 論文マニピュレーションロボティクス
Sparse2Act: クロスドメインロボット操作のための行動整合スパース3D表現の学習
点群エンコーダを事前学習する際に、エンドエフェクタの動作を幾何学的監督として用いることで、観測と行動を整合させたスパース3D表現を獲得し、下流のポリシーに転用可能にする手法を提案した。
原題: Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation / Yu Guo, Chang Yu, Siyu Ma 他
日本語で読む → - 論文VLA/操作ロボティクス
ワールドパイロット:世界行動事前知識で視覚言語行動モデルを操縦する
視覚言語行動モデルに、世界モデルから得たシーン進化の潜在表現と予測軌道を事前知識として注入し、分布外操作タスクや実ロボットでの成功率を向上させた。
原題: World Pilot: Steering Vision-Language-Action Models with World-Action Priors / Zefu Lin, Rongxu Cui, Junjia Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
KinematicRL: 運動学的実現可能性を備えた社会的ナビゲーションのためのシミュレーションから実世界への強化学習フレームワーク
この論文は、社会的ナビゲーションのための強化学習フレームワークを提案し、高次制御入力と2D LiDARのみを用いた人間追跡により、シミュレーションと実世界のギャップを低減して動的に実現可能なナビゲーションポリシーを生成する。
原題: KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility / Zhiming Xu, Haodong Yang, Chengju Liu 他
日本語で読む → - 論文歩行ロボティクス
Shield-Loco: 予測的安全フィルタリングによる歩行ポリシーの保護
強化学習による歩行ポリシーに対し、衝突予測に基づいて接触位置を事後フィルタリングする安全フィルタを提案。実機四足ロボットで安全性違反を大幅に削減しつつ、タスク性能の低下を最小限に抑えた。
原題: Shield-Loco: Shielding Locomotion Policies with Predictive Safety Filtering / Aditya Shirwatkar, Sebastian Sanokowski, Shishir Kolathaya 他
日本語で読む → - 論文産業ロボティクス/計画/LLMロボティクス
デジタルツインを用いた人間参加型産業ロボティクスのためのエージェント型ニューロシンボリック計画とコミッショニング
LLMと決定論的検証を組み合わせ、人間の指示を解釈して産業ロボットの計画・実行・失敗回復を行う枠組みを提案し、デジタルツイン上で検証する。
原題: Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins / Zhihao Liu, Victor Nan Fernandez-Ayala, Tianyu Wang 他
日本語で読む → - 論文VLAロボティクス
二つの橋、一つの道:身体化軌跡結合データによるVLMから汎用VLAへの変換
視覚言語モデル(VLM)をロボット制御ポリシー(VLA)に変換する際のギャップを、ロボットの軌跡に基づく中間データ(ETCデータ)と3段階の訓練手法で段階的に橋渡しし、汎用性を高める手法を提案した論文。
原題: Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data / Linqi Yin, Shiduo Zhang, Shenling Qiu 他
日本語で読む → - 論文制御制御
高不安定システムのロバスト制御のためのハイブリッドニューラルネットワークと従来型コントローラの統合:ティルトローター制御への応用
ティルトローターの完全駆動システムに対し、直接入出力学習は不安定で失敗することを示し、ニューラルネットワークで動的モデルを学習しスライディングモード制御と組み合わせる手法を提案した。
原題: Hybrid Neural Network and Conventional Controller Approach for Robust Control of Highly Unstable Systems: Application to Tilt-Rotor Control / Ali Kafili Gavgani, Amin Talaeizadeh, Aria Alasty 他
日本語で読む → - 論文VLAロボティクス
MotionVLA: 幾何学的な動きを視覚言語行動モデルに注入する
過去のフレームを記憶する代わりに、連続的な軌跡フィールドトークンとして動きを表現し、ロボットの長期的な操作タスクの性能と滑らかさを向上させる手法を提案した。
原題: MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model / Shanglin Yuan, Weiheng Zhao, Xianda Guo 他
日本語で読む → - 論文配送最適化cs.NI
トラック・ドローン協調配送ネットワークのシステムレベル計画と調整
都市部のラストマイル配送におけるトラックとドローンの協調運用を、5層の計画・調整フレームワークとして体系化し、実データに基づくシミュレーションで配送時間とエネルギー消費の大幅な削減を実証した論文。
原題: Systems-Level Planning and Coordination of Truck-Drone Collaborative Delivery Networks / Didem Cicek, Burak Kantarci
日本語で読む → - 論文セマンティックシーン補完画像認識
LiDARセマンティックシーン補完のための簡単な性能向上策の探求
既存のセグメンタによる疑似ラベルと可視性情報を入力に追加するだけで、LiDARセマンティックシーン補完の性能が大幅に向上することを示した論文。
原題: Exploring Easy Boosts for Lidar Semantic Scene Completion / Tetiana Martyniuk, Jonathan Seele, Alexandre Boulch 他
日本語で読む → - 論文データセット標準ロボティクス
FAIR^2 Drones: 分野横断型ドローン野生動物データセットのためのAI対応標準規格
生態学、ロボティクス、コンピュータビジョンの分野横断で再利用可能なドローン野生動物データセットの標準規格を提案し、メタデータとアノテーション仕様を統一する。
原題: FAIR^2 Drones: An AI-Ready Standard for Cross-Domain Wildlife Drone Datasets / Jenna Kline, Kilian Meier, Vandita Shukla 他
日本語で読む → - 論文視覚慣性オドメトリロボティクス
BEVIO: 月面昼夜航法のための効率的な鳥瞰図ベース疎更新視覚慣性オドメトリ
月面探査車向けに、視覚更新頻度が極端に低い状況でも頑健な視覚慣性オドメトリを実現するため、鳥瞰図ベースの画像マッチング手法を提案し、昼夜の自己照明条件下での性能を実機実験で検証した。
原題: BEVIO: Efficient Bird's-Eye-View based Sparse-Update Visual-Inertial Odometry for Lunar Day-Night Navigation / Mohit Singh, Shehryar Khattak, Ashish Goel 他
日本語で読む → - 論文空中マニピュレーションロボティクス
AERMANI-PLACE: 空中マニピュレータによる言語誘導オブジェクト配置
空中マニピュレータを用いて、自然言語の指示から物体の配置位置を推定し、実際に配置するフレームワークを提案。画像編集モデルと深度情報を組み合わせて配置点を特定し、実機で高い成功率を達成した。
原題: AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators / Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav 他
日本語で読む → - 論文VLAロボティクス
WALL-WM: イベント接合部での世界行動モデリングの彫刻
WALL-WMは、ビデオ行動学習をチャンク中心の最適化からイベント基盤の視覚言語行動事前学習へと移行させ、意味的に一貫した行動イベントを学習の原子単位として使用する世界行動モデルです。
原題: WALL-WM: Carving World Action Modeling at the Event Joints / Shalfun Li, Victor Yao, Charles Yang 他
日本語で読む → - 論文VLA/操作ロボティクス
ReactVLA: 改良平均流アクション生成による高速・軽量なリアクティブロボット操作
拡散型VLAの推論遅延を改善するため、改良平均流アクション生成と注意残差機構を備えた軽量・低遅延なVLAフレームワークを提案し、シミュレーションと実機で性能と速度を向上させた。
原題: ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation / Yanzhao Guo, Wenkai Chen, Jianwei Zhang
日本語で読む →