論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/8 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文視覚運動ポリシーロボティクス
フォーカスプーリングによる局所視覚特徴の集約と視覚運動ポリシーへの応用
CNNの中間特徴から制御に重要な局所情報を選択的に集約するFocusPoolを提案し、シミュレーションと実機で成功率を大幅に向上させた。
原題: Localized Visual Feature Aggregation via Focus Pooling for Visuomotor Policies / Ruiyu Wang, Zheyu Zhuang, Danica Kragic 他
日本語で読む → - 論文模倣学習/ベンチマークロボティクス
猿は見て学べるか?ロボットの観察によるスキル学習を評価するベンチマーク
人間の動画からロボットが操作スキルを学習する際の評価を統一するため、10種類の操作タスクを含むベンチマーク「RoboReel」を提案し、複数の最先端アルゴリズムを比較分析した。
原題: Monkey See, Can Monkey Do? A Benchmark for Evaluating Robot Skill Learning by Observation / Weiwei Gu, Anmol Gupta, Anant Sah 他
日本語で読む → - 論文巧みな操作/VLA/触覚ロボティクス
DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル
接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。
原題: DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination / Yankai Fu, Ning Chen, Junkai Zhao 他
日本語で読む → - 論文群制御画像認識
空陸協調物体探索に向けて:ベンチマーク、データセット、エージェント手法
UAVとUGVが協調して目標車両を探索・検証するタスクのためのベンチマークとデータセットを構築し、訓練不要のエージェント手法を提案した。
原題: Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method / Boao Yu, Zimo Chen, Junreng Rao 他
日本語で読む → - 論文ナビゲーション画像認識
AirAnchor:ゼロショット空中視覚言語ナビゲーションのための局所・大域空間情報の橋渡し
ドローンによる空中視覚言語ナビゲーションにおいて、局所空間情報と大域空間情報を空間アンカーで橋渡しし、統合フレームワークで意思決定を行う手法を提案した。実験で既存のゼロショット手法を大幅に上回る性能を示した。
原題: AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language Navigation / Shanwei Fan, Bin Zhang, Zhiwei Xu 他
日本語で読む → - 論文触覚センサロボティクス
TacClip: 指先を覆わずに動的接触力を計測するクリップ型センサ
爪に取り付ける小型クリップ型センサで、指先の変形を計測し、接触力や振動を推定する。指の腹を覆わないため、触覚を保ちつつ、視覚ベースの手の追跡と併用できる。
原題: TacClip: a clip-on sensor measures dynamic contact forces without covering the fingerpads / Yuqian Ye, Hao Li, Jingxi Xu 他
日本語で読む → - 論文検証器ロボティクス
無料の検証器は存在しない:ロボット政策の検証器に関するサーベイ
ロボット政策の検証器約150件を、判定の入手しやすさと信頼性のトレードオフの観点から分類・比較したサーベイ。
原題: No Free Checker: A Survey of Verifiers for Robot Policies / Yang Wan, Xihang Yue, Zhirui Liu 他
日本語で読む → - 論文運転支援画像認識
警告前に観察せよ:視覚言語モデルによる適応的ドライバー警告
ドライバー向けの警告タイミングを、沈黙・観察・警告の3アクションとしてモデル化し、視覚言語モデルで危険性を推定して適応的に警告するフレームワークを提案した。
原題: Observe Before You Alert: Adaptive Driver Alerting with Vision-Language Models / Yuhang Wang, Lingyao Li, Hao Zhou
日本語で読む → - 論文3Dシーン理解画像認識
Spheriverse: 実世界の球面観測による3Dシーン理解
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
原題: Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild / Fei Teng, Sheng Wu, Mengfei Duan 他
日本語で読む → - 論文ロボット設計ロボティクス
言語と物理を橋渡しする:大規模言語モデルによる連続体ロボットの自動設計
大規模言語モデルを用いて、物理シミュレーションの状態をフィードバックとして組み込む多層フレームワークAID-SRを提案し、腱駆動連続体ロボットの自動設計を実現した。
原題: Bridging Language and Physics: Automated Design of Continuum Robots with Large Language Models / Jingyi Chen, Mohan Zhang, Laura Yao 他
日本語で読む → - 論文模倣学習ロボティクス
DISEIL: デモンストレーション蒸留によるサンプル効率的模倣学習
ロボットが少数のデモから学習する際、失敗を分類し、必要なデモを自動的に要求する手法を提案。模倣学習のサンプル効率を向上させる。
原題: DISEIL: Demonstration Distillation for Sample-Efficient Imitation Learning / Suyog Khanal, Arun Kumar A, Santu Rana
日本語で読む → - 論文ベイズ最適化ロボティクス
ベイズ最適化による制御器チューニングとロボット学習の10年:チュートリアル、レビュー、将来展望
ベイズ最適化(BO)を制御器チューニングとロボット学習に応用する研究を10年分レビューし、実践的な導入方法や課題、標準ベンチマークの不足を指摘して軽量ベンチマークを提案したチュートリアル論文。
原題: A Decade of Bayesian Optimization for Controller Tuning and Robot Learning: Tutorial, Review, and Future Prospects / David Stenger, Paul Brunzema, Johanna Menn 他
日本語で読む → - 論文制御/形式手法cs.LO
STL仕様下での論理依存追跡による高速制約抽出と修正制御
Signal Temporal Logic仕様の不確実性下での充足を保証するため、論理依存追跡で不確実性を伝播させ、十分制約のDNFを高速抽出し、最小努力の制御修正を線形計画で実現する手法を提案。
原題: Fast Constraint Extraction for Corrective Control under STL Specifications via Logical Dependency Tracking / Antoine Besset, Joris Tillet, Chuchu Fan 他
日本語で読む → - 論文データセット/マルチモーダルロボティクス
DYAD: 共在する人間支援のマルチモーダルデータセット
ギアボックス組立作業中に、訓練されたヘルパーがHoloLens 2装着者を支援する際の、言語的・物理的介入と作業者の要求・タスク状態・結果を同期記録したデータセットを構築し、支援プロセスの因果理解・モード予測・応答生成のベンチマークを提供した。
原題: DYAD: A Multimodal Dataset of Co-Located Human Assistance / Akhil Ajikumar, Mahya Qorbani, Sakib Reza 他
日本語で読む → - 論文SLAMロボティクス
MFVINS: 複数魚眼カメラを用いた視覚慣性システム
複数の魚眼カメラとIMUを統合したSLAMシステムを提案し、単眼カメラの問題(遮蔽や照明変化、テクスチャレス環境での誤差蓄積)を改善。IMU支援の特徴追跡と学習ベースの深度推定を用いた再投影誤差により、リアルタイムで高精度な姿勢推定を実現。
原題: MFVINS: Multiple Fisheye Camera-Based Visual Inertial System / Eunseong Jang, YuJin Chung, Sang Jun Lee 他
日本語で読む → - 論文デジタルツイン/エージェントAIロボティクス
再構成可能な製造のための認知デジタルツインのエージェントAIによるセマンティックコミッショニング
マルチエージェントAIとRAG・MCPを組み合わせ、認知デジタルツインの構築・デバッグを自動化し、展開時間を数週間から約2時間に短縮した。
原題: Agentic AI-enabled Semantic Commissioning of a Cognitive Digital Twin for Reconfigurable Manufacturing / Yangyang Liu, Xun Xu, Jan Polzer
日本語で読む → - 論文モデルベース強化学習ロボティクス
CAST: 交互状態価値目標と拡張方策勾配によるモデルベース強化学習
モデルベース強化学習において、プランナー誘導行動と現在の方策を交互に用いた状態価値目標を導入し、価値学習を改善する手法CASTを提案。シミュレーションと実機の四足ロボットで有効性を実証。
原題: CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning / Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard 他
日本語で読む → - 論文能動視覚/手内操作/3D再構成ロボティクス
AURORA: 能動的不確実性駆動の手内再方向付けによる物体再構成
ロボットハンドに把持された物体の隠れた表面を効率的に観測するため、再構成の不確実性に基づいて次の視点を選び、手内回転を能動的に制御する3D再構成フレームワークを提案した。
原題: AURORA: Active Uncertainty-Driven Re-Orientation for In-Hand Reconstruction / Feiyu Zhao, Yuetong Li, Chenxi Xiao
日本語で読む → - 論文対話型AI・デジタルヒューマン画像認識
生きた図書館:アーカイブコレクションを対話型知識システムへ変える ― セオドア・ルーズベルト大統領図書館での実践から
断片化したデジタルアーカイブを、統治された対話型の展示体験へと変換する4層フレームワークを構築し、ルーズベルト大統領図書館で実運用した。
原題: The Living Library: Transforming Archival Collections into Conversational Knowledge Systems -- Lessons from the Theodore Roosevelt Presidential Library / Pengce Wang, Lucia Ronchi Darre, Matt Briney 他
日本語で読む → - 論文sim2realロボティクス
脚式ロボット学習における狭可生存性タスクのためのアクチュエータダイナミクスカリキュラム
関節剛性を高く初期化し、エピソード完了長に応じて同定値まで徐々に下げるカリキュラムを提案し、Spotの四足から逆立ちへの遷移など探索が終了条件で妨げられるタスクの学習を可能にした。
原題: Actuator Dynamics Curricula for Narrow-Viability Tasks in Legged Robot Learning / Kousheek Chakraborty, Chandan K. Rajendra, Ayham Alharbat 他
日本語で読む → - 論文手術ロボティクスロボティクス
手動操作と遠隔操作による眼内器具動作の比較:入力デバイスの評価
ロボット支援顕微手術の入力デバイスが外科医の技術を保持するか検証するため、同一条件下で手動と遠隔操作の眼内器具動作を比較し、遠隔操作では時間が3倍、動作分割が3.5倍になるなど実行特性が変化することを示した。
原題: A Controlled Comparison of Manual and Teleoperated Intraocular Instrument Motion for an Input Device / Korab Hoxha, Mirza Imamovic, Angelo Henriques 他
日本語で読む → - 論文VLM画像認識
VANTAGE-Bench:視覚言語モデルにおけるインフラAIギャップの評価
固定カメラ映像を用いたインフラAI(物流・交通・スマート空間)向けベンチマークを提案し、17モデルのゼロショット評価でイベント検証や時間定位に最大24点の性能不足があることを示した。
原題: VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models / Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain 他
日本語で読む → - 論文ナビゲーションロボティクス
OmniNav: 動的環境における堅牢な長期的目標ナビゲーション
動的環境での長期的な目標ナビゲーションを、シーン記憶の更新、信念修正、操作可能なエンドポイント選択を統合した因子化タスク状態推定として定式化し、頑健な探索と操作を実現するシステムを提案した。
原題: OmniNav: Robust Long-Horizon Target Navigation in Dynamic Environments / Yujie Tang, Meiling Wang, Jinhao Jiang 他
日本語で読む → - 論文歩行ロボティクス
PGMT: 人型ロボットのための知覚的汎用動作追跡
複雑な地形でも動作追跡を可能にする、地形認識を組み込んだ人型ロボット用のパイプラインを提案。実機で37cmの障害物を越える適応的歩行と全身動作を実現した。
原題: PGMT: Perceptive General Motion Tracking for Humanoid Robots / Hongyi Li, Li Peizhuo, Yucheng Tao 他
日本語で読む → - 論文マニピュレーションロボティクス
FOCIポリシー:関係的操作ポリシーのためのオブジェクト中心相互作用に焦点を当てる
物体間の相対運動に基づく相互作用中心のフレームワークを提案し、デモから重要な相互作用区間を抽出してスキルを表現することで、少ないデータで高い性能を達成する操作ポリシーを開発した。
原題: FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies / Ze Fu, Pinhao Song, Yutong Hu 他
日本語で読む → - 論文被覆経路計画ロボティクス
冗長マニピュレータのための一般化スパニングツリーを用いた被覆経路計画
冗長マニピュレータの表面被覆問題に対し、各セルの複数の逆運動学解を考慮したオフライン・オンラインのスパニングツリー被覆アルゴリズムを提案し、計算時間と関節動作を削減する。
原題: Coverage Path Planning for Redundant Manipulators using Generalized Spanning Trees / Raksi Kopo, Kostas J. Kyriakopoulos
日本語で読む → - 論文能動学習/材料回収AI
意思決定に焦点を当てた能動学習によるスケール対応の重要材料回収
実験結果と製品要件・コスト・スケール効果を結びつけるため、下流のベイズリスク低減に基づいて実験バッチを選ぶ能動学習手法を提案し、NdFeB磁石の回収プロセスで少ない実験数で最良結果を達成できることを示した。
原題: Decision-Focused Active Learning for Scale-Aware Critical-Materials Recovery / Niranjan Srinivas, Debajyoti Ray, Elias Nakouzi
日本語で読む → - 論文制御/FPGA/ドローンロボティクス
AccelMPC:超小型ドローン向け高速・低消費電力FPGAアクセラレーテッドモデル予測制御
FPGAと専用基板を組み合わせ、35gの超小型ドローン上で動的障害物を考慮した制約付きモデル予測制御を1kHzで実行可能にした研究。
原題: AccelMPC: High-Rate, Low-Power FPGA-Accelerated Model Predictive Control for Tiny Drones / Andrea Grillo, Brian Plancher
日本語で読む → - 論文両腕操作ロボティクス
RoboCousin: 堅牢な両腕ロボット操作のための自作シミュレーションプレイグラウンド
ユーザーが提供した観測データを再利用可能なアセットやシーン、専門家の軌道に変換する、拡張可能なシミュレーションベースのデータ生成プラットフォームを提案し、両腕操作ポリシーの訓練データを大規模に生成する。
原題: RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation / Jingxuan Zhu, Jingyi Li, LiangLiang Chen 他
日本語で読む → - 論文プランニングAI
CLAMP: 視覚言語組み込みプランニングのための制約付きデコーディング
視覚言語モデルによるプランニングを実行可能にするため、シーン情報をデコーディング時の制約として利用し、物体参照やアクションの妥当性を保証するフレームワークを提案した。
原題: CLAMP: Constrained Decoding for Vision-Language Embodied Planning / Tianyi Ma, Parisa Kordjamshidi
日本語で読む →