論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文触覚画像認識
TouchSight: 一人称視野映像からの素手触覚予測
手袋型圧力センサの記録を生成AIで素手映像に変換し、一人称視野の動画から手全体の接触力を予測する手法を提案。触覚センサなしで密な触覚情報を推定できる。
原題: TouchSight: Bare-Handed Tactile Prediction from Egocentric Video via Generative Visual Augmentation / Danyan Zhou, Jinxuan Lu, Jiawei Lin 他
日本語で読む → - 論文物理シミュレーション機械学習
物理世界モデルにおける安定性と反事実的推論の構造的基盤
学習した物理シミュレータの長期安定性にはシンプレクティック積分によるエネルギー保存が、未知の物理パラメータへの適応には明示的な線形因子分解がそれぞれ必要であり、両者は独立した構造的メカニズムであることを示した。
原題: Conservation Buys Stability and Factoring Buys Counterfactuals in Physical World Models / Yufeng Wang, Parivesh Priye, Lu Wei 他
日本語で読む → - 論文報酬モデル/マルチビュー画像認識
AnyviewMeter: カメラ幾何とマルチビュー注意によるロボット報酬モデルの適応
カメラ視点の変化に頑健なロボット報酬モデルを実現するため、低ランク微調整とPlucker光線条件付け、同期ブロック注意を組み合わせた適応フレームワークを提案し、視点変更時の誤差を約21%削減した。
原題: AnyviewMeter: Adapting Robotic Reward Models with Camera Geometry and Multi-View Attention / Yuang Tu, Runjia Tan, Yujie Yan 他
日本語で読む → - 論文ウェアラブルAI画像認識
ウェアラブル知能のためのAIスマートグラス:一人称視点センシングからエージェント型パーソナライゼーションまで
AIスマートグラスを、一人称視点センシング・リソース制約下の計算・推論・マルチモーダル対話・実応用制約を統合設計するシステム概念として整理し、ハードウェアから応用・評価までを4次元で俯瞰したサーベイ。
原題: AI Smart Glasses for Wearable Intelligence: From Egocentric Sensing to Agentic Personalization / Xu Yuan, Yi Wang, Zhuohang Jiang 他
日本語で読む → - 論文sim2realロボティクス
MILER: 非構造自律運転のためのsim-to-real強化学習に向けた意味的中間表現
意味的な中間表現シミュレータとBEVFusionによる知覚・制御のゼロショットsim-to-real転移を実現し、非構造環境での実車自律走行を達成した。
原題: MILER: Semantic Mid-Level Representation for Sim-to-Real Reinforcement Learning in Unstructured Autonomous Driving / Thomas Steinecker, Denis Trescher, Alexander Bienemann 他
日本語で読む → - 論文自動運転/安全性評価ロボティクス
時空間遮蔽領域における最悪ケース隠れ車両軌道探索
遮蔽領域に隠れた車両の履歴整合的な最悪軌道をミニマックス探索で求め、自動運転の安全性評価に役立てる手法を提案。
原題: Worst-Case Hidden-Vehicle Trajectory Search in Spatiotemporal Occlusion Regions / Ruichen Tan, Zengxiang Lei, Satish Ukkusuri
日本語で読む → - 論文データ生成/両眼視覚画像認識
BinoGen: 身体性視覚知覚と学習のための大規模自己中心両眼データ生成
屋内環境で身体性を考慮した自己中心両眼視覚体験を自動生成するフレームワークBinoGenを提案し、2000万枚以上の注釈付き画像データセットを構築して、実世界の深度推定・物体検出・追跡性能を向上させた。
原題: BinoGen: Scaling egocentric binocular data for embodied visual perception and learning / Chunpeng Li, Ya-tang Li
日本語で読む → - 論文経路追従制御ロボティクス
特異点なし誘導ベクトル場における経路パラメータ化からの物理速度の分離
特異点のない誘導ベクトル場において、経路のパラメータ化に依存せずにロボットの物理速度を指定できる新しい手法を提案し、二次系の飽和加速度制御則を開発して四回転翼機の3D経路追従実験で有効性を示した。
原題: Decoupling Physical Speed from Path Parameterization in Singularity-Free Guiding Vector Fields / Zhouru Xiao, Sha Luo, Yang Lu 他
日本語で読む → - 論文VLAロボティクス
StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習
大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。
原題: StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation / Jinbang Huang, Yuanzhao Hu, Zhiyuan Li 他
日本語で読む → - 論文農業ロボティクス画像認識
ロボット収穫のための選択的ワタボール位置推定:圃場条件下での深層学習視覚モデル評価
圃場で撮影したワタの画像データセットを用い、YOLO系やSAM系の深層学習モデルによるワタボールの検出・セグメンテーション性能を比較評価した。
原題: Selective Cotton Boll Localization for Robotic Harvesting: Evaluation of Deep Learning Vision Models Under Field Conditions / Thevathayarajh Thayananthan, Xin Zhang, Isuru Laddusinghe Badu 他
日本語で読む → - 論文遠隔操作ロボティクス
テレ走破性:遠隔操作ロボットの地形ナビゲーションにおける走破性評価の再考
遠隔操作ロボットの地形ナビゲーションにおいて、人間の認知状態(注意、作業負荷、リスク許容度)を考慮した「テレ走破性」という概念を提案し、人間中心の遠隔操作システムに向けた課題と展望を論じた。
原題: Tele-Traversability: Rethinking Traversability for Teleoperated Ground Robots in Terrain Navigation / Lewei Feng, Qi Chen, Wenshuo Wang 他
日本語で読む → - 論文自己校正ロボティクス
OmniCalib:ヒューマノイドロボットのためのターゲット不要・タスク構造化自己校正
ロボット自身の動作と搭載センサのみを用い、腕・脚の関節ゼロ点やカメラ外部パラメータを校正ターゲットなしで推定する自己校正ワークフローを提案。
原題: OmniCalib: Target-Free, Task-Structured Self-Calibration for Humanoid Robots / Kaixiang Lu, Haiyu Lan, Chunxiao Qiao 他
日本語で読む → - 論文脚式ロボットロボティクス
情報理論による脚式ロボットの機械的知能の定量化
脚式ロボットを例に、身体ダイナミクスを計算過程かつ通信路とみなし、機械的知能を情報理論的指標で定量化する手法を提案した。
原題: Quantifying Mechanical Intelligence in Legged Robots with Information Theory / Zach J. Patterson
日本語で読む → - 論文SLAM画像認識
AMB3R-SLAM: 階層型バックエンドによるキロメートル規模SLAM
単一の民生用GPUで1万フレーム超のキロメートル規模軌跡をリアルタイム復元できる単眼SLAMを提案し、階層型バックエンドで動的環境にも対応、LiDAR等の追加入力にも拡張可能。
原題: AMB3R-SLAM: Kilometer-scale SLAM with Hierarchical Backend / Hengyi Wang, Lourdes Agapito
日本語で読む → - 論文SLAMロボティクス
SLAMSqueezeBench:リソース制約下でSLAMシステムを比較するベンチマーク
計算・メモリ制約やフレームドロップを再現するベンチマークを開発し、古典的・学習ベース・ガウススプラッティングのSLAM9手法を比較した。
原題: SLAMSqueezeBench: Comparing SLAM Systems under Resource Constraints / Mohamed Hefny, Karthik Dantu, Steven Y. Ko
日本語で読む → - 論文sim2realロボティクス
AURORA: 自然言語駆動型エージェントフレームワークによる信頼性の高い空陸協調シミュレーションの理解・推論・オーケストレーション
自然言語から空陸協調シミュレーションシナリオを生成し、実行時検証と局所修復により要求された相互作用を忠実に実現するエージェントフレームワークを提案。
原題: AURORA: A Natural Language-Driven Agentic Framework for Understanding, Reasoning, and Orchestrating Reliable Air-Ground Co-Simulation / Keshu Wu, Hao Zhang, Rui Gan 他
日本語で読む → - 論文ナビゲーションロボティクス
進むか退けるか?未知環境における可動障害物を考慮した計画
未知環境で経路が塞がれたとき、ロボットが探索と障害物の移動をどう選ぶかをオンラインで判断し、LLMで効率的に移動順序を計画する手法を提案した論文。
原題: Navigate or Relocate? Planning Among Movable Obstacles in Unknown Environments / Yuqing Zhang, Haoyu Zhu, Yiannis Kantaros
日本語で読む → - 論文マニピュレーションロボティクス
VLA事後学習による高自由度巧みなマニピュレーション
高自由度の巧みな手の操作を実現するため、時間的手動作コーデック・教師あり微調整・DAgger・実世界残差強化学習を組み合わせた4段階の事後学習パイプラインを提案し、実世界の5タスクで成功率100%を達成した。
原題: Towards High-DoF Dexterous Manipulation through VLA Post-Training / Junlei Zhu, Shenzhe Yao, Chaogui Huang 他
日本語で読む → - 論文自動運転検証ロボティクス
VAST: V2X・動的マップ対応の自動運転システム検証ツールチェーン
ScenicやAutoware、SIM-LDMなどを連携させ、V2Xや動的マップを考慮した協調自動運転システムの検証を可能にするツールチェーンを構築し、見通しの悪い交差点でのエッジケース発見率や衝突率の改善を実証した。
原題: VAST: V2X/Dynamic Map-Aware Autonomous Driving Systems Validation Toolchain / Shunsuke Ito, Takuya Azumi
日本語で読む → - 論文UAVマッピング画像認識
PerSeM: 長期的なオープンボキャブラリUAVマッピングのための永続的セマンティックメモリ
UAVのオープンボキャブラリセグメンテーションにおいて、フレームごとの予測を永続的な3Dボクセルメモリに統合し、履歴保持型空間精緻化・信頼度考慮リプレイ・文脈誘導検証で保守的に改善する訓練不要フレームワークを提案。
原題: PerSeM: Persistent Semantic Memory for Long-Horizon Open-Vocabulary UAV Mapping / Saurbh Singh Jamwal, Ganesh Ramakrishnan
日本語で読む → - 論文3Dシーングラフ画像認識
3Dシーングラフにおける意味的不確実性の階層的集約
既存の3Dシーングラフが持つ検出器信頼度と埋め込みから、物体エントリの正しさを確率化し、包含階層を通じて部屋レベルの信念に伝播させる枠組みを提案。追加の知覚や学習なしで物体検索と部屋レベルの主張の精度を向上。
原題: Hierarchical Aggregation of Semantic Uncertainty in 3D Scene Graphs / Carlos Cueto Zumaya, Iacopo Catalano, Wallace Moreira Bessa 他
日本語で読む → - 論文VLAAI
意図から行動へ:車両音声コマンド認可におけるLLM安全性のベンチマーク
車載音声アシスタントにおけるLLMの実行前認可判断を評価する202シナリオのベンチマークを提案し、7クラス分類での意思決定整合性と安全性エラーを測定した。
原題: From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization / Diba Afroze, Xingli Zhang, Yazhou Tu 他
日本語で読む → - 論文VLAロボティクス
EmbodiedMind: 効率的な身体性知能のための適応的データキュレーションとプレフィックス木強化学習
身体性基盤モデルの学習において、低情報サンプルの除去、タスク間のバランス調整、長期的計画におけるクレジット割り当て問題を解決するため、RSFT、IR-GRPO、Trie-GRPOを組み合わせた効率的な訓練パラダイムを提案。
原題: EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence / Feifan Wang, Zongbing Zhang, Yu Zhang 他
日本語で読む → - 論文マニピュレーションロボティクス
TacSushi: 触覚に基づく世界行動モデリングによる器用な寿司操作
触覚と将来予測を組み込んだ世界行動ポリシーを実ロボット340成功・50失敗試行で学習し、寿司の変形・遮蔽・不確実な接触下での操作を実現した。
原題: TacSushi: Tactile-Grounded World-Action Modeling for Dexterous Sushi Manipulation / Haodi Hu, Kaen Kogashi, Toshiaki Koike-Akino
日本語で読む → - 論文sim2realロボティクス
ReShoot: 記録済みロボット実演の生成的視覚ドメインランダム化による視覚運動ポリシー学習
記録済みのロボット実演を視覚的に再レンダリングして外観を多様化し、追加データ収集なしで視覚運動ポリシーの頑健性を高める手法を提案。
原題: ReShoot: Generative Visual Domain Randomization of Recorded Robot Demonstrations for Visuomotor Policy Learning / Chiyoung Kim, Min Sung Choi, Jinho Ju 他
日本語で読む → - 論文VLAロボティクス
VA-Bench:視覚実演・能動的知覚・メートル制御による身体性空間知能の評価
RGB実演から手順を学び、カメラ視点を能動的に選び、メートル単位の動作指令を出してフィードバックで修正する「観察-推論-行動-修正」ループを評価するベンチマークVA-Benchを提案。最良モデルでもタスク成功率は約54%にとどまることを示した。
原題: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control / Zhongbo Zhang, Jiayi Jin, Yifan Wang 他
日本語で読む → - 論文VLA機械学習
Uni-LaDiR:潜在拡散がマルチモーダル推論を統合する
異なるモダリティの推論過程を共有潜在空間のトークンに変換し、拡散モデルで次の思考ブロックを予測する統合推論フレームワークを提案。視覚言語タスクとロボット操作タスクで性能を向上させた。
原題: Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning / Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang 他
日本語で読む → - 論文安全フィルタリングロボティクス
ロボットによる電池リサイクルにおける二端子危険に対する実行時安全フィルタリング
電池リサイクルで導電性ペイロードが充電セルの両端子に同時に近づく危険を対象に、学習済み操作ポリシーへの実行時安全フィルタの設計(述語構造・マージン・フォールバック)を比較し、フォールバック戦略が安全性とタスク成功率のトレードオフに最も大きく影響することを示した。
原題: Runtime Safety Filtering for Two-Terminal Hazards in Robotic Battery Recycling / Yuxin Cao, Wei Song, Xianglin Yang 他
日本語で読む → - 論文状態推定ロボティクス
音響・深度支援慣性航法のための同変フィルタ設計
水中ロボットの慣性航法において、バイアスを状態空間の幾何に組み込むTangent-Group対称性に基づく同変フィルタを提案し、従来のIEKFやEKFより推定精度と共分散の一貫性を改善した。
原題: Equivariant Filter Design for Acoustic and Depth Aided Inertial Navigation Systems / Arihant Lunawat, Pieter van Goor, Frank Dellaert 他
日本語で読む → - 論文全身マニピュレーションロボティクス
LYRIC: 言語駆動の物理ベース全身接触リッチ物体インタラクション制御
自由形式の言語指示と目標物体位置から、物理シミュレーション上のキャラクタが全身で接触を伴う物体操作を行うフローマッチング制御器を提案。プランナと行動生成器に分解し、専門家軌道の追従と強化学習の微調整で高い成功率を達成した。
原題: LYRIC: Language-Driven Physics-Based Character Control for Contact-Rich Whole-Body Object Interaction / Zeyu Han, Zichong Meng, Julian Tanke 他
日本語で読む →