論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ロボット学習ロボティクス
STEAM: 実世界ロボット学習のための自己教師あり時間アンサンブル優位性モデリング
専門家のデモからフレーム間の時間オフセットを自己教師ありで学習し、ロールアウトデータの各フレームの優位性を評価する手法を提案。混合品質データの保守的なスコアリングにより、ポリシー学習の成功率を向上させた。
原題: STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning / Zhihao Liu, Qiuyi Gu, Yitao Wang 他
日本語で読む → - 論文システム同定ロボティクス
RigPI: VLMシード付き微分可能シミュレーションによる剛体の動的パラメータ同定
ロボットと物体の相互作用中に、剛体や多リンク剛体の慣性・摩擦パラメータを、視覚言語モデルによる初期化と微分可能シミュレーションの勾配情報を用いて正確に同定するフレームワークを提案した。
原題: RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation / Xincheng He, Rongrong Zhang, Wei Jiang 他
日本語で読む → - 論文共創/音楽ロボティクスロボティクス
Co-policy: 人間とロボットによる応答的な音楽共創のためのフレームワーク
音楽セマンティクスを物理的な演奏動作に結びつける、人間とロボットの音楽共創フレームワークを提案。意味理解、音楽変奏、視覚運動実行を分離し、低遅延で応答的な演奏を実現する。
原題: Co-policy: Responsive Human-Robot Co-Creation for Musical Performances / Xuetao Li, Wenke Huang, Mang Ye 他
日本語で読む → - 論文音源距離推定cs.SD
Fast-SDE: 残響環境における効率的な単一マイク音源距離推定
単一マイクで音源までの距離を推定する軽量フレームワークを提案し、計算資源やサイズに制約のあるロボットへの応用を目指した。
原題: Fast-SDE: Efficient Single-Microphone Sound Source Distance Estimation in Reverberant Environments / Jiang Wang, Runwu Shi, Yaozhong Kang 他
日本語で読む → - 論文LLMエージェント/制御ロボティクス
宇宙自律のためのエージェント型自動研究:航空宇宙制御問題向けの監査可能なLLM駆動研究エージェント
大規模言語モデルが航空宇宙制御問題の研究ループを自律的に駆動し、シードノイズに対する信頼性検証を組み込んだフレームワークを提案した論文。
原題: Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems / Amit Jain, Richard Linares
日本語で読む → - 論文経路計画ロボティクス
生成フローフィールドサロゲートによる3D水中経路計画
自律型水中ビークルの発進・回収時の複雑なプロペラ後流を考慮した3次元経路計画を、RANS CFDの代わりに条件付きGANで高速生成した流れ場データを用いて実現した。
原題: 3D Underwater Path Planning via Generative Flow Field Surrogates / Zachary Cooper-Baldock, Paulo E. Santos, Russell S. A. Brinkworth 他
日本語で読む → - 論文マニピュレーションロボティクス
行動プロンプト方策:操作のためのデモンストレーションをプロンプトとして活用
単一の人間のデモンストレーションをプロンプトとして用い、推論時に新しいタスクを実行できるロボットのパラダイムを提案。新しいアーキテクチャ、データ収集インターフェース、評価ベンチマークを導入し、微調整なしで新しいスキルを教える柔軟な方法を示した。
原題: Behavior Prompting Policy: Demonstrations as Prompts for Manipulation / Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez 他
日本語で読む → - 論文VLAロボティクス
TempoVLA: 速度制御可能な視覚言語行動ポリシーの学習
ロボット操作の速度を明示的な条件で制御できる単一のVLAモデルを提案。デモの軌道を任意の速度に再タイミングするデータ拡張と、速度をポリシーに供給する機構を組み合わせ、低リスク区間での高速化と高リスク区間での低速化を実現した。
原題: TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies / Dong Jing, Jingchen Nie, Tianqi Zhang 他
日本語で読む → - 論文マニピュレーションロボティクス
嗜好較正型ヒューマン・イン・ザ・ループ強化学習によるロボット操作
人間介入を利用した強化学習で、介入が誘発する嗜好信号から劣った軌道区間を特定し、Q値の過大評価を防ぎつつ方策を人間の修正行動に合わせて較正するPACTフレームワークを提案した。
原題: Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation / Zeyi Liu, Guangyao Liu, Yinuo Qu 他
日本語で読む → - 論文データセット/インタラクションロボティクス
HABIT: ロボット操作のための人間認識行動とインタラクション訓練データセット
人間が存在する環境でのロボット操作のための大規模デモデータセットHABITを構築し、人間との協調・共有・指示の3役割でタスクを整理。人間存在データで訓練することで、人間認識行動が獲得できることを示した。
原題: HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation / Jaehwi Song, Suchae Jeong, Byeongguk Jeon 他
日本語で読む → - 論文全身制御ロボティクス
CWI: 複合ヒューマノイド全身模倣システムによる移動操作
上半身の操作と下半身の移動を分離し、モーションキャプチャデータを活用してヒューマノイドの全身協調動作を実現する模倣学習フレームワークを提案した。
原題: CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation / Wenqi Ge, Junde Guo, Zhen Fu 他
日本語で読む → - 論文ドローン/強化学習ロボティクス
投擲を学ぶ:クアッドローターによるケーブル吊り下げペイロードの機敏かつ正確な配送
クアッドローターが吊り下げたペイロードを目標へ正確に投げる強化学習ポリシーを、高精度シミュレーションと実機で検証し、モデルベース手法より誤差と時間を大幅に削減した。
原題: Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor / Yifan Zhai, Elia Raimondi, Yunfan Ren 他
日本語で読む → - 論文医療ロボティクスロボティクス
視触覚と明示的な力制御を用いた腹部ボリューム再構成のためのロボット超音波診断
専門医の走査動作と力データを記録・再生し、ステレオ視と剛性計測で患者の腹部形状を把握しながら、力制御でプローブを密着させて自律的に腹部スキャンを行うシステムを構築した。
原題: Visuotactile and Explicitly Force-Controlled Robotic Ultrasound for Abdominal Volumetric Reconstruction / Adrian Piedra, R Brooke Jeffrey, Oussama Khatib
日本語で読む → - 論文VLAロボティクス
GeoAlign: セマンティクスを超えた状態誘導による空間的位置合わせをVLAモデルに導入
VLAモデルにロボットの状態情報を利用した幾何学的特徴の位置合わせ機構を導入し、操作タスクの成功率を向上させた。
原題: GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models / Yizhi Chen, Zhanxiang Cao, Xinyi Peng 他
日本語で読む → - 論文軌道予測機械学習
予測の訓練と推論の再考:Winner-Take-AllをGMMに結びつける
軌道予測モデルの訓練と推論の不一致を指摘し、テスト時の後処理でモード確率を改善する手法を提案した論文。
原題: Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs / Qiyuan Wu, Katie Z Luo, Bharath Hariharan 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
HumanoidArena: 自己中心視点の階層的全身体学習のベンチマーク
ヒューマノイドロボットの階層的制御(高レベル方策と低レベル運動追跡器)の性能を評価する新しいシミュレーションベンチマークを提案し、脚部が重要な7つのタスクを設計して、方策と追跡器のインターフェースの実行可能性や頑健性を検証する。
原題: HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning / Taowen Wang, Zikang Xie, Bin Yang 他
日本語で読む → - 論文3D物体検出/センサ融合画像認識
低重なり構成における頑健な3D物体検出のための幾何認識型魚眼-LiDAR融合
魚眼カメラとLiDARの融合において、魚眼の幾何特性を考慮したハイブリッド融合フレームワークを提案し、極端な歪みや低重なり条件下での3D物体検出性能を向上させた。
原題: Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups / Xiangzhong Liu, Xihao Wang, Hao Shen
日本語で読む → - 論文模倣学習ロボティクス
完璧なデモは悪い教師:重要な動作セグメントからのロバストな位置合わせ学習
熟練者の滑らかなデモは、精密な位置合わせ動作の重要な瞬間が短時間に圧縮されるため、模倣学習の教師として不十分であることを示し、動作認識を強化する時空間特徴STAIRを提案して性能を向上させた。
原題: Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments / Mingyu Liu, Zeju Li, Jiuhe Shu 他
日本語で読む → - 論文触覚/操作ロボティクス
触覚対応ワールドアクションモデル:非対称注意による触覚統合
接触を伴う操作タスクで、視覚と触覚を統合した世界行動モデルを提案。触覚トークンが視覚ダイナミクスを乱す問題を非対称注意機構で解決し、実ロボットで成功率を向上させた。
原題: Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention / Siyu Wu, Linjing You, Junjie Zhu 他
日本語で読む → - 論文自動運転/シナリオ生成ロボティクス
RiskFlow: 高速かつ忠実な安全臨界交通シナリオ生成
自動運転システムの評価に必要な安全臨界シナリオを、反復的ノイズ除去を避け、単一の順伝播で生成する新しいフレームワークを提案した論文。
原題: RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation / Qi Lan, Yining Tang, Yu Shen 他
日本語で読む → - 論文連続体ロボットロボティクス
CoLI: モノリシック3Dプリンティングと同型遠隔操作による連続体ロボット学習のための再現可能なプラットフォーム
複雑な製造工程や運動学モデリングを不要にする、モノリシック3Dプリントと同型遠隔操作を備えた連続体ロボットのオープンソースプラットフォームを提案し、模倣学習による自律制御も支援する。
原題: CoLI: A Reproducible Platform for Continuum Robot Learning via Monolithic 3D Printing and Isomorphic Teleoperation / Ziyuan Tang, Chenxi Xiao
日本語で読む → - 論文ナビゲーションロボティクス
意図を考慮したシーン表現による群衆中のロボット視覚ナビゲーション学習
群衆中のロボットナビゲーションにおいて、人間の意図と環境構造を考慮した視覚表現を用いた強化学習手法を提案し、シミュレーションと実環境で優れた性能を示した。
原題: Learning Robot Visual Navigation in Crowds via Intention-Aware Scene Representations / Han Bao, Bingyi Xia, Hanjing Ye 他
日本語で読む → - 論文圧縮/クラウドロボティクスeess.IV
SEAOTTER: センサー組み込みオートエンコーダとワンタイムトランスコードによる効率的な再構成
ロボットシステム向けに、学習ベースの潜在表現と標準JPEGの互換性を組み合わせた画像圧縮フレームワークを提案し、高圧縮率で高速な符号化・復号化と高い認識精度を実現した。
原題: SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction / Dan Jacobellis, Neeraja J. Yadwadkar
日本語で読む → - 論文世界モデル画像認識
ATM: 行動整合性転移行列による潜在世界モデルの診断と改善
潜在世界モデルの表現が計画に有用かどうかを、シミュレータ評価なしで軽量なプローブにより診断する行列ATMを提案し、さらにその診断信号を訓練に用いて計画性能を改善する手法も示した。
原題: ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models / Jiaheng Chen
日本語で読む → - 論文エッジ推論画像認識
ベンチマークを超えて:細粒度路側認識のための連続エッジ推論
エッジデバイス上での連続AI推論における実運用上の課題(熱スロットリングや時間的不安定性など)を分析し、NVIDIA Jetson Orin Nano上で路側認識のための連続推論システムEdge-TSRを提案。時間的安定化機構により、フレーム単位の推論と比較して最大10.16%の分類精度向上を達成した。
原題: Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception / Aditya Mishra, Haroon Lone
日本語で読む → - 論文触覚/操作ロボティクス
Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
原題: Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation / Yunfan Lou, Yifan Ye, Yankai Fu 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット操作のための身体化チェーン・オブ・ソートの再考
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
原題: Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation / Nan Sun, Yuan Zhang, Yongkun Yang 他
日本語で読む → - 論文双腕操作/VLAロボティクス
Co-VLA: 双腕ビジョン・ランゲージ・アクションシステムのための協調認識型構造化アクションモデリング
双腕ロボット操作において、明示的な協調構造をVLAモデルに導入し、共有・残差潜在変数と制御器により信頼性と解釈可能性を向上させるフレームワークを提案した。
原題: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems / Yandong Wang, Jiaqian Yu, Xiongfeng Peng 他
日本語で読む → - 論文VLAロボティクス
Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへ
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
原題: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack / He Zhang, Lingzhu Xiang, Haitao Lin 他
日本語で読む → - 論文行動クローニングロボティクス
オープンデータ・訓練・評価によるスケーラブルな行動クローニング
大規模な遠隔操作データセットABC-130K(3500時間、13万エピソード)とオープンソースのハードウェア・訓練・シミュレーション基盤を公開し、行動クローニングの再現可能な研究基盤を提供した。
原題: Scalable Behavior Cloning with Open Data, Training, and Evaluation / Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh 他
日本語で読む →