論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文支援技術/ヒューマンインターフェースHCI
bFaaaP: 頭部角度でペダル操作を実現する包括的ピアノ演奏支援 -- 足を使わずにアコースティック/電子ピアノで奏者の意図を定量的に再現
足が使えない演奏者向けに、頭部の角度でサステインペダルを操作できる装置を開発。スマートフォンのAR顔追跡とBLE通信でペダルを制御し、定量的な制御則により自然な表現を実現した。
原題: bFaaaP: An Inclusive, Head-Angle Piano-Pedal Interaction that Quantitatively Reproduces a Pianist's Intended Pedalling -- Foot-Free, for Acoustic and Electronic Pianos / Tomoyuki Shishido, Masahiro Ootaki, Hiroyuki Narusawa
日本語で読む → - 論文器用操作ロボティクス
C2Dex: 単眼ビデオからの接触整合的な器用操作の再構築とリターゲティング
単眼ビデオから器用なロボット操作のデモを転送する際、接触の安定性と物理的妥当性を保つフレームワークC2Dexを提案。物体側の安定接触を共有表現として、軌道の再構築と異なる手の形態へのリターゲティングを改善し、シミュレーションと実機で高い成功率を達成した。
原題: C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video / Jie Ren, Zhehao Jiang, Yinhong Yang 他
日本語で読む → - 論文VLA画像認識
ワールドトークン:訓練時ワールドモデリングによる身体化ポリシーの強化
視覚言語行動モデルに、訓練時に未来ビデオのノイズ除去を条件付けるワールドアダプタを導入し、推論時にはビデオモデルを除去して効率的な行動生成を実現する新しいアーキテクチャを提案した。
原題: World Tokens: Enhancing Embodied Policies with Training-Time World Modeling / Qu Tang, Benhui Zhuang, Bo Yuan 他
日本語で読む → - 論文マニピュレーションロボティクス
集中訓練と批評家分解による実世界オンライン強化学習の効率化:ロボット操作への応用
実世界でのオンライン強化学習を効率化するため、集中訓練と分散実行(CTDE)とハイブリッド報酬アーキテクチャ(HRA)を組み合わせ、複数のエージェントが共有する多頭批評家を導入した。タスク報酬と把握報酬を分離し、サンプル効率と性能を大幅に向上させた。
原題: Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition / Changhao Li, Yifang Zhang, Heng Zhang 他
日本語で読む → - 論文自動運転/強化学習機械学習
Dreamer-SAC: 潜在世界モデルにおけるオフポリシー学習によるサンプル効率的な自動運転
自動運転向けに、世界モデルとソフトアクタークリティックを組み合わせ、潜在空間でオフポリシー学習するフレームワークを提案。短いロールアウトとnステップ目標推定により、少ない実環境インタラクションで高い性能を達成した。
原題: Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving / Jiazhuo Li, Linjiang Cao, Qi Liu 他
日本語で読む → - 論文サービスロボット/世界モデルロボティクス
PBD-AG: 不確実性を考慮した検査を備えた持続的ベースライン-デルタ能動グラフによる長時間稼働サービスロボットのための世界モデル
長時間稼働するサービスロボット向けに、安定した構造物と変化する物体イベントを分離した持続的な世界モデルを構築するフレームワークを提案。ロボットが自律的に環境を探索し、物体の状態を確率的に管理し、検査視点を選択することで、長期的な認識の信頼性を向上させる。
原題: PBD-AG: Persistent Baseline-Delta Active Graphs with Uncertainty-Aware Inspection for Long-Horizon Service Robots / Shuo Bao, Wei Dong, Shuyue Zhang 他
日本語で読む → - 論文多物体追跡/UAVロボティクス
JitTrack: 敏捷なUAVの視点揺れに対するオンボード多物体追跡
UAVの機体運動による視点揺れに頑健なオンボード多物体追跡フレームワークを提案し、実機での追跡性能を検証した。
原題: JitTrack: Onboard Multi-Object Tracking Against Viewpoint Jitter for Agile UAVs / Yachun Shan, Feitian Zhang
日本語で読む → - 論文操作ロボティクス
JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
原題: JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation / Xiao Liu, Yuguang Yang, Xi Wang 他
日本語で読む → - 論文ハプティックロボティクス
運動感覚ハプティックシステムにおける非線形仮想環境のクープマン表現
非線形仮想環境の力覚レンダリングにクープマン演算子を用いる手法を提案し、シミュレーションと実験で有効性を確認した。閉ループ安定性解析も行い、従来の受動性ベース手法より保守的でないことを示した。
原題: Koopman Representation of Nonlinear Virtual Environments in Kinesthetic Haptic Systems / Yanting Zhou, Jozsef Kövecses, James Richard Forbes
日本語で読む → - 論文深度推定画像認識
RGB基盤モデルの階層的監督による熱画像深度推定への転用
熱画像からの深度推定において、RGB基盤モデルの階層的表現を活用するフレームワークRGB-HSを提案し、複数レベルでの特徴整合と品質検証により性能を向上させた。
原題: Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision / Jie Hong, Tingtian Li, Xuesong Li 他
日本語で読む → - 論文操作/監視ロボティクス
接触前実行監視:行動条件付き潜在世界モデルによるコンタクトガード
ロボットの接触を伴う操作において、接触前に失敗を予測して動作を中断する監視システムを提案。未ラベルの軌跡から潜在世界モデルを学習し、計画された行動の結果を予測して失敗を検出する。
原題: ContactGuard: Pre-Contact Execution Monitoring with Action-Conditioned Latent World Models / Gehan Zheng, Matthew Johnson-Roberson, Weiming Zhi
日本語で読む → - 論文VLA/解釈可能性ロボティクス
VLA表現からのタスク進捗の解読
視覚言語行動モデル(VLA)の内部表現からタスクの進捗状況が線形に読み取れることを発見し、それを用いたラベル不要の異常検出器を提案した論文。
原題: Decoding Task Progress from VLA Representations / Atiksh Bhardwaj, Edward Weiyi Duan, Prithwish Dan 他
日本語で読む → - 論文LLM/海上航行AI
実海域の航海シナリオにおける状況理解とCOLREG遵守のためのLLM能力の探求
AISデータから作成した50の実世界の航海シナリオを用いて、大規模言語モデル(LLM)が海上航行規則(COLREG)と「良き船乗り」の慣行を理解し、適切な行動を推論できるかを評価した。その結果、微調整なしでは大きなオンラインモデルでもこのタスクは難しいことが示された。
原題: Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios / Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen 他
日本語で読む → - 論文産業用自動化ロボティクス
RAGベースの産業用フィールドバス機器自動設定
産業用機器の設定を自動化するパイプラインを提案。PDFマニュアルからハイブリッド検索とLLMで設定を生成し、安全ゲートで誤動作を防ぐ。
原題: RAG-Based Auto-Configuration for Industrial Fieldbus Devices / Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi
日本語で読む → - 論文探査計画ロボティクス
自律科学探査のためのPOMDP
センサ不確実性下での科学探査計画を、生のセンサデータではなく推論された物理特性に基づいて分岐するPOMDP(SHM-POMDP)を導入し、計算効率と報酬を改善した。
原題: POMDPs for Autonomous Science Exploration / Daniel Guirguis, Nathan Wallace, Hanna Kurniawati 他
日本語で読む → - 論文姿勢推定画像認識
カメラ校正誤差に対する証明可能な一次免疫を備えた差動6自由度姿勢推定
フレーム間の画像変位と既知の3D制御点からプラットフォームの6自由度運動を直接推定する差動法を提案し、並進の外部校正誤差が厳密に相殺されることを証明した。
原題: Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors / Yueqiang Zhang, Liang Deng, Yi Zhang 他
日本語で読む → - 論文操作学習ロボティクス
JoyAI-RA 0.5: デュアルアクションアライメントによるロボット操作学習のスケーリング
人間の映像データやシミュレーション、実ロボットなど異なるデータソースを統合してロボット操作を学習するためのフレームワークを提案し、潜在アクションの推論と統一アクション空間への変換により、データの多様性を活かして汎用ポリシーの性能を向上させる。
原題: JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment / RA Team
日本語で読む → - 論文物体検出画像認識
データセット構成が組み込みリアルタイムUAV山火事検出に与える影響:コンパクトYOLOモデルを用いた検証
UAVによる山火事検出において、実画像とAI生成画像の混合やデータ拡張が性能に与える影響を、コンパクトなYOLOモデルで評価した。実データのみの非拡張データセットが最良の性能を示し、合成データや拡張の効果は限定的だった。
原題: Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models / Eduardo de los Santos, Andre S. Kelbouscas, Ricardo B. Grando 他
日本語で読む → - 論文カリキュラム学習/ナビゲーションロボティクス
構造化パラメトリック環境下でのカリキュラム生成による頑健なナビゲーションポリシー
連続的な環境パラメータ(旋回率、障害物、摩擦など)に対して頑健なナビゲーションポリシーを学習するため、勾配ベースのカリキュラム生成フレームワークを提案し、分布シフト正則化を導入してマルチモーダル観測の表現を改善した。2つの連続制御環境で既存手法を上回る性能を示した。
原題: Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies / Prishita Ray
日本語で読む → - 論文触覚・力覚学習ロボティクス
物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
原題: Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning / Shilin Shan, Chuhao Zhou, Ruize Wang 他
日本語で読む → - 論文世界モデル画像認識
ワールドモデリングはどこへ向かうのか?
エージェントの継続的改善のための世界モデルの概念を、物理状態遷移からエージェント中心の情報遷移へと拡張し、6つのプロキシ形式と3つの活用レベルを提案する。
原題: Quo Vadis, World Modeling? / Yu Yang, Xuemeng Yang, Licheng Wen 他
日本語で読む → - 論文群制御ロボティクス
機械内の形態的多様性による環境レジリエンス
生物が内部の多様な部品間の相互作用を通じて環境変化に適応する仕組みを、機械の結合体で再現し、内部の物理的逆境が外部環境への耐性を高めることを示した。
原題: Environmental resilience via morphological diversity within machines / Alice Hein, Josh Bongard
日本語で読む → - 論文VLA/移動操作ロボティクス
意味的3Dガウススプラッティングによるオープンボキャブラリ移動操作のための身体化マルチモーダル基盤付け
家庭環境でのオープンボキャブラリ物体操作を実現するため、能動的マルチビュー意味的3Dガウススプラッティングと拡散型VLAポリシーを統合した身体化マルチモーダル基盤付けフレームワークを提案し、実ロボット評価で高い成功率を示した。
原題: Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting / Huosen Ou, Dongni Song, Yuncong Wang 他
日本語で読む → - 論文UAVナビゲーションロボティクス
FlowPilot: 俊敏なUAVナビゲーションのためのリアルタイム世界行動モデリング
深度画像から将来のシーンと軌道を同時に生成するコンパクトな世界行動モデルを提案し、シミュレーションと実機で高速・高機動な飛行を実現した。
原題: FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation / Runqing Wang, Ding Yu, Pengyuan Min 他
日本語で読む → - 論文全身制御/学習ロボティクス
LooperMuscle: 構造化Mixture-of-Expertsによるヒューマノイド全身追従の高速かつ安定な学習
ヒューマノイドの全身追従タスクにおいて、高速学習手法FastSACの性能低下を、構造化MoEアクターと専門家認識型クリティック、寄与度ルーティングリプレイを組み合わせた閉ループ学習で改善し、PPOに近い精度を約45分で達成した。
原題: LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts / Boyi Liu, Qijin Li, Tianqi Yu 他
日本語で読む → - 論文3D再構成画像認識
Swimm3R: 水中3D再構成のための媒質対応SfMとベータスプラッティング
水中環境での散乱や減衰による3D再構成の失敗を解決するため、媒質対応SfMとベータスプラッティングを組み合わせた統一フレームワークを提案し、新たな水中ビデオデータセットで有効性を示した。
原題: Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction / Minseong Kweon, Junaed Sattar
日本語で読む → - 論文VLAロボティクス
OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
原題: OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation / Tianyi Zhang, Ziyang Gong, Zhenjie Yang 他
日本語で読む → - 論文移動操作/VLAロボティクス
DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
原題: DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation / Zheng Yang, Wenjie Zhang, Xiangyu Chen 他
日本語で読む → - 論文マニピュレーションロボティクス
AffordTrajDP: 動的アフォーダンス誘導によるロボット操作の視覚運動ポリシー学習
静的アフォーダンスの限界を克服するため、物体のSE(3)姿勢を媒体にアフォーダンス軌道を生成し、時間的に一貫した状態認識ガイダンスを提供する動的フレームワークを提案。ManiSkill3で70%の成功率を達成し、実機でも堅牢性を実証した。
原題: AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation / Gaoyuan Wu, Ziyu Shan, Haoyang Du 他
日本語で読む → - 論文触覚ロボティクス
ヒューマノイド向け形状適応型全身触覚:3Dプリント共形EITスキン
3Dプリントで作る曲面に沿った電気インピーダンス断層撮影(EIT)触覚スキンを提案し、平面・曲面・顔形状で接触位置推定を検証した。
原題: Toward Geometry-Scalable Whole-Body Touch for Humanoids: A 3D-Printed Conformal EIT Skin / Haofeng Chen, Carson Kohlbrenner, Jiri Kubik 他
日本語で読む →