論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ヒューマノイドロボット/ジェスチャ生成ロボティクス
WaveSync: ヒューマノイドロボットの同期した共話ジェスチャのための制約付き波面最適化
ヒューマノイドロボットが発話と同期した自然なジェスチャを生成するためのハイブリッドフレームワークを提案。LLMで意味的な重要度を推定し、動的運動プリミティブと波面最適化により、ハードウェアの制約を満たしつつジェスチャと音声の同期を実現する。
原題: WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots / Thang Tran Viet, Thanh Nguyen Canh, Gia Huy Uong 他
日本語で読む → - 論文巧みな操作ロボティクス
把持から巧みな操作へ:巧みな操作のための大規模把持事前学習
大規模な巧みな把持データセットを利用して低レベル制御器を事前学習し、関節式ツール使用などの機能的な巧みな操作タスクで性能を向上させる手法を提案した。
原題: From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation / Ying Yuan, Xinyu Liu, Sriram Krishna 他
日本語で読む → - 論文拡散ポリシー/自己改善機械学習
ReGuide: テスト時ガイダンスから自己改善型拡散ポリシーへ
拡散ポリシーの共変量シフト問題に対し、テスト時にガイダンスで生成した修正軌道を再利用してポリシーを自己改善するフレームワークを提案した。
原題: ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies / Tzu-Hsiang Lin, Srinivas Shakkottai, Dileep Kalathil 他
日本語で読む → - 論文群制御ロボティクス
DynaHMRC: 大規模言語モデルによる動的タスクのための分散型異種マルチロボット協調
各ロボットが役割認識を持つLLMエージェントとして動作する分散型フレームワークを提案し、動的タスクにおける異種マルチロボット協調のスケーラビリティと適応性を向上させた。
原題: DynaHMRC: Decentralized Heterogeneous Multi-Robot Collaboration for Dynamic Tasks with Large Language Models / Wenhao Yu, Yu'ang Xie, Yifan Duan 他
日本語で読む → - 論文安全制御ロボティクス
ピクセルから証明へ:並列コンフォーマルロバストMPCによる確率的に安全な潜在世界モデル制御
学習した潜在世界モデル上でロバストMPCを行い、コンフォーマル予測で安全性を保証するフレームワークを提案。視覚ベースの制御タスクで性能と安全性を向上させた。
原題: Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC / Devesh Nath, Anutam Srinivasan, Haoran Yin 他
日本語で読む → - 論文センサフュージョン制御
多数のMEMS IMUを用いた陸上ナビゲーションのためのロバスト拡張カルマンフィルタ
多数の低コストMEMS慣性センサを配列し、異常値除去とバイアス追跡を行う前処理フレームワークRISAFを導入して、拡張カルマンフィルタの精度とロバスト性を向上させた。
原題: Robust Extended Kalman Filter for Land Navigation Using Massive Array of MEMS IMUs / Omer Hanani, Alon Kipnis
日本語で読む → - 論文ナビゲーションロボティクス
展開可能なソーシャルロボットナビゲーションのための視覚言語モデル:意味推論と低レベル制御の橋渡し
本論文は、ソーシャルロボットナビゲーションにおける視覚言語モデルの活用を概観し、高レベルの意味推論と低レベルの制御を統合するための構造化されたロードマップを提案している。
原題: Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control / Runji Cai, Toshihiko Yamasaki, Ling Xiao
日本語で読む → - 論文sim2realロボティクス
実シーンと合成データ生成の効率的な連携:AIベースの認知ロボティクスとコンピュータビジョン応用に向けて
AIビジョンモデルの訓練データ生成において、シミュレーションと実世界のドメインギャップを埋めるための現在の限界とトレンドを議論し、それらを連携させる進行中の研究を紹介する論文。
原題: Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications / Paul Koch, Vivek Chavan, André Sers 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
原題: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation / Fengnian Zhang, Tao Huang, Siyu Xu 他
日本語で読む → - 論文ヒューマノイド制御ロボティクス
FADA: ダイナミクス整合による少数ショット領域適応を用いたヒューマノイド制御
ヒューマノイド制御における領域間のダイナミクス不整合に対処するため、プランナーと逆動力学モデルを分離し、少数の実機データでIDMのみを微調整するフレームワークを提案した。
原題: FADA: Few-Shot Domain Adaptation via Dynamics Alignment for Humanoid Control / Angchen Xie, Nikhil Sobanbabu, Ishayu Shikhare 他
日本語で読む → - 論文全身制御ロボティクス
AnyBody: 任意キーポイント指示による全身ヒューマノイドの自由制御
任意の身体キーポイントのサブセットを指示として全身ヒューマノイドを制御する統一的なコントローラを提案し、大規模なモーション追跡や下流タスクの学習を実現した。
原題: AnyBody: Free-Form Whole-Body Humanoid Control from Arbitrary Keypoint Guidance / Shuning Li, Sikai Li, Jiachen Li 他
日本語で読む → - 論文VLA/失敗予測ロボティクス
Tri-Info: 情報理論によるVLAモデルの汎用的で解釈可能な失敗予測
VLAモデルの動作を情報理論の観点から分析し、成功と失敗で異なる情報的シグネチャを捉えるTri-Info信号を提案。再学習なしでアーキテクチャや環境をまたいで失敗を検出でき、実世界タスクでも高い精度を達成。
原題: Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory / Jinghan Yang, Yunchao Zhang, Wang Yuan 他
日本語で読む → - 論文強化学習/探索ロボティクス
DF-ExpEnse: 拡散フィルタ探索によるサンプル効率的なファインチューニング
事前学習済みの生成制御ポリシーをオンライン経験でファインチューニングする際、探索の質を高めてサンプル効率を向上させる手法を提案。
原題: DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning / Calvin Luo, Chen Sun, Shuran Song
日本語で読む → - 論文安全性/シミュレーションロボティクス
OopsieVerse: 損傷認識シミュレーションによるロボット操作の安全性ベンチマーク
家庭用ロボットの物理的安全性を評価するため、接触力や温度変化などの損傷を検出・定量化する統一シミュレーションフレームワークとベンチマークを提案した。
原題: OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation / Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi 他
日本語で読む → - 論文宇宙機制御制御
リアプノフ監視型物理情報ニューラルネットワーク補正層を用いた劣駆動宇宙機のMPC制御
劣駆動宇宙機の姿勢制御において、NMPCに物理情報ニューラルネットワークによる外乱推定とリアプノフ監視機構を組み合わせ、慣性不確かさや未モデル化結合に対する追従性能を向上させる階層的制御アーキテクチャを提案した。
原題: MPC for underactuated spacecraft control with a Lyapunov supervised physics-informed neural network correction layer / Amirhossein Ayanmanesh Motlaghmofrad, Carlo Cena, Mauro Martini 他
日本語で読む → - 論文3D再構成画像認識
単一視点メッシュ再構成はロボットカメラの回転に汎化できるか?
ロボット搭載カメラの回転が単一視点メッシュ再構成の性能に与える影響を評価し、回転による深度推定の歪みやレイアウトずれを明らかにした。重力情報を活用した改良によりレイアウト誤差を47.1%削減できることを示した。
原題: Can Single-View Mesh Reconstruction Generalize to Robot Camera Rotation? / Yu Zhan, Guangcheng Chen, Hanjing Ye 他
日本語で読む → - 論文模倣学習ロボティクス
軌道標準化によるロボット模倣学習の改善
人間のデモンストレーション軌道の速度むらや冗長な停止を情報距離に基づいて再サンプリングする前処理手法ISRを提案し、実世界の操作タスクで成功率を約25%向上させた。
原題: Improving Robotic Imitation Learning via Trajectory Standardization / Licheng Yang, Lingfeng Qian, Fei Zheng 他
日本語で読む → - 論文マニピュレーションロボティクス
物理情報アイコナールケージングによる全身操作計画
物体を囲むロボット形状の脱出時間をアイコナール方程式でモデル化し、物理情報ニューラルネットワークで近似することで、接触モデルに依存しない頑健な全身操作計画を実現した。
原題: Physics-Informed Eikonal Caging for Whole-Arm Manipulation Planning / Yan Zhang, Yiming Li, Yifei Dong 他
日本語で読む → - 論文触覚/操作ロボティクス
UniTacVLA: 視覚言語行動モデルにおける統合触覚理解と予測
接触を伴う器用な操作のために、触覚信号を動的な相互作用の手がかりとして扱い、現在の触覚状態と将来の接触変化を統合的にモデル化するフレームワークを提案。触覚連鎖思考と粗密な将来触覚予測により状態・動態を考慮した事前知識を構築し、実時間と予測触覚を組み合わせた混合制御で高精度な操作を実現。
原題: UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models / Xidong Zhang, Yichi Zhang, Jiaxin Shi 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける宣言的知識と手続き的知識の分離
ロボットの模倣学習において、物体の概念(宣言的知識)と操作方法(手続き的知識)を分離できないことが汎化の妨げとなっている。本論文では、情報の流れを再構成した新しいVLAモデルw²VLAを提案し、モジュール化により知識を分離してゼロショット転移を可能にする。
原題: Decoupling the Declarative from the Procedural in Vision-Language-Action Models / Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu 他
日本語で読む → - 論文マニピュレーションロボティクス
CoDex: デモなしで学ぶ構成的手先機能操作
視覚言語モデルと強化学習を組み合わせ、デモなしでスプレーボトルやグルーガンなどの内部機構を持つ物体を操作する戦略を自律的に発見するフレームワークを提案。
原題: CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations / Bowen Jiang, William Painter Reger, Roberto Martin-Martin
日本語で読む → - 論文データ拡張ロボティクス
Pose6DAug: 物理的に妥当な多視点物体交換によるロボットデータ拡張
ロボットの失敗事例に対して、成功エピソードの物体だけを3Dで交換してデータ拡張する手法を提案し、新規物体での成功率を向上させた。
原題: Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation / Jonghoon Lee, Seong Hyeon Park, Byungwoo Jeon 他
日本語で読む → - 論文VLAロボティクス
MemoryVAM: ロボット操作のためのビデオ行動モデルへの記憶統合
ビデオワールドモデルポリシーにエピソード記憶機構を導入し、長期的な操作タスクで過去の情報を活用できるようにした。LIBERO-Memで成功率を5%から42.5%に向上させた。
原題: MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation / Yuxin Jiang, Chang Yu, Yunuo Chen 他
日本語で読む → - 論文画像処理ロボティクス
TIDY: ウェーブレット領域エントロピーと方向性ストライプ指数による熱赤外画像のノイズ除去
熱赤外画像のノイズ除去をウェーブレット領域で行う軽量な手法を提案し、実データで学習することで高速かつ頑健な処理を実現した。
原題: TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index / Tai Hyoung Rhee, Dong-Guw Lee, Ayoung Kim
日本語で読む → - 論文VLA/スキル獲得ロボティクス
InSight: 操縦可能なVLAによる自己誘導型スキル獲得
VLAモデルにプリミティブ動作レベルでの操縦性を持たせ、デモンストレーションの自動分割とVLMによるデータ収集のフィードバックループを通じて、人間のデモなしに新しい操作スキルを自律的に獲得するフレームワークを提案した。
原題: InSight: Self-Guided Skill Acquisition via Steerable VLAs / Maggie Wang, Lars Osterberg, Stephen Tian 他
日本語で読む → - 論文デジタルツイン/3D再構築ロボティクス
ArtiTwinSplat: RGB-Dビデオからのガウシアンスプラッティングによるインタラクティブなデジタルツイン再構築
RGB-Dビデオから物体の可動部構造と関節運動を自動推定し、写真のようにリアルで操作可能なデジタルツインを構築するフレームワークを提案。CADモデルや手動アノテーションを不要とし、実世界の観測から直接ロボットの計画・学習に使えるモデルを生成する。
原題: ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos / Pranjal Mishra, René Zurbrügg, Max Wilder-Smith 他
日本語で読む → - 論文器用操作/接触推定ロボティクス
接触なしでも心配なし:視覚と自己受容感覚による手内器用操作の接触推定
RGB-D視覚とロボットの自己受容感覚を融合し、接触状態を推定するトランスフォーマーモデルを提案。推定した接触信号で強化学習による物体の向き変えを実現し、シミュレーションと実機で検証した。
原題: NoContactNoWorries: Estimating Contact through Vision and Proprioception for In-Hand Dexterous Manipulation / Soham Patil, Avirup Das, Sourabh Bhosale 他
日本語で読む → - 論文VLA/安全性評価ロボティクス
ForesightSafety-VLA: 視覚・言語・行動モデルのための統合診断安全ベンチマーク
VLAモデルの安全性を評価するための診断ベンチマークを提案し、物理的相互作用・指示・視覚の3側面から13カテゴリの安全分類を定義して、シーン構造・言語コマンド・視覚観察の変動下でプロセスレベルのリスクを測定する。
原題: ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models / Mingyang Lyu, Yinqian Sun, Yiyang Jia 他
日本語で読む → - 論文ナビゲーションロボティクス
NavWM: 先読み計画のための統合ナビゲーションワールドモデル
ナビゲーションのための統合ワールドモデルを提案し、潜在世界トークンによる幾何・意味理解と、多様な行動予測による閉ループ計画を実現した。
原題: NavWM: A Unified Navigation World Model for Foresight-Driven Planning / Yanghong Mei, Longteng Guo, Ming-Ming Yu 他
日本語で読む → - 論文安全性検証ロボティクス
ロボット安全性のための検証可能な基盤モデル
基盤モデルをロボット制御に使う際の安全性検証を可能にするため、ポリシーを高次元知覚を担う大きなコントローラと低次元の安全センサーに基づく小さな安全モジュールに分離するフレームワークFEARLを提案し、シミュレーションと実機で有効性を示した。
原題: Verifiable Foundation Models for Robot Safety / Davide Corsi, Kyungmin Kim, Roy Fox
日本語で読む →