論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAAI
Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?
ビデオ世界モデルと行動予測を組み合わせたWorld Action Models (WAMs)の計算負荷を減らすため、事前学習済みビデオTransformerを表現ハブとし、軽量な出力ヘッドをドッキングする新しい設計原理DoTを提案し、単層行動ヘッドを30層ビデオバックボーンに接続したFaster-WAMを実装。低遅延で競争力のある性能と汎化を実証した。
原題: Faster-WAM: Do World Action Models Need Deep Action Modules? / Liheng Ma, Rui Heng Yang, Zhanguang Zhang 他
日本語で読む → - 論文監視/不確実性ロボティクス
仕様を守り続ける:不確実性下でのリアルタイム監視と海事ケーススタディ
不確実性下でロボットが複雑な仕様を満たすことを監視する枠組みを提案し、データ駆動の到達可能集合を用いてデータ要件を削減。海事ナビゲーションに適用し、シミュレーションと実機実験で有効性を示した。
原題: Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study / Elizabeth Dietrich, Hanna Krasowski, Emir Cem Gezer 他
日本語で読む → - 論文軌道生成ロボティクス
拡散モデルと一貫性蒸留による人間協調ロボット軌道生成の高速化
人間とロボットの協調環境で、衝突回避を考慮した関節空間軌道を拡散モデルで生成し、一貫性蒸留で推論を高速化する手法を提案した。
原題: Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation / Byeong-Il Ham, Hyun-Bin Kim, Kyung-Soo Kim
日本語で読む → - 論文VLAロボティクス
統一視覚運動ターゲット:物理的行動を超えたVLAの教師信号
VLAモデルの予測ターゲットを、物理的な行動だけでなく視覚的なシーン遷移情報も含む統一潜在表現に変更し、追加データやアーキテクチャ変更なしで学習効率と性能を向上させる手法を提案した。
原題: Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions / Zhenyang Feng, Unnat Jain
日本語で読む → - 論文マニピュレーションロボティクス
基盤モデルを活用したキッチンロボット操作
家庭環境でのロボット操作のため、オープンボキャブラリ物体検出や多視点セグメンテーション、3D再構成、6D姿勢推定を組み合わせたモジュール式認識パイプラインを提案し、キッチンでの食器操作タスクで高い性能と実機での適応性を実証した。
原題: Kitchen Robotic Manipulation utilizing Foundation Models / Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim
日本語で読む → - 論文人間ロボット協調ロボティクス
隠れた目標下でのゼロショット人間ロボット協調のための構造化LLM推論
プライベートな目標を持つ協調構築タスクにおいて、LLMを用いた構造化アーキテクチャで心の理論推論と階層的計画を組み合わせ、ゼロショットで人間とロボットの協調を実現する手法を提案した。人間実験で、従来の強化学習ベースラインより少ないインタラクション数と高い信頼評価を達成した。
原題: Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals / Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo 他
日本語で読む → - 論文経路計画ロボティクス
SCOPE: 未知3D環境における視野を考慮した安全ボリューム認証による経路計画
ロボット搭載の限られた視野センサで、移動前に意図した動作の安全ボリューム全体を観測・検証することを要求し、これをオンラインで認証する経路計画フレームワークSCOPEを提案。未知環境での安全なナビゲーションを実現し、シミュレーションと実機で有効性を示した。
原題: SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification / Junbin Yuan, Muqing Cao, Yunwoo Lee 他
日本語で読む → - 論文VLAロボティクス
時間で検索し、周波数で補正する
凍結された視覚言語行動ポリシーの性能を、訓練なしのテスト時補正フレームワークで向上させる。成功軌道からの低周波残差を転送し、長期的な操作タスクの成功率を改善する。
原題: Retrieve in Time, Correct in Frequency / Yuze Fan, Yue Cao, Pengjie Gao 他
日本語で読む → - 論文世界モデル画像認識
行動制御可能な世界モデルにおける統計的バイアスの克服
行動条件付き世界モデルが統計的ショートカットに依存する問題を指摘し、反事実的一貫性フレームワークCoCoを導入して行動制御性を向上させた。
原題: Overcoming Statistical Bias in Action-Controllable World Models / Yuhong Shi, Zhenhao Chu, Jie Wei 他
日本語で読む → - 論文VLAロボティクス
抑制は効くが局所性は脆い:VLAポリシーにおけるタスクベクトル否定の閉ループ標的・制御監査
マルチタスクの視覚言語行動(VLA)ポリシーからタスクベクトルを引き算したときの挙動を、全10スキルで監査し、抑制可能・抵抗・全崩壊の3つの様式があることを示した。
原題: Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies / Shaoguang Wang, Weiyu Guo, Rushi Dai 他
日本語で読む → - 論文群制御ロボティクス
PRIMAL3: 強化学習と模倣学習によるマルチエージェント経路探索 - LaCAM3を活用した大規模フレームワーク
本論文は、強化学習と模倣学習を統合した大規模マルチエージェント経路探索フレームワークPRIMAL3を提案し、ボトルネックや行き止まりなどの重要な状態でのエージェント間の協調を改善する。
原題: PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3 / Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps 他
日本語で読む → - 論文身体化エージェント/記憶システムロボティクス
Mimir: インタラクティブ環境における身体化エージェントのための動的グラウンディングを備えたニューロシンボリック記憶システム
身体化エージェントの長期タスク遂行を改善するため、世界記憶とタスク記憶を分離し、行動前に動的にグラウンディングするニューロシンボリック記憶システムMimirを提案した。
原題: Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments / Haoming Xu, Zhenlin He, Hengyi Wang 他
日本語で読む → - 論文VLA画像認識
Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデル
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
原題: Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models / Haodong Yan, Junfeng Li, Junjie He 他
日本語で読む → - 論文群制御ロボティクス
展開は運命ではない:未見のソフトウェア・ハードウェア・計算ペイロードによる現場でのロボット再構成
ロボットのサブシステム間の密結合によるモノリシック設計を解消し、実行時に未見のモジュールをプラグアンドプレイで統合・分散共有できる再構成フレームワークを提案。災害対応シナリオで実証した。
原題: Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads / Steven Swanbeck, Jonathan Salfity, Jeffery Gunawan 他
日本語で読む → - 論文模倣学習/可変インピーダンス制御ロボティクス
VIDP: 多様なデモから学ぶコンプライアントなロボット操作のための可変インピーダンス拡散ポリシー
力センサを使わずに、多様なデモから可変インピーダンス制御を学習するフレームワークを提案。タスクパラメータ化された方向性を考慮した混合モデルで軌道分布を抽出し、剛性プロファイルに変換して位置とコンプライアンスを同時予測する。
原題: VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations / Hisham Khalil, Neil Fernandes, Thomas M. Kwok 他
日本語で読む → - 論文ナビゲーションロボティクス
順序なしランドマークを用いた視覚ナビゲーション
時間順序や深度などの補助センサーに依存せず、順序のない画像集合から2Dトポロジカルマップを構築し、グラフベースの信念伝播フィルタで自己位置推定と動的サブゴール計画を行うRGBのみのナビゲーションフレームワークを提案した。
原題: Unordered Landmark Visual Navigation / Hao Ren, Junzhe Zhu, Yihan Li 他
日本語で読む → - 論文マッピングロボティクス
M2-SMap: 階層的マルチモデル表現によるメモリ効率的なセマンティックマッピング
リソース制約のあるロボット向けに、階層的マルチモデル表現を用いてメモリ消費を抑えつつ、多様な環境を表現できるセマンティックマッピングフレームワークを提案した。
原題: M2-SMap: Memory-Efficient Semantic Mapping with Hierarchical Multi-Model Representation / QiYing Deng, ZhongLai Wang, Yuan Gao 他
日本語で読む → - 論文マニピュレーションロボティクス
投影-引き戻しMPPI: マニピュレータのための厳密な制約多様体制御
MPPI制御では制約をコストでしか扱えず近似に留まる問題を解決するため、サンプリングされたダイナミクス内で制約を強制する投影-引き戻しMPPIを提案した。二腕ロボットのシミュレーションと実機で検証し、閉リンク等式制約を数値許容誤差内で満たすことを示した。
原題: Projection-Retraction MPPI: Exact Constraint-Manifold Control for Manipulators / Seulchan Lee, Leesai Park, Minhyeong Kang 他
日本語で読む → - 論文群制御ロボティクス
再構成可能な構造ロボット組立:自己整列複合入れ子格子モジュールによるインターロック3次元集合体
ロボットと材料を一体化した自己整列可能な格子モジュールを開発し、ロボットアームと移動式組立機で家具や建築規模の構造物を組み立てられることを実証した。
原題: Reconfigurable Structural Robotic Assembly: Interlocking 3D Aggregations with Self-Aligning Compound Nested Lattice Modules / Alexander Htet Kyaw, Miana Smith, Paul Richard 他
日本語で読む → - 論文VLAロボティクス
LIRA: 視覚言語行動デコーディングのための局所クロスレイヤー情報ルーティング
VLAモデルにおいて、VLMの中間特徴をアクションデコーダにルーティングする新しい機構LIRAを提案。深さを考慮した局所ウィンドウで情報を集約し、既存のバックボーンや学習手法を変えずに性能を向上させる。
原題: LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding / Zhewei Zhang, Puyue Wang, Guanren Qiao 他
日本語で読む → - 論文移動操作/強化学習機械学習
LUCID: 想像上のダイナミクスによる潜在スキル統合制御による長期的ヒューマノイド移動操作
長期的なヒューマノイドの移動操作タスクを解決するため、学習したダイナミクスモデルの想像上のロールアウトを通じて再利用可能なスキルを計画する階層的モデルベース強化学習フレームワークを提案した。
原題: LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation / Cheng Guo, Mingzhe Ni, Angelo Cangelosi 他
日本語で読む → - 論文VLAロボティクス
マルチモーダルロボットデモにおける指示と軌道の不一致の監査
ロボットのデモデータセットに含まれる、正しい動作だが誤った指示が付与されたデータを検出・修正する監査手法を提案した。
原題: Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations / Simon Holk, Ryosuke Takanami, Tatsuya Matsushima 他
日本語で読む → - 論文HRI/LLMロボティクス
知能の限界効用:短期・自由対話型ヒューマンロボットインタラクションにおけるLLM規模とユーザー知覚の非線形関係
19人の参加者が4B、8B、30BパラメータのLLMを搭載したロボットと短時間の自由対話を行い、知覚される知能や自然さに有意差がないことを示し、モデル規模の拡大が必ずしもユーザー体験向上につながらないことを明らかにした。
原題: Diminishing Returns of Intelligence: The Non-Linear Relationship Between LLM Scale and User Perception in Short-Duration Open-Ended Social Human-Robot Interactions / Amanda Rasille Røn Volf, Morten Roed Frederiksen
日本語で読む → - 論文ナビゲーションロボティクス
ガウス型人間コスト関数を用いた社会的ナビゲーションのためのMPPIプランニング
歩行者の将来位置を予測し、移動方向に沿った異方性ガウス斥力場としてコスト化するMPPIプランナーを提案。混雑環境での衝突率を大幅に低減しつつリアルタイム性能を維持した。
原題: MPPI Planning with Gaussian-Based Human Cost Function for Social Navigation / Chinmay Mundane
日本語で読む → - 論文VLAロボティクス
Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留する
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
原題: Vid2WAM: Distilling Video Diffusion Priors into World Action Models / Chenhao Qiu, Ruixiang Wang, Runyi Zhao 他
日本語で読む → - 論文pHRIロボティクス
ロボット支援入浴のための高忠実度な人間デモンストレーションの捕捉・再構築・転移
臨床医による入浴デモンストレーションを接触領域を基盤として高忠実度に記録し、そのデータを用いてソフトハンド搭載ロボットによる入浴動作を実現した。
原題: High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing / Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo 他
日本語で読む → - 論文グリッパ/ハードウェアロボティクス
高帯域・透明な物理的相互作用のための超低インピーダンスロボットグリッパ
高減速比の伝達機構と外部センサに頼らず、ダイレクトドライブモータと低減速比の差動機構を組み合わせた9自由度3指グリッパを提案し、低インピーダンスで高帯域な物理的相互作用を実現した。
原題: Ultra-Low-Impedance Robotic Gripper for High-Bandwidth and Transparent Physical Interaction / Joon Lee, Ari Choi, Seokhwan Jeong
日本語で読む → - 論文位置推定ロボティクス
惑星探査ドローン向けテザー慣性位置推定
惑星探査用UAVの位置推定を、テザー(ケーブル)の長さと角度の計測と慣性センサを組み合わせて行う新しい手法を提案。ケーブルのたるみをモデル化し、ガウス過程で誤差を補正することで、高精度な位置推定を実現した。
原題: Tether-Inertial Localization for Planetary Drones / Dielof van Loon, Anton Bredenbeck, Lennart Puck 他
日本語で読む → - 論文VLAロボティクス
HarnessWAM:世界行動モデルにおける予測と熟考の橋渡し
世界行動モデル(WAM)の予測と実行のギャップを埋めるエージェントフレームワークを提案。視覚言語モデルによるタスク管理とイベント駆動の二重タイムスケールフィードバックで、複雑なタスクの計画・実行・失敗回復を実現する。
原題: HarnessWAM: Bridging Prediction and Deliberation in World Action Models / Zhaopeng Gu, Bingke Zhu, Tianxi Lin 他
日本語で読む → - 論文多物体追跡画像認識
GenTrack3: クラスタ認識型関連付けを用いた確率的・決定的ハイブリッドオンライン多物体追跡
決定論的手法と確率的手法を統合したオンライン多物体追跡フレームワークを提案し、スケーラブルなトラック検出マッチング手法を導入して群追跡を支援する。
原題: GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association / Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft 他
日本語で読む →