論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文操作学習/強化学習/Sim-to-Realロボティクス
ゼロショットSim-to-Real転送を備えたマルチタスクブロック押し操作のための単一拡散ポリシーコントローラ
強化学習を用いて、複数の形状のブロックを押すマルチタスク操作を単一の拡散ポリシーで学習し、実世界へゼロショット転送できることを示した論文。
原題: A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer / Haitong Ma, Haldun Balim, Yang Hu 他
日本語で読む → - 論文HRI/XRHCI
拡張現実を媒介層とする人とロボットのチームにおける状況的ヒューマンコントロール
XRを人とロボットの協調における状況的制御の媒介層と捉え、看護支援や多腕遠隔操作などのシナリオから設計次元を導出する研究。
原題: Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming / Jens Grubert, John Dudley, Eyal Ofek 他
日本語で読む → - 論文把握検出/マルチモーダルロボティクス
Speech2Grasp: ヒューマノイドロボットにおけるテキスト条件付き把握検出の音声へのデータ効率的転移
テキスト条件付き把握検出モデルを音声入力に効率的に転移するフレームワークを提案し、実機ヒューマノイドでASRパイプラインより高性能かつ低遅延であることを示した。
原題: Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots / Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu 他
日本語で読む → - 論文ワールドモデルロボティクス
3Dポイントワールドモデル:点群補完による高精度なダイナミクス学習
部分点群を補完してから行動条件付きダイナミクスを学習する、3D空間で動作するタスク非依存のワールドモデルを提案し、長期的なロールアウトとモデルベース計画の精度を向上させた。
原題: 3D Point World Models: Point Completion Enables More Accurate Dynamics Learning / Skand Peri, Hung Nguyen, Chanho Kim 他
日本語で読む → - 論文触覚/VLA/操作ロボティクス
予期せぬ感覚を捉える:残差触覚表現によるResTacVLAの接触豊富な操作
視覚言語行動モデルに触覚を統合する際、視覚特徴が触覚を覆い隠す問題を解決するため、視覚予測と実際の触覚の差を残差表現として用い、視覚的に予測できない重要な接触イベントを捉えるResTacVLAを提案した。
原題: Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation / Pengwei Zhang, Bin Xie, Xinpan Meng 他
日本語で読む → - 論文HRI/教育ロボティクス
混合エージェント博物館ツアーガイド設計が性別による学習成果と訪問者の好みを改善する
物理ロボットと仮想エージェントを組み合わせた混合エージェントツアーガイドシステムを提案し、30人の参加者による実験で、女性の学習成績向上と訪問者の好みに効果があることを示した。
原題: Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences / Annette M. Masterson, Wonse Jo, Helena C. Sieh 他
日本語で読む → - 論文安全性/VLAロボティクス
制約付きフローマッチングによる視覚言語行動モデルのための神経記号的安全性ガイダンス
フローマッチングに基づくVLAモデルに対し、予測軌道のノイズ除去過程で安全制約を最適化問題として適用し、衝突を予測的に回避する手法を提案した。
原題: Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching / William English, Hao Zheng, Rickard Ewetz
日本語で読む → - 論文VLA/世界モデルロボティクス
DREAMSTEER: 潜在世界モデルによるVLAポリシーの展開時誘導(微調整不要)
事前学習済みの視覚言語行動(VLA)ポリシーを、微調整なしで展開時に潜在世界モデルと価値モデルを用いて誘導し、分布シフト下での成功率と指示追従精度を大幅に向上させるフレームワークを提案した。
原題: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning / Hanchen Cui, Sergio Arnaud, Arjun Majumdar 他
日本語で読む → - 論文SLAM画像認識
リアルタイムLiDARガウシアンスプラッティングSLAM
LiDARの幾何情報を活用し、高速なG-ICPレジストレーションと球面ラスタライズによる高密度マッピングを組み合わせたリアルタイムSLAMフレームワークを提案。局所共分散を用いたガウシアン初期化と幾何スコアによる刈り込み・高密度化で、オンライン軌跡で高精度かつ高速なマッピングを実現。
原題: Real-Time LiDAR Gaussian Splatting SLAM / Seungjun Tak, Yewon Jeon, Jaeik Hwang 他
日本語で読む → - 論文マニピュレーションロボティクス
衝突ベースの遅延探索による高速マルチマニピュレータ計画
複数マニピュレータの動作計画を高速化するため、遅延評価と事前計算を組み合わせた新しいアルゴリズムCBLSを提案した。
原題: Conflict-Based Lazy Search for Fast Multi-Manipulator Planning / Dongliang Zheng, Zhipeng Wang, Siqi Wang 他
日本語で読む → - 論文触覚画像認識
VQ-Touch: センサーとシナリオを横断する高効率触覚生成フレームワーク
触覚画像生成のためのフレームワークVQ-Touchを提案。データ効率の良い表現学習と離散拡散デコーダにより、異なるセンサーやシナリオでの触覚データ生成を実現し、既存手法を上回る性能を示した。
原題: VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios / Kailin Lyu, Long Xiao, Jianing Zeng 他
日本語で読む → - 論文自動運転/意思決定ロボティクス
自動運転における相互作用を考慮した注意機構ベースの高レベル意思決定学習
自動運転の車線変更や速度制御の高レベル意思決定を、動的な交通状況に応じて可変長の入力に対応しつつ、相互作用を明示的にモデル化する注意機構ベースのアーキテクチャDecisionPerceiverを提案した。固定サイズの潜在空間への投影と細かい行動離散化により、性能とスケーラビリティを向上させた。
原題: Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving / Marcelo Contreras, Willi Poh, Christoph Stiller 他
日本語で読む → - 論文強化学習/操作ロボティクス
HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
原題: HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models / Angen Ye, Weijie Ke, Xiaofeng Wang 他
日本語で読む → - 論文ベンチマークロボティクス
RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマーク
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
原題: RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies / Tianxing Chen, Yue Chen, Zixuan Li 他
日本語で読む → - 論文オフライン強化学習機械学習
効率的なオフライン強化学習のためのショートカット軌道計画
拡散モデルによる軌道計画の推論コストを削減するため、単一ステージで学習可能なショートカット軌道モデルを提案し、ステップサイズ調整による1ステップ・数ステップ推論と、実現可能性補正付き批評家による計画選択を実現した。
原題: Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning / Guanquan Wang, Yoshimasa Tsuruoka
日本語で読む → - 論文触覚ロボティクス
スパースな触覚による変形物体のトポロジー非依存メッシュ再構成
視覚なしで少数の触覚のみから、ロープ・布・立体など様々な変形物体の全体メッシュを再構成する学習ベース手法を提案。触覚の次の位置を能動的に選ぶことで精度が向上することを示した。
原題: Topology-Agnostic Mesh Reconstruction of Deformable Objects from Sparse Touch / Everest Yang
日本語で読む → - 論文マニピュレーションロボティクス
AutoSpeed: 注釈不要の段階適応型動作速度学習によるロボット操作
操作タスクの各段階の難易度に応じて動作速度と予測時間を適応させる学習フレームワークを提案し、注釈なしで速度を調整し、タスク実行時間を短縮し成功率を向上させる。
原題: AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation / Qingda Hu, Ziheng Qiu, Jieru Zhao 他
日本語で読む → - 論文自動実験/自己運転ラボAI
検証ボトルネックの圧縮:科学的発見のためのエージェント型セルフドライビングラボ
実験検証のボトルネックを減らすため、事前知識を活用した実験計画と、低コスト測定から高コスト測定を予測するサロゲートモデルを組み合わせたエージェントを提案し、生物学と材料科学でのループ数とコスト削減を目指す。
原題: Compressing the Validation Bottleneck: An Agentic Self-Driving Lab for Scientific Discovery / Kyunghoon Hur, Chihun Lee
日本語で読む → - 論文全身制御ロボティクス
Athena-WBC: 能力に合わせたポリシー専門家による長尾的人型全身制御
人型ロボットの全身運動追従制御において、訓練データの長尾部分(高ダイナミクス遷移やバランス重視動作)が解けない問題を、動作要求と訓練手法の能力ミスマッチと捉え、動的専門家とバランス専門家を備えた教師-学生パイプラインを提案し、少数の専門家でベースラインを上回る性能を達成した。
原題: Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control / Yuan Jiang, Ningyuan Zhang, Xicun Yang 他
日本語で読む → - 論文データ生成ロボティクス
PRISM: 画像ベースのシーン・動作合成によるパーソナライズドロボットデータセット生成
単一画像と自然言語指示から、ユーザ環境に適合した多様なデジタル双子シーンと実行可能なデモを自動生成し、ロボットポリシー学習用のパーソナライズドデータセットを構築するパイプラインを提案。
原題: PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis / Dogyu Ko, Haneul Kim, Chanyoung Yeo 他
日本語で読む → - 論文VLAロボティクス
WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦する
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
原題: WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time / Yusen Feng, Bingchen Han, Jiangran Lyu 他
日本語で読む → - 論文制御理論/MPPI制御
適応MPPIとオンライン外乱共分散推定:空間平滑化による証明可能な安定性の強化
未知で空間的に変動する外乱共分散を持つ非線形システムに対し、オンライン推定と空間拡散を組み合わせた適応MPPI制御を提案し、安定性証明の改善を示した論文。
原題: Adaptive MPPI with Online Disturbance Covariance Estimation: Provable Stability Tightening via Spatial Smoothing / Hyung-Jin Yoon, Hunmin Kim
日本語で読む → - 論文VLAロボティクス
ロボット操作のための視覚言語行動モデルにおける二重潜在記憶
視覚言語行動モデルに、過去の経験を潜在記憶トークンとして統合するフレームワークを導入し、長期依存タスクの性能を向上させた。
原題: Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation / Hongyu Qu, Jianzhe Gao, Xiaobin Hu 他
日本語で読む → - 論文VLA/長期メモリ/操作ロボティクス
NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
原題: NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation / Ziye Wang, Modi Shi, Chaojun Ni 他
日本語で読む → - 論文器用操作/ベンチマークロボティクス
DexVerse: 多タスク・多形態の器用操作のためのモジュール型ベンチマーク
多様な操作スキル、ロボット形態、視覚変化をカバーする大規模ベンチマークDexVerseを構築し、既存手法の汎化性能を評価した。
原題: DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation / Yunchao Yao, Zhuxiu Xu, Tianqi Zhang 他
日本語で読む → - 論文強化学習ロボティクス
Robo-ValueRL: オフラインからオンラインへの強化学習における信頼性の高い価値推定
オフラインからオンラインへの強化学習において、価値関数の信頼性がポリシー最適化に与える影響を分析する統一フレームワークを提案し、信頼性の高い価値推定が下流の性能向上に寄与することを実験で示した。
原題: Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning / Wenke Xia, Pei Ren, Wenbo Yu 他
日本語で読む → - 論文HRIロボティクス
ERR@HRI 3.0チャレンジ:人間とロボットのインタラクションにおけるエラー検出と予測のマルチモーダル手法
本論文は、人間とロボットのインタラクションにおけるエラー検出と予測を目的としたチャレンジの第3版を紹介し、自然環境下で収集された2つのデータセットを提供して、参加者がマルチモーダルモデルを開発することを促す。
原題: ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions / Maria Teresa Parreira, Micol Spitale, Maia Stiber 他
日本語で読む → - 論文計画画像認識
APIVOT: 視覚と言語の思考を適応的に交互配置する長期的計画手法
長期的なロボット計画において、言語による意味推論と視覚による幾何学的検証を適応的に交互に行うVLMベースのプランナーを提案し、キッチンタスクで性能を向上させた。
原題: APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts / Emily Jin, Joy Hsu, Yiqing Xu 他
日本語で読む → - 論文軌道計画ロボティクス
包括的グレブナー基底系に基づく実数量限定子消去を用いた3自由度ロボットマニピュレータの軌道計画と検証
3自由度ロボットマニピュレータの軌道計画と解の存在検証を、包括的グレブナー基底系に基づく実数量限定子消去法(CGS-QE法)で効率的に行うアルゴリズムを提案・実装した。
原題: Trajectory Planning and Certification for 3-DOF Robot Manipulators Using Real Quantifier Elimination Based on Comprehensive Gr\"obner Systems / Yu Nakai, Akira Terui, Masahiko Mikawa
日本語で読む → - 論文制御ロボティクス
MP-MPPI: モーションプリミティブ誘導型サンプリングベースのモデル予測制御最適化手法
モデル予測経路積分(MPPI)にモーションプリミティブを組み合わせ、構造化サンプリングで大域的最適解への収束を改善する新しい制御手法を提案した。クアッドコプターの障害物回避タスクで有効性を実証している。
原題: MP-MPPI: A Motion Primitive Guided Sampling-Based Optimizer for Model Predictive Control / Marlon Mathisen, Aksel Vaaler, Olav Egeland 他
日本語で読む →