論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文歩行ロボティクス
足位置マップと安定性報酬を用いた四足ロボットの複雑地形歩行学習
四足ロボットの複雑地形歩行を強化学習で行う際、高さマップに足位置マップを統合し、動的安定性報酬を導入することで、正確で安定した歩行を実現した。
原題: Learning Locomotion on Complex Terrain for Quadrupedal Robots with Foot Position Maps and Stability Rewards / Matthew Hwang, Yubin Liu, Ryo Hakoda 他
日本語で読む → - 論文シミュレーションロボティクス
Habitat-GS: 動的ガウシアンスプラッティングを用いた高忠実度ナビゲーションシミュレータ
Habitat-Simを拡張し、3Dガウシアンスプラッティングによる高精細なシーン描画と、駆動可能なガウシアンアバターによる動的人間モデリングを統合したナビゲーション用シミュレータを提案した。
原題: Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting / Ziyuan Xia, Jingyi Xu, Chong Cui 他
日本語で読む → - 論文群制御ロボティクス
VULCAN: 屋内火災対応のための視覚言語モデル強化型マルチエージェント協調ナビゲーション
火災時の屋内環境で、視覚言語モデルを用いたマルチエージェント協調ナビゲーション手法を提案し、煙や熱などの動的障害をシミュレートしたベンチマークで既存手法の限界を示した。
原題: VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response / Shengding Liu, Qiben Yan
日本語で読む → - 論文sim2realロボティクス
物理的ヒューマンロボットインタラクションにおけるポリシー学習のための生成的シミュレーション
大規模言語モデルと視覚言語モデルを用いて、自然言語プロンプトから多様な物理的ヒューマンロボットインタラクションシナリオを自動生成し、模倣学習ポリシーを訓練するフレームワークを提案。ユーザー研究で80%以上の成功率でゼロショットsim-to-real転送を達成した。
原題: Generative Simulation for Policy Learning in Physical Human-Robot Interaction / Junxiang Wang, Xinwen Xu, Tiancheng Wu 他
日本語で読む → - 論文群制御ロボティクス
二台の四足ロボットによる協調搬送のための安全重視型集中非線形MPC
二台の四足ロボットが協調してペイロードを搬送する際に、衝突回避などの安全性を保証する集中型非線形モデル予測制御(NMPC)を提案し、実機実験で有効性を検証した。
原題: Safety-Critical Centralized Nonlinear MPC for Cooperative Payload Transportation by Two Quadrupedal Robots / Ruturaj S. Sambhus, Yicheng Zeng, Kapi Ketan Mehta 他
日本語で読む → - 論文マニピュレーションロボティクス
VADF: 視覚適応型拡散ポリシーフレームワークによる効率的なロボット操作
拡散ポリシーの学習収束の遅さと推論タイムアウト問題を解決するため、訓練時のサンプル難易度に応じた重み付けと、推論時の視覚に基づくタスク分割により、収束ステップ数を削減し早期成功率を向上させるフレームワークを提案した。
原題: VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation / Xinglei Yu, Zhenyang Liu, Shufeng Nan 他
日本語で読む → - 論文データ生成/VLAロボティクス
V-CAGE: ロボット操作のための視覚閉ループエージェント生成エンジン
VLAモデル学習用の高品質な合成データを自動生成するエージェントフレームワークを提案。セマンティックなレイアウト計画と視覚自己検証により、物理的に実行可能なシーンと軌道を生成し、データ圧縮も実現する。
原題: V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation / Yaru Liu, Ao-bo Wang, Nanyang Ye
日本語で読む → - 論文シミュレーション/変形物操作ロボティクス
FLASH: GPU高速シミュレーションによる数分での高忠実度変形物操作の高速学習
GPUネイティブな変形物操作シミュレーションフレームワークFLASHを提案し、数分の合成データ学習で実ロボットのタオル折りや衣類折りをゼロショットで成功させた。
原題: FLASH: Fast Learning via GPU-Accelerated Simulation for High-Fidelity Deformable Manipulation in Minutes / Siyuan Luo, Bingyang Zhou, Chong Zhang 他
日本語で読む → - 論文手の再構築/レンダリング画像認識
MASS: メッシュ整合楕円変形可能サーフェルスプラッティングによる自己中心視単眼ビデオからの手の再構築とレンダリング
自己中心視の単眼ビデオから高精細な3D手を再構築するため、変形可能な2Dガウシアンサーフェル表現を用いた新しい手法を提案し、メッシュ整合楕円とフラクタル密度化によるメッシュからサーフェルへの変換、およびサーフェル変形と不透明度マスクによる効率的なモデリングを実現した。
原題: MASS: Mesh-inellipse Aligned Deformable Surfel Splatting for Hand Reconstruction and Rendering from Egocentric Monocular Video / Haoyu Zhu, Yi Zhang, Lei Yao 他
日本語で読む → - 論文VLAAI
Rule-VLN:意味推論と幾何補正による知覚とコンプライアンスの橋渡し
ルール遵守ナビゲーションのための大規模都市ベンチマークRule-VLNを構築し、事前学習済みエージェントに安全意識を付与するゼロショットモジュールSNRMを提案した。
原題: Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification / Jiawen Wen, Penglei Sun, Wenjie Zhang 他
日本語で読む → - 論文VLA/計画ロボティクス
意味的に汎化可能な計画のための接地された世界モデル
視覚と言語を整合させた潜在空間で世界モデルを学習し、行動の将来結果とタスク指示の類似度で行動を評価するMPC手法を提案。未見の視覚信号や指示表現を含むベンチマークで従来のVLAを大幅に上回る汎化性能を示した。
原題: Grounded World Model for Semantically Generalizable Planning / Quanyi Li, Lan Feng, Haonan Zhang 他
日本語で読む → - 論文動作生成画像認識
Re$^2$MoGen: LLM推論と物理認識リファインメントによるオープンボキャブラリ動作生成
テキストから動作を生成する際、訓練データにない未知の記述に対して性能が落ちる問題を解決するため、LLMの推論と強化学習による物理的妥当性の改善を組み合わせたフレームワークを提案した。
原題: Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement / Jiakun Zheng, Ting Xiao, Shiqin Cao 他
日本語で読む → - 論文エージェントガバナンスロボティクス
具現化エージェントの活用:ポリシー制約実行のためのランタイムガバナンス
エージェントの認知と実行監視を分離し、ポリシー検査やロールバック等を行う専用ランタイム層を導入して、実行中の安全性を確保する枠組みを提案した。シミュレーションで高い介入成功率と回復成功率を実証した。
原題: Harnessing Embodied Agents: Runtime Governance for Policy-Constrained Execution / Xue Qin, Simin Luan, John See 他
日本語で読む → - 論文オフロード走行ロボティクス
マルチモーダルLLMを用いた視覚プロンプトに基づくオフロード地図生成の推論
SAM2によるセグメンテーションと視覚言語モデル(VLM)の推論を組み合わせ、ゼロショットで走行可能領域を判定するオフロード自律走行の統合フレームワークを提案した。
原題: Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs / Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu 他
日本語で読む → - 論文拡散ポリシー/非同期実行ロボティクス
DiscreteRTC: 離散拡散ポリシーは自然な非同期実行器である
離散拡散ポリシーが本来持つインペインティング能力を活用し、非同期実行を実現する新しいポリシー「DiscreteRTC」を提案。連続的なRTCと比べて、追加コードなしで実装でき、推論コストも削減しつつ、動的タスクでの成功率が向上することを示した。
原題: DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors / Pengcheng Wang, Kaiwen Hong, Chensheng Peng 他
日本語で読む → - 論文器用操作ロボティクス
HANDFUL: 資源を考慮した逐次把持条件付き器用操作
器用なロボットハンドで、最初の把持を維持しながら次の操作タスクを実行する逐次操作を学習するフレームワークを提案し、指の使用を資源とみなして資源を考慮した把持を探索する。
原題: HANDFUL: Sequential Grasp-Conditioned Dexterous Manipulation with Resource Awareness / Ethan Foong, Yunshuang Li, Hao Jiang 他
日本語で読む → - 論文VLA/操作ロボティクス
移動してから操作する:人間らしいロボット操作のための行動フェーズ分割
ロボット操作を粗い移動フェーズと接触が重要な操作フェーズに分離するVLAフレームワークを提案し、RoboTwin2ベンチマークで従来手法より高い成功率を達成した。
原題: Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation / Haoming Xu, Lei Lei, Jie Gu 他
日本語で読む → - 論文協調自動運転ロボティクス
SwarmDrive: 遅延制約のある協調自動運転のための意味的V2V連携
近隣車両が小型言語モデルで意図を共有し、不確実性が高い時のみイベント駆動で合意形成するV2V協調フレームワークを提案し、交差点の遮蔽シナリオで成功率と遅延を改善した。
原題: SwarmDrive: Semantic V2V Coordination for Latency-Constrained Cooperative Autonomous Driving / Anjie Qiu, Donglin Wang, Zexin Fang 他
日本語で読む → - 論文医用ロボティクス画像認識
SAMe: ロボット超音波のための意味的解剖マッピングエンジン
ロボット超音波の走査開始を支援するため、臨床症状から標的臓器を特定し、患者の外観画像から解剖学的表現を構築して、6自由度のプローブ初期化状態を生成する意味的解剖マッピングエンジンSAMeを提案した。
原題: SAMe: A Semantic Anatomy Mapping Engine for Robotic Ultrasound / Jing Zhang, Duojie Chen, Wentao Jiang 他
日本語で読む → - 論文VLA/サーベイロボティクス
ロボティクスにおける視覚-言語-行動モデル:データセット、ベンチマーク、データエンジンの調査
視覚-言語-行動(VLA)モデルの進歩はデータ基盤に依存するとし、データセット、ベンチマーク、データエンジンの3つの柱に沿ってデータ中心の分析を行い、今後の課題を整理したサーベイ論文。
原題: Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines / Ziyao Wang, Bingying Wang, Hanrong Zhang 他
日本語で読む → - 論文3D再構成/ガウシアンスプラッティング画像認識
スペクトラルスプラット:運転シーンのための外観分離型フィードフォワードガウシアンスプラッティング
運転シーンの3D再構成において、幾何学と外観(照明・天候など)を分離するフィードフォワードガウシアンスプラッティング手法を提案し、外観の転送や再照明を可能にした。
原題: SpectralSplat: Appearance-Disentangled Feed-Forward Gaussian Splatting for Driving Scenes / Quentin Herau, Tianshuo Xu, Depu Meng 他
日本語で読む → - 論文探査/強化学習ロボティクス
ロボット探査アルゴリズムにおける動的グラフの学習ベース間引き
ロボット探査で用いる動的グラフを強化学習(PPO)で間引き、冗長な情報を削減する手法を提案。RRTによるフロンティア探査のシミュレーションでグラフサイズを最大96%削減し、探索の一貫性が向上することを示した。
原題: Learning-Based Sparsification of Dynamic Graphs in Robotic Exploration Algorithms / Adithya V. Sastry, Bibek Poudel, Weizi Li
日本語で読む → - 論文リザーバコンピューティングロボティクス
OpenPRC: 物理リザーバコンピューティングにおける物理からタスクへの評価のための統合オープンソースフレームワーク
物理リザーバコンピューティング(PRC)の開発・評価を統一するオープンソースPythonフレームワークOpenPRCを提案。GPUシミュレーションと実実験データを同一インターフェースで扱い、再現性と物理認識最適化を実現する。
原題: OpenPRC: A Unified Open-Source Framework for Physics-to-Task Evaluation in Physical Reservoir Computing / Yogesh Phalak, Wen Sin Lor, Apoorva Khairnar 他
日本語で読む → - 論文姿勢推定制御
スカラー計測に基づくSO(3)上の相補フィルタによる姿勢推定
スカラー計測(部分的なベクトル観測)を用いた姿勢推定のための相補フィルタを提案し、特定の励起条件下でほぼ大域的漸近安定性を回復することを示した。
原題: Complementary Filtering on SO(3) for Attitude Estimation with Scalar Measurements / Alessandro Melis, Soulaimane Berkane, Tarek Hamel
日本語で読む → - 論文群制御ロボティクス
証明書駆動の閉ループ型マルチエージェント経路探索と継承可能な分解手法
倉庫や物流でのマルチエージェント経路探索(MAPF)において、閉ループ型アルゴリズムの短期的視点による問題を解決するため、証明書軌道と艦隊予算を導入し、証明書改善更新のみを受け入れることで完全性を保証し、さらに予算に基づく分解で大規模問題を効率的に解く手法を提案した。
原題: Certificate-Driven Closed-Loop Multi-Agent Path Finding with Inheritable Factorization / Jiarui Li, Runyu Zhang, Gioele Zardini
日本語で読む → - 論文地形センシングロボティクス
衝撃から洞察へ:粒状媒体上のダイナミクスを考慮した固有感覚地形センシング
高速ホッピング中の粒状地形との接触を固有感覚のみで推定する物理ベースのフレームワークを提案し、加速度依存の付加質量効果を考慮することで、準静的な仮定による誤差を補正し、地形剛性パラメータを正確に推定できることを示した。
原題: From Impact to Insight: Dynamics-Aware Proprioceptive Terrain Sensing on Granular Media / Yifeng Zhang, Yue Wu, Jake Futterman 他
日本語で読む → - 論文強化学習/部分観測/MPC/四足歩行機械学習
PriPG-RL: 部分観測システムのための特権プランナー誘導強化学習と常時実行可能なMPC
部分観測環境下で強化学習ポリシーを訓練する際、訓練時のみ利用可能な特権プランナー(近似モデルと完全状態情報を持つMPC)が学習エージェントを誘導する枠組みを提案し、シミュレーションと実機の四足ロボットで検証した。
原題: PriPG-RL: Privileged Planner-Guided Reinforcement Learning for Partially Observable Systems with Anytime-Feasible MPC / Mohsen Amiri, Mohsen Amiri, Ali Beikmohammadi 他
日本語で読む → - 論文状態推定ロボティクス
因子グラフとチェビシェフ多項式によるテンセグリティロボットの状態・軌道推定
ケーブル駆動テンセグリティロボットの状態推定に因子グラフとチェビシェフ多項式を用いた2段階手法を提案し、RGB-Dカメラとケーブル長センサの融合により高精度な連続時間推定を実現した。
原題: State and Trajectory Estimation of Tensegrity Robots via Factor Graphs and Chebyshev Polynomials / Edgar Granados, Patrick Meng, Charles Tang 他
日本語で読む → - 論文安全性評価ロボティクス
JailWAM: ロボット制御におけるワールドアクションモデルの脱獄
ワールドアクションモデル(WAM)の安全性リスクを評価する初の脱獄フレームワークJailWAMを提案。視覚軌跡マッピングとリスク判別器、二重経路検証により、悪意ある指示による不安全なロボット動作を効率的に検出する。
原題: JailWAM: Jailbreaking World Action Models in Robot Control / Hanqing Liu, Songping Wang, Jiahuan Long 他
日本語で読む → - 論文模倣学習ロボティクス
不完全な人間のデモンストレーションからのスキル獲得のための統合多層フレームワーク
本論文は、人間とロボットのインタラクションにおけるスキル教示を効率的かつ直感的で安全に行うための、3層からなる統合制御フレームワークを提案している。単一のデモから軌道と可変インピーダンスを学習し、特異点管理と全身コンプライアンスを実現する。
原題: A Unified Multi-Layer Framework for Skill Acquisition from Imperfect Human Demonstrations / Zi-Qi Yang, Mehrdad R. Kermani
日本語で読む →