論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文人型ロボット制御画像認識
MIND: テキスト駆動の物理ベース人型ロボット制御のためのマルチスケール意図拡散
テキスト指示から物理ベースの人型ロボットを制御する新しいエンドツーエンド拡散フレームワークを提案し、行動意図を意味的橋渡しとして用いることで、テキストと低レベル行動のギャップを解消する。
原題: MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control / Bin Li, Ruichi Zhang, Han Liang 他
日本語で読む → - 論文人型ロボット制御cs.GR
SCRIPT: 言語駆動の物理ベース人型ロボット制御のための多段階学習によるスケーラブル拡散ポリシー
自然言語指示で物理ベースの人型ロボットを制御するための、多段階学習フレームワークを備えた拡散ポリシーを提案。行動・状態・テキストを統合するトランスフォーマーと強化学習による後段学習で、指示追従性と動作品質を向上させた。
原題: SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control / Jingyan Zhang, Han Liang, Ruichi Zhang 他
日本語で読む → - 論文VLA/行動監視ロボティクス
VLAの失敗の仕方はアーキテクチャごとに異なる:ブラックボックス行動監視が明らかにする構造特異的な失敗シグネチャ
VLAアーキテクチャ(VQ-BeT、Diffusion Policy、ACT)がモーターコマンドレベルで異なる失敗パターンを示すことを発見し、アーキテクチャに合わせた監視手法の選択が重要であることを示した。
原題: How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures / Krishnam Gupta
日本語で読む → - 論文ロボット制御ロボティクス
HarmoWAM: 適応的世界行動モデルによる汎用性と精密操作の調和
世界行動モデル(WAM)の2つのパラダイム間のトレードオフを解消するため、予測と反応の2つの専門家を世界モデルで統合し、適応的ゲーティングで切り替えるエンドツーエンドのWAMを提案した。
原題: HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models / Qiuxuan Feng, Jiale Yu, Jiaming Liu 他
日本語で読む → - 論文ソフトロボティクスロボティクス
トポロジー最適化による空気圧ソフトアクチュエータの設計と実験的検証
非線形トポロジー最適化を用いて空気圧駆動のソフトアクチュエータを3D設計し、造形・実験で性能を検証した論文。
原題: Topology-Optimized Pneumatic Soft Actuator: Design and Experimental Validation / Sumit Mehta, Konstantinos Poulios
日本語で読む → - 論文VLA画像認識
GEM-4D: ロボット操作のための幾何学強化ビデオワールドモデル
ビデオ生成モデルに4次元対応関係の教師信号を注入し、外観と幾何構造を同時に学習させることで、物理的に一貫した未来予測とロボット操作への直接適用を可能にした。
原題: GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation / Kaichen Zhou, Yuzhen Chen, Fangneng Zhan 他
日本語で読む → - 論文VLAロボティクス
GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
原題: GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization / Xiaosong Jia, Bowen Yang, Zuhao Ge 他
日本語で読む → - 論文強化学習/飛行制御ロボティクス
重心再構成による劣駆動飛行船の二段階強化学習制御
推力2基と可動スライダーを持つ劣駆動飛行船の追従制御を、重心計画と推力制御を分離した二段階強化学習で実現し、シミュレーションと実機実験で有効性を示した論文。
原題: Bi-Level Reinforcement Learning Control for an Underactuated Blimp via Center-of-Mass Reconfiguration / Xiaorui Wang, Hongwu Wang, Yue Fan 他
日本語で読む → - 論文マニピュレーションロボティクス
ForceFlow: 接触駆動フローマッチングによる感覚と行動の学習
接触を伴う操作タスクのための力覚対応リアクティブフレームワークを提案。非対称マルチモーダル融合と視覚から力へのハンドオーバー機構により、力と運動の深い結合を実現し、実世界6タスクで成功率を37%向上させた。
原題: ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching / Shuoheng Zhang, Yifu Yuan, Hongyao Tang 他
日本語で読む → - 論文HRI/プログラミング教育HCI
ロボ・ブロック:ソーシャルロボットのエンドユーザー設計・プログラミングにおける生成的足場かけ
LLMを活用したブロック型プログラミング環境「Robo-Blocks」を設計し、初心者が物語構造を通じてロボットの行動を生成できるようにする手法を提案・評価した。
原題: Robo-Blocks: Generative Scaffolding in End-User Design and Programming of Social Robots / Arissa J. Sato, Callie Y. Kim, Nathan Thomas White 他
日本語で読む → - 論文世界モデル画像認識
残差潜在アクションによる視覚特徴ベース世界モデルの学習
視覚特徴ベースの世界モデルにおいて、DINO残差から学習可能な新しい潜在アクション表現(RLA)を導入し、フローマッチングで予測することで、既存手法より高速かつ高精度な未来予測を実現した。さらに、ロボット学習への応用として、アクションなし動画からの行動学習や、オフライン動画のみで学習する視覚RLフレームワークを開発した。
原題: Learning Visual Feature-Based World Models via Residual Latent Action / Xinyu Zhang, Zhengtong Xu, Yutian Tao 他
日本語で読む → - 論文動作計画ロボティクス
TCBiRRT:タスク空間ランダム拡張による密結合デュアルアーム宇宙マニピュレータの高速動作計画
閉ループ拘束下の密結合デュアルアーム宇宙マニピュレータに対し、タスク空間で直接サンプリング・展開する双方向RRTアルゴリズムTCBiRRTを提案し、従来手法より高い成功率と桁違いの高速化を達成した。
原題: TCBiRRT: Rapid Motion Planning for Tightly Coupled Dual-arm Space Manipulator Using Task-space Random Expansion / Jiawei Zhang, Xinhao Miao, Jifeng Guo 他
日本語で読む → - 論文ドローン/衝突耐性/強化学習ロボティクス
HoLoArm: 衝突に耐えるクアッドローターのための変形可能アーム
トンボの翅の結節構造に着想を得た柔軟アームを持つクアッドローターを提案し、強化学習制御により衝突後の回復と安定飛行を実現した。
原題: HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight / Quang Ngoc Pham, Jonas Eschmann, Yang Zhou 他
日本語で読む → - 論文SLAMロボティクス
証明可能最適なポーズグラフ最適化を備えた分散型LiDAR-SLAMシステム
分散型マルチロボットLiDAR-SLAMのための、証明可能最適なポーズグラフ最適化を統合した初のシステムを提案し、大規模環境でのグローバルな一貫性を向上させた。
原題: A Decentralized LiDAR-SLAM System with Certifiably Optimal Pose Graph Optimization / Baoshan Song, Feng Huang, Li-Ta Hsu
日本語で読む → - 論文位置推定ロボティクス
擬似衛星補強航法のための疎結合因子グラフ最適化
GNSSが劣化した環境で、擬似衛星とIMUデータを疎結合因子グラフ最適化で統合し、測位精度を向上させる手法を提案した。
原題: Loosely Coupled Factor Graph Optimization for Pseudolite-Augmented Navigation / Chih-Chun Chen, Lipeng Tan, Shiyu Bai 他
日本語で読む → - 論文触覚/制御ロボティクス
VBT-MPC: 視覚ベース触覚MPCによる輪郭追従
視覚ベース触覚センサを用いたモデル予測制御(MPC)を提案し、物体の輪郭追従を直接特徴空間で行うことで、姿勢推定や複雑な力制御を不要にした。シミュレーションと実機で多様な形状・材質の物体に対する追従性能を評価した。
原題: VBT-MPC: Vision-Based Tactile MPC for Contour Following / Edison Velasco-Sanchez, Luis F. Recalde, Guanrui Li 他
日本語で読む → - 論文状態推定ロボティクス
エッジを滑らかに:因子グラフ上のガウス過程運動事前分布による連続時間推定
因子グラフの枠組みでガウス過程による連続時間状態推定を簡潔に解説し、GTSAMでの実装例を提供する論文。
原題: Smoothing Out the Edges: Continuous-Time Estimation with Gaussian Process Motion Priors on Factor Graphs / Connor Holmes, Sven Lilge, Zi Cong Guo 他
日本語で読む → - 論文ナビゲーションロボティクス
NORM-Nav: 自然言語による行動制約を用いたゼロショット移動ロボットナビゲーション
LLMを用いて自然言語の行動指示をコストマップに変換し、幾何・意味・方向・速度の制約を統合することで、人間らしい軌道生成を実現するゼロショットナビゲーション手法を提案した。
原題: NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints / Dongjie Huo, Junhui Wang, Chao Gao 他
日本語で読む → - 論文ナビゲーションロボティクス
LiDARで教え、レーダーで繰り返す:劣化・変動環境における頑健なクロスモーダルナビゲーション
教示・反復ナビゲーションにおいて、教示時はLiDAR、実行時は4Dミリ波レーダーを用いることで、悪天候や環境変化に頑健なナビゲーションを実現するシステムを提案した。
原題: LiDAR Teach, Radar Repeat: Robust Cross-Modal Navigation in Degenerate and Varying Environments / Renxiang Xiao, Yichen Chen, Yuanfan Zhang 他
日本語で読む → - 論文形式検証/制御合成ロボティクス
演算子に基づく信号時相論理へのアプローチ
信号時相論理(STL)の複雑な式を扱うための新しい理論的枠組みとして、到達可能性値関数に作用する演算子を提案し、オンライン制御合成のツールを提供する。
原題: An Operator-based Approach to STL / Panagiotis Rousseas, Dimos V. Dimarogonas
日本語で読む → - 論文機構学ロボティクス
リンケージの非横断的分岐の識別
リンケージの特異点と可動性の局所解析において、運動の分岐を分離するための計算手法を提案した論文。
原題: Identification of Non-Transversal Bifurcations of Linkages / Andreas Mueller, P. C. López Custodio, J. S. Dai
日本語で読む → - 論文群集シミュレーションロボティクス
データ駆動アプローチによる群集移動における衝突回避行動のシミュレーション
群集シミュレーションの精度向上のため、衝突ペナルティを損失関数に組み込んだGANベースのモデルCPGANを提案し、双方向流での衝突率低減とレーン形成の再現を実現した。
原題: Simulation of collision avoidance behavior in crowd movement by data-driven approach / Xuanwen Liang, Eric Wai Ming Lee
日本語で読む → - 論文水陸両用ロボット/センサ統合ロボティクス
Polymander II:接触・流れセンサを備えたサンショウウオ型水陸両用ロボット
サンショウウオに着想を得た水陸両用ロボットに、ホール効果センサを用いて足の接触力と横方向の流体力を計測するシステムを実装し、高速な外部感覚情報の取得と防水性を実現した。
原題: Polymander II: an amphibious salamander-inspired robot with contact and flow sensors / Qiyuan Fu, Sudong Lee, Andrea Grillo 他
日本語で読む → - 論文自動運転/強化学習画像認識
MTA-RL: マルチモーダルトランスフォーマーによる3Dアフォーダンスと強化学習を用いた堅牢な都市運転
RGB画像とLiDAR点群をトランスフォーマーで融合し、幾何学的な3Dアフォーダンスを予測して強化学習の観測空間とすることで、解釈可能でサンプル効率の高い都市自動運転を実現した。CARLAシミュレーションでゼロショット汎化性能が向上することを示した。
原題: MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning / Guangli Chen, Dianzhao Li, Wenjian Zhong 他
日本語で読む → - 論文デジタルヒューマンモデリングHCI
OPENJ: CAD環境におけるオープンソースのデジタルヒューマンモデリングと人間工学的評価のための概念的枠組み
産業現場の人間工学的課題に対応するため、CAD環境で動作するオープンソースのデジタルヒューマンモデリング(DHM)ツールの概念的枠組みを提案する論文。商用DHMの高コスト・クローズドソース問題を解決することを目指す。
原題: OPENJ: A Conceptual Framework for Open-Source Digital Human Modeling and Ergonomic Assessment in a CAD Environment / Sinan Bank, Casey E. Eaton
日本語で読む → - 論文移動操作ロボティクス
CEER: 階層型ヒューマノイド移動操作のための統一インターフェースとしてのコンプライアントなエンドエフェクタ・ルート制御
ヒューマノイドの移動操作を階層的プランニングで実現するため、エンドエフェクタとルートのコンプライアント制御を統一インターフェースとして提案し、教師学生フレームワークで低レベルポリシーを学習。シミュレーションと実機で精度と安定性を実証した。
原題: CEER: Compliant End-Effector and Root Control as a Unified Interface for Hierarchical Humanoid Loco-Manipulation / Xinyuan Luo, Xingrui Chen, Xunjian Yin 他
日本語で読む → - 論文ワールドモデル/強化学習機械学習
PH-Dreamer: ポート・ハミルトン生成ダイナミクスによる物理駆動ワールドモデル
リカレント状態空間モデルにポート・ハミルトン構造を導入し、物理法則に従う潜在ダイナミクスを学習するワールドモデルを提案。エネルギー勾配を用いたActor-Criticで制御を最適化し、報酬予測精度とエネルギー効率を向上させた。
原題: PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics / Xueyu Luan, Chenwei Shi
日本語で読む → - 論文触覚/視覚-触覚統合ロボティクス
ロボットに触覚を感じさせる:身体化されたミラー共鳴のための視覚-触覚皮質アライメント
視覚と触覚の表現を多層的に整合させることで、RGB画像からロボットハンド上の触覚信号を予測し、人間の触れ合いに対する反射的な応答を可能にするフレームワークを提案した。
原題: Let Robots Feel Your Touch: Visuo-Tactile Cortical Alignment for Embodied Mirror Resonance / Tianfang Zhu, Ning An, Rui Wang 他
日本語で読む → - 論文生成ポリシー機械学習
ドリフト場ポリシー:ワッサースタイン勾配流による一段生成ポリシー
ドリフトモデルに基づく非ODEの一段生成ポリシーを提案し、逆KLワッサースタイン勾配流としてポリシー更新を定式化。ロボミミックやOGBenchの操作タスクで最先端性能を達成した。
原題: Drifting Field Policy: A One-Step Generative Policy via Wasserstein Gradient Flow / Juil Koo, Mingue Park, Jiwon Choi 他
日本語で読む → - 論文VLAロボティクス
予測に基づくサブゴール生成による長期タスク解決のためのAnticipation-VLA
長期にわたるロボットタスクを解決するため、タスクの進行に応じて適応的にサブゴールを生成する予測モデルを導入し、階層型VLAモデルを提案した。
原題: Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation / Zhilong Zhang, Wenyu Luo, Haonan Wang 他
日本語で読む →