論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/18 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文触覚画像認識
GelSight Miniセンサ間での力マップ推定のゼロショット転移
異なるGelSight Miniセンサ個体間で3D力マップ推定を一般化する手法を提案。入力触覚画像をUniTベースモデルで共通表現に再構成し、U-Netで力マップを推定する。
原題: Zero-Shot Transfer of Force Map Estimation Across GelSight Mini Sensors / Julio Castaño Amoros, Pablo Gil
日本語で読む → - 論文世界モデルロボティクス
Hydra-0: 汎用世界モデリングと制御のためのアクションフロー
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
原題: Hydra-0: Action Flow for Generalist World Modeling and Control / Hongyu Li, Bowen Wen, Xinghao Zhu 他
日本語で読む → - 論文VQA/3Dシーン理解画像認識
メモリツリー誘導キーフレーム問い合わせによる効率的な3D質問応答
3D環境での質問応答を効率化するため、メモリツリー構造でシーンを表現し、質問に関連するキーフレームを高速に選択する手法を提案。
原題: Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering / Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao 他
日本語で読む → - 論文データセットロボティクス
PRISM:マルチモーダルセンシングを備えた精密で接触豊富な実世界産業スキルデータセット
産業組立に必要な精密制御や力/トルク、触覚などのマルチモーダルフィードバックを含む、25以上の操作タスクと45時間の遠隔操作デモを収録した大規模データセットを公開した論文。
原題: PRISM: Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing / Tengbo Yu, Jiahao Wu, Hanning Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
CompCPZ: 言語誘導ロボット操作におけるマルチモーダル意図の保存
ロボット操作において、指示の曖昧さ(例:「赤い皿か青い皿の近くにカップを置いて」)を単一の目標点に潰さず、多様な解空間を多面体で表現する手法を提案。
原題: CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation / Zhen Zhang, Ahmad Hafez, Peng Xie 他
日本語で読む → - 論文マニピュレーションロボティクス
局所ガウス過程回帰を用いたキー付きペグ・イン・ホール組立の力ベースオフセット推定
キー付きペグ・イン・ホール組立において、手首の力/トルク測定から残りの位置ずれを推定する手法を提案。接触状態を分類し、局所KNN-GPハイブリッド回帰でオフセットを推定し、挿入成功率を67%から87%に向上させた。
原題: Force-Based Offset Estimation for Keyed Peg-in-Hole Assembly Using Local Gaussian Process Regression / Chandra Yuvesh Aubeeluck, Abilash Philip Madavath, Augustin Raju 他
日本語で読む → - 論文群制御ロボティクス
ガウス信念伝播による巡回ロボット群の環境信号の集合的ランキング
巡回ロボット群が環境の各地点の信号強度を測定し、ガウス信念伝播を用いて全地点のランキングを集団で推定する手法を提案・検証した。
原題: Collective Ranking of Environmental Signals through Gaussian Belief Propagation in a Patrolling Robot Swarm / Zachary R. Madin, Connor York, Jonathan Lawry 他
日本語で読む → - 論文手術映像理解画像認識
器具の動きを超えて:組織張力の認識による手術スキル評価
腹腔鏡手術の映像から組織の張力を認識する新しいタスクを提案し、専門家が注釈したデータセットと軽量な軌跡ベースの認識手法を開発した。
原題: Beyond Instrument Motion: Recognizing Tissue Tension Toward Surgical Skill Assessment / Marko Haralovi, Zhiqi Miao, Alexander Machiel Bont 他
日本語で読む → - 論文シーングラフロボティクス
OVIP-SG: 小さな細粒度オブジェクトのマッピングと検索のためのオープンボキャブラリ・インスタンス保存シーングラフ
オープンボキャブラリ知覚を3Dシーングラフに統合する際のインスタンス断片化問題を解決し、小さなオブジェクトの保存と機能的なシーン分割、言語ガイドによる検索を実現する統一フレームワークを提案した。
原題: OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects / Tianjing Hao, Haiyu Lan, Angsong Li 他
日本語で読む → - 論文ワールドモデル機械学習
ガウス分布は不要:JEPAワールドモデルのための対照逆動学
JEPAワールドモデルの表現崩壊を防ぐ新しい正則化手法を提案。逆動学ヘッドを訓練時のみ追加し、行動識別タスクで崩壊を防ぐ。複雑なタスクで従来法を大きく上回る性能を達成。
原題: No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models / Jack Boylan, Chris Hokamp
日本語で読む → - 論文空中マニピュレーションロボティクス
傾斜マルチロータのエフェクタ中心NMPCによるオフセットフリー全方位空中マニピュレーション
傾斜可能な4ロータ構成の設計解析と、外乱補償を統合したエフェクタ中心の非線形モデル予測制御(NMPC)を提案し、実機で90度回転やバルブ操作などの空中作業を実証した。
原題: Effector-Centric NMPC of Tiltable-Multirotors for Offset-Free Omnidirectional Aerial Manipulation / Jinjie Li, Yicheng Chen, Johannes Kübel 他
日本語で読む → - 論文マニピュレーションロボティクス
反復的把握ポーズ洗練:2Dビジョンのための深層強化学習アプローチ
強化学習を用いて、幾何学的手法で失敗した把握候補を反復的に改善し、把握成功率を向上させる枠組みを提案した。シミュレーションと実機で効果を検証した。
原題: Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision / Amir Arsalan Nematollahi, Shayan Ahmadi, Mehdi Tale Masouleh 他
日本語で読む → - 論文VLA/ベンチマーク/安全性ロボティクス
LIBERO-VIFO: 視覚言語行動モデルにおける視覚的手がかり追従の能力と安全性のベンチマーク
VLAモデルが視覚的手がかりを正しく追従できるか、また許可されていない手がかりを無視できるかを評価するベンチマークLIBERO-VIFOを提案し、7つのVLAモデルの評価を通じて、言語指示なしでも視覚的手がかりに従ってタスクを実行するリスクを明らかにした。
原題: LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models / Zhengyan Qian, Rui Yan, Alex Jinpeng Wang 他
日本語で読む → - 論文群制御制御
LSTMを用いた意味的符号化によるDMPCの通信削減
分散モデル予測制御(DMPC)における通信量を削減するため、LSTMベースのエンコーダ・デコーダネットワークを用いてメッセージを圧縮・再構成する手法を提案し、移動ロボット群の実験で有効性を示した。
原題: Communication Reduction via Semantic-Based Encoding in DMPC Using LSTMs / Torben Schiz, Pedro H. J. Nardelli, Henrik Ebel
日本語で読む → - 論文ヒューマノイド/サービスロボットロボティクス
HODAgent:物理世界での人間との対話のためのオンデマンド・応答型ヒューマノイド
サービス現場のヒューマノイドロボット向けに、状況に応じた意図理解、応答実行、タスク修正、結果検証を統合したSystem-2エージェントを提案し、シミュレーションと実機で有効性を実証した。
原題: HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction / Wang Warren Chen, Jiahao Zhang, Zhenjiang Li 他
日本語で読む → - 論文3Dシーン理解画像認識
GroupForward: インスタンスグループ化フィードフォワードガウシアンスプラッティングによる参照可能な3Dシーン構築
疎な多視点画像から3Dシーンの幾何・外観・インスタンス構造・意味を同時に再構成するフィードフォワード型の3Dガウシアンスプラッティングモデルを提案し、インスタンスグループ化により参照表現による複雑なシーン推論を可能にした。
原題: GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting / Qijian Tian, Zimeng Wu, Xuhong Wang 他
日本語で読む → - 論文遊泳ロボット/最適制御physics.flu-dyn
パーセルのマイクロスイマーモデルに基づく遊泳ロボットの最適制御
パーセルの3リンク遊泳モデルを実スケールのロボットで実現し、ポントリャーギンの最大原理を用いて変位とエネルギー効率を最大化する最適な遊泳パターンを求めた。
原題: Optimal control of a swimming robot based on Purcell's microswimmer model / Noam Berkovich Lahav, Oren Wiezel, Yizhar Or
日本語で読む → - 論文ナビゲーションロボティクス
具現化ナビゲーター:指差し・思考・記憶・整合による効率的ナビゲーション
大規模視覚言語モデルを具現化ナビゲーションに活用する際の課題を解決するため、2Dピクセル選択と3D投影による行動形式、選択的推論と記憶圧縮、GRPOによる二段階整合を備えた統一フレームワークTAMP-Navを提案した。
原題: Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation / Hongyan Feng, Sunlai Chen, Xuanyu Liu 他
日本語で読む → - 論文VLA/ヒューマノイドロボティクス
EATR-Stereo: 身体性を考慮したステレオ証拠のルーティングによるヒューマノイド視覚言語行動制御
頭部搭載ステレオカメラを持つヒューマノイドのVLA制御において、主視点のトークンを保持しつつ補助視点の情報を身体状態に応じて選択的に統合するフレームワークを提案し、実機で高い成功率を達成した。
原題: EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control / Songwei Wu, Rui Zhao, Fan Yang 他
日本語で読む → - 論文力制御ロボティクス
UniReflex: 高速・低速反射による事前学習生成ポリシーのためのプラグアンドプレイ力制御
事前学習済みの生成ポリシーに追加学習なしで力制御を組み込むプラグアンドプレイフレームワークを提案。潜在表現から高速反射ネットワークが可変インピーダンス制御を駆動し、接触安定性を向上させる。
原題: UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex / Yan Huang, Shoujie Li, Ziwu Song 他
日本語で読む → - 論文VLAロボティクス
Prism-GRPO: 同一結果グループの分割による高速なVLAポリシー最適化
GRPOの強化学習において、成功/失敗が同一のグループを品質スコアで分割し、学習信号を回復することでロールアウト効率を向上させる手法を提案した。
原題: Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups / Zeyun Deng, Yuzhe Lu, Yawei Wang 他
日本語で読む → - 論文SLAMロボティクス
Scalix: 不確実性を考慮したスケール一貫性のある単眼SLAM
単眼SLAMのスケール曖昧性を解決するため、学習された深度情報を確率的因子グラフに統合し、ピクセル単位とフレーム単位の不確実性を考慮してメートルスケールの状態推定を実現するフレームワークを提案した。
原題: Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM / Sebastian Barbas Laina, Tianyi Zhang, Panagiotis Petropoulakis 他
日本語で読む → - 論文安全性評価/操作ロボティクス
MANIGUARD: 仕様に基づく安全性評価とロボット操作改善のためのベンチマークとデータセット
ロボット操作の基盤モデルの安全性を評価・改善するための、仕様に基づくフレームワークとベンチマーク、データセットを提案した論文。
原題: MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation / Yiyan Peng, Philip Wang, Simon Sinong Zhan 他
日本語で読む → - 論文強化学習機械学習
反復による強化:強化学習における即時エピソード反復によるサンプル効率の向上
成功したエピソードの行動系列を即座に繰り返す新しいメカニズム「Instant Episode Repetition (IER)」を提案し、SACやTD3に統合してサンプル効率を向上させた。
原題: Repetition as Reinforcement: Enhancing Sample Efficiency via Instant Episode Repetition in Reinforcement Learning / Hoda Yamani, Yuning Xing, Koen van Rijnsoever 他
日本語で読む → - 論文モジュラーロボット/再構成計画ロボティクス
変形可能な平面モジュラーロボットのための再構成完全な動作プリミティブと構成的計画
変形可能なモジュラーロボットの再構成計画を、正方形セル抽象化と2つの基本動作(ピボットとシア)を用いて解析し、任意の非直線エッジ接続構成を固定の標準階段形状に変換可能であることを証明し、構成的な計画手法を提案した。
原題: Reconfiguration-Complete Motion Primitives with Constructive Planning for Deformable Planar Modular Robots / Jie Gu, Tingting Wang, Hongrun Gao 他
日本語で読む → - 論文マニピュレーションロボティクス
ORPA: 人間のフィードバックを用いたロボット操作制御のためのオンライン残差ポリシー適応
模倣学習で訓練された操作ポリシーの実行時エラーを、基盤ポリシーを変更せずに軽量なフィードバック条件付きモジュールで残差補正するフレームワークを提案し、ALOHAプラットフォームでの精密操作タスクで成功率向上を実証した。
原題: ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback / Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai 他
日本語で読む → - 論文VLA画像認識
もし、ならば、そうでなければ:視覚言語ナビゲーションにおける条件分岐の診断
視覚言語ナビゲーションエージェントの条件分岐能力を診断するためのベンチマークCondVLNを導入し、分岐条件をシーングラフに基づいて生成し、エージェントの失敗原因を分析した。
原題: If, Then, Otherwise: Diagnosing Conditional Branching in Vision-Language Navigation / Seoyoung Lee, Neel P. Bhatt, Pranay Samineni 他
日本語で読む → - 論文VLA/テスト時拡張ロボティクス
検索前に再利用せよ:具現化マルチモーダルポリシーのテスト時拡張における余裕と相補性の診断
凍結された視覚-言語-行動(VLA)ポリシーをテスト時に改善する際、追加サンプリングと外部デモ検索のどちらが有効かを、回復可能な余裕と検索相補性という2つの指標で診断し、選択器が性能を向上させることを示した。
原題: Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies / Yuhwan Jeong, Kuk-Jin Yoon
日本語で読む → - 論文群制御ロボティクス
tinyDSM: 資源制約のあるミリロボットのためのスキルモデリングと開発フレームワーク
cmサイズのミリロボットが自律的に探索・学習・適応するための発達メカニズムを提案し、内発的動機付けと適合度評価を統合したtinyDSMフレームワークを実装した。最小限の事前知識から階層的知識グラフと運動学的推論を用いてスキルを発達させる。
原題: tinyDSM: A Framework for Skill Modeling and Development for Resource-Constrained Millirobots / Markus D. Kobelrausch, Michael Miedler, Axel Jantsch
日本語で読む → - 論文言語モデル/評価指標自然言語
低リソース言語での思考:SFTが構築するもの、RLが修正するもの、精度では見えないもの
低リソース言語での推論に特化してモデルを微調整し、精度指標では変化が見えない一方で、思考言語の切り替えや形式遵守などの行動的変化を新たな評価軸で測定・改善した研究。
原題: Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See / Ayoub Kirouane, Christos Petrocheilos
日本語で読む →