論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/12 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3Dシーン生成画像認識
MUSE: 記憶に基づく段階的要件充足によるエージェント型3Dシーン作成
テキストから3Dシーンを生成・編集する際に、既存のシーンを保ちながら要件を段階的に満たすマルチエージェントフレームワークMUSEを提案し、要件レベルの制御と保存を評価するベンチマークも導入した。
原題: MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction / Ruijie Xu, Xinnan Zhu, Jiayu Ying 他
日本語で読む → - 論文説明可能性/音声cs.SD
音声モデルにおける説明の脆さ:予測を変えずに帰属を操作する
音声ディープフェイク検出モデルにおいて、聞こえない摂動を用いて説明ヒートマップを操作できることを示した論文。
原題: The Perceived Fragility of Explanations in Audio Models: Manipulation of Attribution with Unchanged Predictions / Piotr Kitłowski, Dominik Wiącek, Mateusz Modrzejewski
日本語で読む → - 論文運動計画ロボティクス
衝突回避運動計画のための半正定値緩和
球状障害物を避ける点ロボットの運動計画問題を半正定値緩和で解く手法を提案し、理論的解析と高速性を示した論文。
原題: Semidefinite Relaxations for Collision-Free Motion Planning / Bernhard Paus Graesdal, Alexandre Amice, Pablo A. Parrilo 他
日本語で読む → - 論文強化学習/計画AI
因果オブジェクト中心モデルによるモンテカルロ木探索計画
オブジェクト中心表現と因果注意を組み合わせたモデルベース強化学習アルゴリズムCOMETを提案し、複数のベンチマークで初期学習性能を向上させた。
原題: Causal Object-Centric Models for Planning with Monte Carlo Tree Search / Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik 他
日本語で読む → - 論文触覚機械学習
LESSでより多くを実現:触覚イメージングのための局所シーン表現
触覚イメージングのための物体中心の局所表現(LESS)を提案し、局所受容野を持つリカレントエンコーダのグリッドで触覚シーンをモデル化することで、汎化性能を高め、手持ちセンシングや3D再構成を可能にした。
原題: More with LESS -- Local Scene Representations for Tactile Imaging / Zohar Rimon, Elisei Shafer, Tal Tepper 他
日本語で読む → - 論文マニピュレーションロボティクス
ORCA: オープンソース巧緻性研究のためのプラットフォーム
ロボット操作研究のためのオープンソースの学習スタックを紹介し、低レベル制御、シミュレーション、遠隔操作、手のリターゲティングを統合し、既存のロボット学習フレームワークと連携することで、巧緻性研究を容易にする。
原題: ORCA: A Platform for Open-Source Dexterity Research / Francesco Capuano, Maximilian Eberlein, Fabrice Bourquin 他
日本語で読む → - 論文マニピュレーションロボティクス
視覚と触覚による推論時ポリシー誘導
接触を伴う操作タスクにおいて、視覚と触覚の両方を用いて生成ロボットポリシーの候補行動を検証・編集する推論時誘導フレームワークViTaLを提案し、実世界の3つのタスクで成功率を大幅に向上させた。
原題: Inference-time Policy Steering via Vision and Touch / Yilin Wu, Zilin Si, Zeynep Temel 他
日本語で読む → - 論文視覚エージェント/空間推論画像認識
知覚・対話・推論:空間推論のためのツール拡張型視覚エージェントの構築
視覚言語モデルの空間推論能力を高めるため、知覚・対話ツールを備えたエージェントPERIAを提案し、マルチツール行動の学習手法とともにその有効性を実証した。
原題: Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning / Changye Li, Meng Lu, Yi Wu 他
日本語で読む → - 論文ナビゲーションロボティクス
NavWAM: 目標条件付き視覚ナビゲーションのためのナビゲーションワールドアクションモデル
将来の視覚予測と行動生成を統合した拡散トランスフォーマーポリシーを提案し、シミュレーション事前学習と実機適応により、計画ベースのワールドモデルより高い性能を実現した。
原題: NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation / Daichi Azuma, Taiki Miyanishi, Koya Sakamoto 他
日本語で読む → - 論文VLAAI
WISE: Minecraftにおける長期的目標達成エージェントのためのWhy-Which推論
Minecraftのような環境での長期的タスクを達成するエージェント向けに、因果イベントグラフを用いた記憶と推論を統合したフレームワークWISEを提案し、従来手法より成功率と効率を向上させた。
原題: WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning / Renmin Cheng, Changhao Chen
日本語で読む → - 論文点群位置合わせ画像認識
コンピュータ支援手術における部分点群から全体点群への位置合わせのための点単位の幾何学的認識トランスフォーマー
部分点群と全体点群の位置合わせを高精度に行うため、局所幾何特徴と大域文脈を融合する粗密トランスフォーマーネットワークGAPR-Netを提案した。
原題: Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery / Siyu Zhou, Zhongliang Jiang
日本語で読む → - 論文マルチモーダル学習ロボティクス
欠損モダリティに頑健な注意機構ベースの予測モデル
マルチモーダルロボット学習において、訓練・推論時に一部のセンサデータが欠損しても動作する、注意機構とCVAEを組み合わせたモデルを提案し、人間の軌道予測とロボット操作予測の2タスクで有効性を示した。
原題: An Attention-based Model for Robust Forecasting with Missing Modality / Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova 他
日本語で読む → - 論文自動運転/世界モデル画像認識
自動運転のシーン予測のための拡散トランスフォーマーワールドアクションモデル
自動運転車の将来のカメラシーンを行動条件付きで予測するコンパクトな潜在ワールドモデルを提案し、拡散トランスフォーマーを用いて現実的な予測を実現した。
原題: Diffusion Transformer World-Action Model for AV Scene Prediction / Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew
日本語で読む → - 論文手術ロボティクス画像認識
GeoCFNet: ロボット支援内視鏡的粘膜下層剥離術のための幾何学認識信頼度フィールドネットワーク
内視鏡手術中の動的なシーンにおいて、煙やハイライト、組織変形などの課題に対処しつつ、解剖ガイドのための信頼度フィールドを幾何学的に推定するネットワークを提案した。
原題: GeoCFNet: Geometry-Aware Confidence Field Network for Robot-Assisted Endoscopic Submucosal Dissection / Rui Tang, Guankun Wang, Long Bai 他
日本語で読む → - 論文マルチモーダル生成画像認識
InterleaveThinker: エージェント型インターリーブ生成の強化
既存の画像生成器にテキストと画像の交互生成能力を付与するマルチエージェントパイプラインを提案し、プランナーと批評エージェントを用いて段階的な指示修正を強化学習で強化する。
原題: InterleaveThinker: Reinforcing Agentic Interleaved Generation / Dian Zheng, Harry Lee, Manyuan Zhang 他
日本語で読む → - 論文VLA/コード生成cs.PL
機能キャッシュ移植による身体化エージェント向けロバストかつ高速なコードポリシー合成
コード生成LLMの遅延と不安定性を解決するため、検証済み関数コードとKVキャッシュを再利用してポリシーを合成するFCGraftを提案。タスク成功率と生成速度を大幅に向上させた。
原題: Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents / Saehun Chun, Wonje Choi, Sera Choi 他
日本語で読む → - 論文強化学習/組み込みシステム制御
TetraRL: オンデバイス深層強化学習システムのための自己適応型ランタイム
本論文は、リソース制約のある組み込みデバイス上でDRLを実行する際に、リアルタイム性、報酬、メモリ、エネルギーという4つの目的を動的にバランスする自己適応型ランタイムフレームワークTetraRLを提案する。
原題: TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems / Zexin Li, Soheil Shirvani, Cong Liu
日本語で読む → - 論文グラフ最適化cs.PF
Δ探索を用いた部分グラフ抽出問題の解法
NP困難な部分グラフ抽出問題を解くための汎用ヒューリスティックフレームワークΔ探索を提案し、様々なグラフ問題で既存手法と同等以上の性能を示した。
原題: Solving Subgraph Extraction Problems Using $Δ$Search / Rebin Silva Valan Arasu, Rajiv Gupta
日本語で読む → - 論文VLA画像認識
MaskWAM: マスクプロンプトと予測を統合したワールドアクションモデル
ロボット制御のためのワールドアクションモデルに、マスクを入力と予測の両方に統合する手法を提案し、言語の曖昧さを低減して汎化性能を向上させた。
原題: MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models / Hanyang Yu, Haitao Lin, Jingbo Zhang 他
日本語で読む → - 論文ハンド/バイオミメティクスロボティクス
MCR-Bionic Hand: 巧緻操作のための解剖学的構造事前知識
ヒトの手の巧緻性は骨格や腱などの構造に一部コード化されているという考えに基づき、手首から指へのテノデーシスや伸筋フードなどの構造的知能を組み込んだ1:1筋骨格バイオミメティックハンドを開発し、硬貨回しやペン移動などの接触を伴うタスクでその有効性を示した。
原題: MCR-Bionic Hand: Anatomical Structural Priors for Dexterous Manipulation / Haosen Yang, Guowu Wei
日本語で読む → - 論文ビデオ生成/推論画像認識
テスト時生成ビデオ推論のための時間的バックトラッキング探索
ビデオ生成モデルの推論を改善するため、時間軸上で生成・検証・再開を繰り返すTBS法を提案し、単発生成やBoNサンプリングより高い成功率を達成した。
原題: Temporal Backtracking Search for Test-time Generative Video Reasoning / Sejoon Jun, Zheng Ding, Huangyuan Su 他
日本語で読む → - 論文マニピュレーションロボティクス
境界ボックスを目標に:ニューロシンボリック計画による言語条件付き把持
事前学習済みVLMと境界ボックス検出を用いて、自然言語の指示を物理世界の目標状態に変換し、追加学習なしでテーブルトップ操作を実行するフレームワークGRASPを提案した。
原題: Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning / Allison Andreyev, Landon Eum, Nestor Tiglao 他
日本語で読む → - 論文世界モデル機械学習
EPM-JEPA:JEPA系世界モデルにおけるオペレータ側経験変調
JEPA系世界モデルで、テスト時の分布シフトに対応するため、経験表現を予測器の重みにLoRAで注入する方式(EPM-JEPA)を提案し、既存の隠れ状態への注入方式(EI-JEPA)と比較。結果は統計的に差がないという帰無結果だったが、重み変調の有効性を示唆する観察も得た。
原題: EPM-JEPA: Operator-Side Experience Modulation in JEPA-Family World Models / Vedant Pandya
日本語で読む → - 論文マニピュレーションロボティクス
PhysVLA: 物理に基づく身体化ロボット操作のためのVLA
既存のVLAモデルは物理法則を無視するため、推論時に物理的整合性を補正するプラグアンドプレイのフレームワークPhysVLAを提案し、成功率と安定性を向上させた。
原題: PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation / Namai Chandra, Shriram Damodaran, Lin Wang
日本語で読む → - 論文世界モデルロボティクス
μ0: スケーラブルな3Dインタラクショントレース世界モデル
ロボット学習のための、物体や手などの相互作用点の3D軌跡を予測する世界モデルを提案。多様なビデオから自動で3D教師信号を抽出し、行動ラベルなしで事前学習可能。
原題: $μ_0$: A Scalable 3D Interaction-Trace World Model / Seungjae Lee, Yoonkyo Jung, Jusuk Lee 他
日本語で読む → - 論文VLA自然言語
LabVLA: 科学実験室における視覚言語行動モデルの基盤構築
科学実験室向けのVLAモデルを開発し、シミュレーションデータ生成と2段階学習で実験プロトコルの実行を可能にした。
原題: LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories / Baochang Ren, Xinjie Liu, Xi Chen 他
日本語で読む → - 論文強化学習/拡散ポリシー機械学習
QPILOTS: フローポリシーのための効率的なテスト時Qステアリング
フローマッチングや拡散ポリシーを強化学習で最適化する際、推論時にノイズ除去プロセスをQ値の勾配で操縦する手法QPILOTSを提案し、オフラインからオンラインへのRLベンチマークで高い成功率を達成した。
原題: QPILOTS: Efficient Test-Time Q-Steering for Flow Policies / Yifan Ruan, Chenyang Cao, Andreas Burger 他
日本語で読む → - 論文LLMエージェント機械学習
ProPlay: 自己進化型LLMエージェントのための手続き的世界モデル
LLMエージェントが環境の手続き的知識をグラフ構造で学習し、事前シミュレーションとフィードバックによる自己進化を実現する手法を提案した。
原題: ProPlay: Procedural World Models for Self-Evolving LLM Agents / Yijun Ma, Zehong Wang, Yiyang Li 他
日本語で読む → - 論文データアノテーションロボティクス
SPARC: ロボットデモからの信頼性校正付き空間アノテーションの大規模生成
ロボットのデモンストレーションから、信頼度スコア付きの構造化空間アノテーション(バウンディングボックスや物体軌跡など)を自動生成するリスク認識フレームワークを提案し、ノイズの多いラベルを減らしつつ有用なサンプルを保持する。
原題: SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale / Nils Blank, Paul Mattes, Maximilian Xiling Li 他
日本語で読む → - 論文世界モデルロボティクス
FlowMo-WM: 物体の運動量と隠れた環境ドリフトを備えた世界モデル
ロボット学習のための世界モデルで、慣性や水流などの隠れた環境ドリフトを考慮し、画像と行動の履歴から物体中心の運動状態と環境コンテキストを分離して予測する手法を提案した。
原題: FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift / Yitao Jiang, Luyang Zhao, Muhao Chen 他
日本語で読む →