論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/7 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マニピュレーションロボティクス
GraspFoM: 3D基盤モデルを用いた再構成駆動型ロボット把持
3D基盤モデル(SAM3D)を活用し、物体の再構成と把持姿勢予測を共有の3D潜在表現で統合するフレームワークを提案。再構成による幾何情報と把持学習の相互作用で、部分観測下でも高精度な把持と高忠実度な3D再構成を実現した。
原題: GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors / Dongli Wu, Xiaobao Wei, Hao Wang 他
日本語で読む → - 論文VLA/操作ロボティクス
GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
原題: GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation / Yuan Zhang, Shiqi Zhang, Yedong Shen 他
日本語で読む → - 論文触覚/操作ロボティクス
RGB-S: 画像整合型触覚サリエンシによる堅牢な器用操作
視覚が遮蔽された状況でも、触覚センサ位置を画像平面に投影し、力変調ガウス分布で空間的不確実性をモデル化して視覚特徴に統合することで、器用操作の成功率を大幅に向上させる手法を提案した。
原題: RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation / Shengcheng Luo, Kefei Wu, Xiaoying Zhou 他
日本語で読む → - 論文シーングラフ/物理推論ロボティクス
PhysGraph: 物理を考慮した3Dシーングラフによる知覚と推論
RGB-D観測から物体の3D形状と物理特性(質量・関節構造など)を推定し、物理的に一貫したシーングラフを構築するフレームワークを提案。下流タスクとしてアフォーダンス予測や実-to-シミュレーション転送を実証した。
原題: PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning / Haoyu Li, Aaron Thomas, Shuyan Zhou 他
日本語で読む → - 論文マニピュレーションロボティクス
PACT: 拡散ポリシーの身体的操作における自己進化型物理安全性アライメント
事前学習済みの拡散ポリシーを、デモデータや報酬なしで制約適合領域に投影する自己進化型の後処理フレームワークを提案し、安全性違反を平均31.0%削減しつつタスク成功率を30.7%向上させた。
原題: PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation / Lingxuan Wu, Zijian Zhu, Lizhong Wang 他
日本語で読む → - 論文操作/ロボット学習ロボティクス
ビデオが誤読するとき:探索的操作トレースQAのための読み取りヒューリスティックの閉ループ蒸留
探索的操作の失敗トレースから最小成功アクション連鎖を予測するEMT-QAタスクを提案し、トレースから読み取りヒューリスティックを蒸留してVLMの精度を大幅に向上させる手法を導入した。
原題: When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA / Haizhou Ge, Yufei Jia, Yue Li 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
SO-101における視覚言語行動モデルのベンチマーク:失敗と回復の分析
低コストロボットSO-101上でVLAモデルと模倣学習を標準化ベンチマークで評価し、失敗分類と回復能力を分析した論文。
原題: Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis / Yi Yu, Xinchuan Qiu
日本語で読む → - 論文強化学習/空中マニピュレーション機械学習
文脈的対比メタ強化学習による自律空中マニピュレーション
クワッドローターが多様なペイロードを自律的に把持・輸送・配送するための、文脈エンコーダと対比学習を組み合わせたメタ強化学習手法を提案。シミュレーションのみで訓練し、実機へ直接展開可能。
原題: Autonomous Aerial Manipulation via Contextual Contrastive Meta Reinforcement Learning / Lixuan Jin, Bingxuan Lan, Xinyi Bao 他
日本語で読む → - 論文音声セキュリティcs.SD
勾配反転と変分情報ボトルネックによる話者不変のなりすまし検出の表現学習
話者バイアスによる汎化性能低下を解決するため、話者ラベルなしで話者不変ななりすまし検出を行う教師-学生フレームワークを提案した。
原題: Speaker-Invariant Representation Learning for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck / Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier 他
日本語で読む → - 論文世界モデル解釈機械学習
一つのレンズ、多様な世界:世界モデルの解釈可能性のための能力型インターフェース
異なるアーキテクチャの世界モデルを統一的に解釈するための、能力型アダプタを備えたオープンソース基盤WorldModelLensを提案する論文。
原題: One Lens, Many Worlds : A Capability-Typed Interface for World-Model Interpretability / Bhavith Chandra Challagundla, Sanskar Pandey, Param Thakkar 他
日本語で読む → - 論文VLA画像認識
FiberTune: 視覚言語行動モデルの微調整における行動ファイバー視覚残差の保持
VLAポリシーの行動教師あり微調整で生じる視覚表現の崩壊を防ぐため、行動予測方向を除いた視覚残差を教師モデルに整合させる訓練手法FiberTuneを提案し、シミュレーションと実機で性能向上を確認した。
原題: FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning / Haihao Lin, Xiangsheng Huang, Xiao Yang 他
日本語で読む → - 論文強化学習機械学習
密度輸送によるフローマッチングポリシーの強化学習
フローマッチングポリシーを強化学習で微調整する新しいアルゴリズムRLDTを提案。最大エントロピーRL目的とSVGDを用いて輸送場を構築し、期待ターゲット推定で安定学習を実現。
原題: Reinforcement Learning for Flow-Matching Policies with Density Transport / Boshu Lei, Kostas Daniilidis, Antonio Loquercio
日本語で読む → - 論文VLA画像認識
実世界のストリーミング動画の活用
オフライン動画理解に優れる既存のVLMを、ストリーミング動画の対話・理解に適応させるためのデータセット、訓練手法、デプロイシステム、評価ベンチマークを提案した論文。
原題: Harnessing Streaming Video in the Wild / Dingyu Yao, Shuhuan Gu, Qingyi Si 他
日本語で読む → - 論文水中ロボット/強化学習ロボティクス
強化学習を用いた自律型水中ロボットのエンドツーエンドの動作計画と実行に向けて
本論文は、生のセンサーデータからスラスター指令へのエンドツーエンドの深層強化学習アプローチを提案し、高レベル方策と低レベル方策を階層的に組み合わせて水中ロボットの障害物回避と目標到達を実現する。
原題: Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning / Elisei Shafer, Oren Gal
日本語で読む → - 論文ヒューマノイド制御ロボティクス
EgoPriMo: 対話型ヒューマノイド制御のための自己中心視点動作生成
自己中心視点の人間デモから全身動作の事前分布を学習し、テキスト指示に基づいて動作の再構築・生成・予測を行う統一フレームワークを提案した。
原題: EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control / Haoyang Ge, Peng Ren, Yukun Shi 他
日本語で読む → - 論文遠隔操作ロボティクス
微分可能な制約ベース軌道計画によるリアルタイムで正確な衝突回避遠隔操作
遠隔操作において、ロボットと環境をカプセルと多面体で近似し、微分可能な衝突回避制約を用いた軌道計画を提案。シミュレーションと実機で計算時間の短縮と正確な障害物モデリングを実証した。
原題: Real-Time and Accurate Collision-Free Teleoperation via Differentiable Constraint-Based Trajectory Planning / Max Grobbel, Tristan Schneider, Daniel Flögel 他
日本語で読む → - 論文歩行ロボティクス
歩みに注意:正確な人型ロボットの足場追跡のための汎用学習フレームワーク
人型ロボットの足場配置を明示的に追跡する汎用の強化学習フレームワークを提案し、実世界のノイズに頑健な目標表現とゴールサンプラーにより、様々な高レベルプランナーと組み合わせ可能な低レベルコントローラを実現した。
原題: Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking / Alessandro Montenegro, Shihao Li, Puze Liu 他
日本語で読む → - 論文ロボット操作画像認識
Light-WAM: 状態融合アクション復号による効率的なワールドアクションモデル
ロボット操作のための軽量なワールドアクションモデルを提案し、将来予測の学習コストを削減しつつ、高速なアクション予測を実現した。
原題: Light-WAM: Efficient World Action Models with State-Fusion Action Decoding / Ziang Li, Dongzhou Cheng, Yibin Wang 他
日本語で読む → - 論文スキル接地/コード生成AI
スモール言語モデルによるコードリファクタリングを用いた効率的なスキル接地
スモール言語モデルを用いて、スキルの意味論と実行環境への結合を分離し、局所的なリファクタリングのみでスキルを接地するフレームワークRECENTを提案。LLM並みの性能をsLMで達成した。
原題: Efficient Skill Grounding via Code Refactoring with Small Language Models / Sera Choi, Wonje Choi, Saehun Chun 他
日本語で読む → - 論文知覚/操作ロボティクス
ロボット操作における関節部品知覚の再考
関節部品の幾何学的構造を抽象化した「GPS」表現を提案し、VRデバイスで1分間の注釈で高品質なデータを収集、単一RGB-D画像から汎用的なGPSモデルを学習して操作に応用した。
原題: Revisiting Articulated Parts Perception in Robot Manipulation / Xiaoqian Wu, Yejie Guo, Xiaoyang Chen 他
日本語で読む → - 論文VLAロボティクス
Ego-Pi: 自己中心視点の人間・ロボットデータによるVLAファインチューニング
ロボット操作のデータ不足を解決するため、自己中心視点の人間データを活用してVLAモデルをファインチューニングし、ロボットが新しいタスクの意味を学習し、既存スキルを組み合わせて新行動を生み出せることを示した論文。
原題: Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data / Ji Woong Kim, Ke Wang, Zipeng Fu 他
日本語で読む → - 論文操作理解画像認識
劣化環境下でのロバストな操作理解のための信頼性のある視覚述語
ぼけや遮蔽などの視覚劣化下で、操作理解に用いる視覚述語(接触、把持など)の信頼性を評価する枠組みを提案し、劣化が述語の失敗に構造的な影響を与えることを示した。
原題: Trustworthy Visual Predicates for Robust Manipulation Understanding under Degradation / Fatemeh Ziaeetabar
日本語で読む → - 論文水中画像/インスタンス分割画像認識
水中境界顕著性注意モジュールを用いた軽量水中顕著インスタンス分割検出トランスフォーマー
水中画像の顕著なインスタンスを軽量に分割・検出するためのトランスフォーマーモデルを提案し、境界やコントラストなどの水中特有の手がかりを注意機構に組み込むことで、高速かつ高精度な推論を実現した。
原題: Aqua Boundary-Saliency Attention Module for Lightweight Underwater Salient Instance Segmentation Detection Transformer / M. Fazri Nizar, Julian Supardi, Muhammad Naufal Rachmatullah
日本語で読む → - 論文記憶/不確実性定量化画像認識
自信を持って記憶する:確率的保証を伴う時空間記憶の不確実性定量化
VLMによる説明文のノイズや視点依存性を考慮し、物体ごとの意味的不確実性を定量化して、不確実な物体を能動的に改善する時空間記憶システムUQ-DAAAMを提案した。
原題: Remember with Confidence: Uncertainty Quantification for Spatio-temporal Memory with Probabilistic Guarantees / Harry Zhang, Nicolas Gorlo, Luca Carlone
日本語で読む → - 論文模倣学習/言語指示ロボティクス
CLASP: 言語駆動型ロボットスキル選択とタスクパラメータ学習による合成
自然言語コマンドからロボットのスキルを選択・合成するモジュール型アーキテクチャを提案。少数のデモから学習したスキルをVLMで解釈し、データ効率と直感的な指示を両立する。
原題: CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning / Markus Knauer, Valentin Gieraths, Tai Mai 他
日本語で読む → - 論文画像編集/VLM画像認識
IEA: アマチュア向け対話型画像編集エージェント - 3段階のマルチタスクアライメントによる実現
パラメータ化された編集ツールを明示的かつ解釈可能なアクション空間で操作する対話型画像編集エージェントIEAを提案し、3段階のマルチタスク学習で訓練する。
原題: IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment / Zichen Zhu, Yuheng Sun, Mingxuan Zhu 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
vla.cpp: 視覚言語行動モデルのための統合推論ランタイム
ロボット上で動作する軽量なC++推論ランタイムを提案し、複数のVLAモデルを単一のランタイムで効率的に実行可能にした。
原題: vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models / Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen 他
日本語で読む → - 論文VLA/メタ学習ロボティクス
重み空間メタ学習によるロボットポリシー適応
VLAモデルを新しいタスクに適応させる際、タスク固有のデモや微調整を不要にするため、言語指示と短いデモ動画からLoRAパラメータを直接生成するメタ学習フレームワークWIZARDを提案した。
原題: Robotic Policy Adaptation via Weight-Space Meta-Learning / Christian Bianchi, Siamak Yousefi, Alessio Sampieri 他
日本語で読む → - 論文ビデオ改ざん検出画像認識
真正なビデオストリームにおける時間的に局所的な改ざんの検出
短い改ざん区間が挿入された真正なビデオを検出するためのデータセットを提案し、DINOv3特徴量を用いた2つの手法で初期ベンチマークを確立した。
原題: Detecting Temporally Localized Manipulations in Authentic Video Streams / Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu
日本語で読む → - 論文強化学習機械学習
GenPO++: ヤコビアンフリー尤度比を用いた生成的方策最適化
フローベースの生成的方策を強化学習に適用する際、実行アクションの確率評価が難しい問題を、高次可逆ODEソルバーと履歴状態を利用して正確かつヤコビアンフリーな尤度比計算を実現する枠組みを提案した。大規模シミュレーションや実ロボット操作タスクで優れた性能を示した。
原題: GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios / Ke Hu, Shutong Ding, Panxin Tao 他
日本語で読む →