論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ワールドモデル機械学習
ループ型ワールドモデル
パラメータ共有のトランスフォーマーブロックを反復適用して潜在状態を精緻化する、初のループ型ワールドモデルを提案。従来比100倍のパラメータ効率と適応的計算量を実現し、反復的な潜在深度を新たなスケーリング軸として確立した。
原題: Looped World Models / Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang 他
日本語で読む → - 論文VLAロボティクス
フローベースの視覚言語行動モデルにおける不確実性の定量化
フローマッチングを用いた視覚言語行動モデル(VLA)に対して、速度場の不一致に基づく効率的な不確実性推定手法を提案し、失敗検出と能動的ファインチューニングに応用した。
原題: Uncertainty Quantification for Flow-Based Vision-Language-Action Models / Ralf Römer, Maximilian Seeliger, Saida Liu 他
日本語で読む → - 論文VLA/操作画像認識
WeaveLA: 反復ロボット操作のためのイベント駆動型サブタスク間潜在記憶の織り込み
VLAポリシーに、サブタスク完了イベントで圧縮した潜在記憶を次のサブタスクの行動生成に渡す軽量なクロスサブタスク記憶チャネルを追加し、反復操作の成功率を向上させた。
原題: WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation / Shoujing Zhu, Zhenyang Liu, Fungmiu Wang 他
日本語で読む → - 論文身体化AI/ベンチマークロボティクス
ERQA-Plus:身体化AIにおける推論の診断ベンチマーク
身体化AIエージェントの推論能力を診断するためのベンチマークERQA-Plusを提案し、空間・手続き・社会的推論などのカテゴリ別にモデルの弱点を明らかにした。
原題: ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI / Hong Yang, Basura Fernando
日本語で読む → - 論文データセット画像認識
EgoCS-400K: 世界モデルのための自己中心型ゲームプレイデータセット
プロのCounter-Strikeのデモから、行動・状態・イベントと時間的に整合した自己中心型の大規模データセットを構築し、世界モデルの学習を支援する。
原題: EgoCS-400K: An Egocentric Gameplay Dataset for World Models / Rongjin Guo, Dong Liang, Yuhao Liu 他
日本語で読む → - 論文VLA/基盤モデルロボティクス
Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放する
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
原題: Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models / Haoqi Yuan, Zhixuan Liang, Anzhe Chen 他
日本語で読む → - 論文顔認証/プライバシー保護/拡散モデル画像認識
Flux-Guard: 拡散モデルを用いた顔認証プライバシー保護
顔編集とプライバシー保護を統合した生成フレームワークを提案し、敵対的攻撃により不正な顔認証を防ぎつつ編集品質を維持する。
原題: Flux-Guard: Facial Identity Protection using diffusion models / Jie Wang, Tao Wang, Ru Zhang 他
日本語で読む → - 論文評価・検証cs.CR
AIサンドボックス:脅威モデル、分類法、および測定フレームワーク
AIシステムを評価するためのサンドボックス環境について、境界の形式化、脅威モデル、分類法、測定フレームワークを提案し、実例で検証した論文。
原題: AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework / Inderjeet Singh, Haitham Mahmoud, Andrés Murillo
日本語で読む → - 論文ナビゲーションAI
EvolveNav: ゼロショット物体目標ナビゲーションのための先行的内省と自己進化メモリ
ゼロショット物体目標ナビゲーションにおいて、過去の軌跡からルールを抽出し、探索前に結果を予測する自己進化フレームワークを提案し、成功率を向上させた。
原題: EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation / Qi Chai, Wenhao Shen, Nanjie Yao 他
日本語で読む → - 論文群制御ロボティクス
ED3R: 協調ロボットエージェントによるエネルギー考慮型分散災害検出
ロボットと遠隔制御器が階層的に協調し、不確実性下での山火事検出をエネルギー消費を最小化しつつ行う分散フレームワークED3Rを提案した。
原題: ED3R: Energy-Aware Distributed Disaster Detection Enabled by Cooperative Robotic Agents / Lina Magoula, Nikolaos Koursioumpas, Nancy Alonistioti 他
日本語で読む → - 論文マニピュレーションロボティクス
EAGG: 幾何認識グラフ条件付けによる身体性整合グラスプ生成
異なるエンドエフェクタ形状に適応する統一グラスプ生成モデルを提案し、トポロジー認識グラフと反復的な幾何注入で成功率と接触精度を向上させた。
原題: EAGG: Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning / Wanhao Niu, Qiyan Ke, Yuan Sun 他
日本語で読む → - 論文VLA画像認識
GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
原題: GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning / Haoyu Wang, Guoqing Ma, Zeyu Zhang 他
日本語で読む → - 論文ヒューマンロボットインタラクションHCI
データと対話する:パーソナルヘルス振り返りのための具現化会話インターフェースの探求
ウェアラブル健康データを、ダッシュボードではなく具現化された対話エージェントとの会話を通じて振り返るシステムを提案・評価した論文。
原題: Talking to Your Data: Exploring Embodied Conversation as an Interface for Personal Health Reflection / Nikola Kovacevic, Bastien Husler, Di Zhuang 他
日本語で読む → - 論文ロボットメモリ管理AI
記憶は消耗資産:組み込みエージェントのフラッシュ耐久性の価格設定とその限界
ロボットのフラッシュメモリの書き込み耐久性を枯渇性資本とみなし、単一のシャドウプライスで価格付けする最適配置手法を提案。実ログで価値と書き込みの関連性を測定し、耐久性が制約となる場合の限界を明らかにした。
原題: Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So / Josef Liyanjun Chen
日本語で読む → - 論文継続学習機械学習
次元が継続学習におけるモジュール性の有用性を左右する
モジュール型アーキテクチャが継続学習で有利になる条件を、表現の次元性(高次元の「怠惰」領域か低次元の「豊か」領域か)に着目して解析した論文。
原題: Dimensionality Controls When Modularity Helps in Continual Learning / Kathrin Korte, Christian Medeiros Adriano, Joachim Winther Pedersen 他
日本語で読む → - 論文ヘルスケアロボティクスロボティクス
異種移動ロボットにおける非接触呼吸モニタリング:マルチモーダルエッジコンピューティングフレームワーク
異なる移動ロボットプラットフォーム上で、RGB・熱・近赤外・低照度カメラを適応的に切り替え、姿勢変化に頑健な非接触呼吸数モニタリングを実現するエッジコンピューティングフレームワークを提案・評価した。
原題: Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework / Milind Rampure, Shadman Sakib, Haley Patel 他
日本語で読む → - 論文メタ強化学習AI
メタ強化学習における知識再利用フレームワーク
メタ強化学習で、単純化したエージェントで学習したタスク知識を異なる形態のエージェントに転移するフレームワークを提案し、追従誤差を大幅削減しデータ効率を向上させた。
原題: Knowledge Reutilization in Meta-Reinforcement Learning / Yuan Meng, Bo Wang, Juan de los Rios Ruiz 他
日本語で読む → - 論文評価基盤AI
DeepInsight: 物理AIスタック全体を統合する評価インフラストラクチャ
物理AIスタック全体を単一のランタイムで評価できる統合インフラを提案し、異なるスケールやモダリティのタスクを共通の抽象化で扱えるようにした。
原題: DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack / Siyi Li, Chunyu Sun, Jiahao Zhang 他
日本語で読む → - 論文手と物体のインタラクション検出画像認識
手と物体のインタラクション検出の改善と評価
手と物体のインタラクション検出を改善する新しいフレームワークHOI-DETRを提案し、複数のデータセットで最先端の性能を達成した。
原題: Improving and Evaluating Hand-Object Interaction Detection / Ahmad Darkhalil, Dima Damen, David Fouhey
日本語で読む → - 論文生成ポリシーロボティクス
行動生成はどこから始めるべきか?生成ロボットポリシーのための学習可能なソース事前分布
生成ロボットポリシーの初期ノイズ分布を、 proprioception に基づく学習可能な対角ガウス分布に置き換える LeaP を提案し、15の操作タスクで成功率を向上させた。
原題: Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies / Meipo Dai, Qiyuan Zhuang, He-Yang Xu 他
日本語で読む → - 論文拡散ポリシー機械学習
ロバスト拡散ポリシーのためのコルモゴロフ回帰
拡散ポリシーの時間的ドリフトを、後向きコルモゴロフ方程式を用いてカメロン=マーチン空間上の決定論的境界値問題に置き換えることで改善し、軌道の規則性向上と決定的な故障検出を実現した。
原題: Kolmogorov Regression for Robust Diffusion Policies / Lekan Molu
日本語で読む → - 論文LLMセキュリティcs.CR
「プロ」LLMサブスクリプションは実は「無料」かもしれない:LLM推論サービスにおけるフィンガープリント偽装リスクの暴露
LLM APIの利用者が提供モデルの品質を検証するフィンガープリント手法が、悪意あるプロバイダによるモデル重みの操作で回避される「フィンガープリント偽装」という新たな脅威を提案・実証した論文。
原題: Your "Pro" LLM Subscription May Actually Be "Free": Exposing Fingerprint Spoofing Risks in LLM Inference Services / Jiahao Zhang, Xiuyu Li, Suhang Wang
日本語で読む → - 論文動画検索画像認識
手術室クリップの推論型テキスト動画検索:アクション駆動デジタルツインによる実現
手術室の動画から、暗黙的なクエリ(例:クリッピング直前のステップ)に基づいて該当クリップを検索する手法を提案。クリップをアクション駆動デジタルツインに変換し、LLMによる想像的検索と証拠に基づく修正で推論を可能にした。
原題: Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins / Yiqing Shen, Hao Ding, Mathias Unberath
日本語で読む → - 論文シミュレーション/強化学習画像認識
食品破壊シミュレーションにおける逆材料推定のための潜在空間強化学習
食品の破壊挙動から材料パラメータを推定する逆問題を、強化学習を用いて解く手法を提案。オレンジの皮むきを例に、目標条件付きポリシーが単一の順伝播で材料推定を行い、CMA-ESによる改良と組み合わせることで高精度な推定を実現した。
原題: Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation / Adrian Ramlal, Yuhao Chen, John S. Zelek
日本語で読む → - 論文視覚エンコーダ/事前学習/模倣学習ロボティクス
視覚運動制御のための対比的行動-画像事前学習
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
原題: Contrastive Action-Image Pre-training for Visuomotor Control / Yuvan Sharma, Dantong Niu, Anirudh Pai 他
日本語で読む → - 論文シーン位置合わせ画像認識
PROSE: 視覚言語モデルによる学習不要の自己中心視点シーン位置合わせ
頭部装着カメラで撮影した同一室内の異なる時刻のRGB映像を、事前学習済み視覚言語モデルを用いて物体レベルの3Dシーングラフに変換し、物体対応付けと幾何的検証により位置合わせする学習不要の手法を提案した。
原題: PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models / Zhiang Chen, Nahyuk Lee, Boyang Sun 他
日本語で読む → - 論文世界モデルAI
Kairos: 後悔を考慮した物理AI向けネイティブ世界行動モデルスタック
物理AIのための世界モデルスタックを提案し、制御に重要な情報のみを学習・維持・展開する手法を導入した。
原題: Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI / Kairos Team, Fei Wang, Shan You 他
日本語で読む → - 論文セグメンテーション画像認識
ActiveSAM: 画像条件付きクラス刈り込みによる高速かつ高精度なオープンボキャブラリセグメンテーション
SAM 3をベースに、画像ごとにアクティブなクラスのみを推定してフル解像度でデコードする訓練不要の推論フレームワークを提案し、精度を保ちつつ最大5.5倍高速化した。
原題: ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation / Tran Dinh Tien, Zhiqiang Shen
日本語で読む → - 論文器用操作ロボティクス
V2P-Manip: 単眼人間ビデオからの器用操作学習
単眼の人間デモビデオから、視覚的忠実度と物理的妥当性を両立した軌道を抽出し、器用な操作ポリシーを直接学習するフレームワークを提案。3Dアセット取得、軌道推定、ポリシー学習を統合し、二段階の精緻化で空間整合性と物理一貫性を確保する。
原題: V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos / Kaihan Chen, Yanming Shao, Haifeng Ji 他
日本語で読む → - 論文画像編集画像認識
テキストとビジョンの共同指示による画像編集
テキスト指示の意味表現力とビジュアル指示の空間精度を統合した画像編集フレームワークTV-Editを提案し、動画から構築したデータセットとベンチマークで性能を評価した。
原題: Text-Vision Co-Instructed Image Editing / Chenxi Xie, Yuhui Wu, Qiaosi Yi 他
日本語で読む →