論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/14 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文4D再構成画像認識
高忠実度4D手と物体のキャプチャ:多視点時空間トラッキングと物理認識ガウシアンによる実現
テンプレートやマーカーを使わずに、多視点ビデオから手と物体の相互作用を高精度に4D再構成する新しいシステムを提案した。
原題: High-Fidelity 4D Hand-Object Capture via Multi-View Spatiotemporal Tracking and Physics-Aware Gaussians / Bo Peng, Xu Chen, Yi Gu 他
日本語で読む → - 論文自動運転画像認識
Metis: 自動運転と都市ナビゲーションのための汎用かつ効率的なワールドアクションモデル
ビデオ生成と行動予測を分離したエンドツーエンドのワールドアクションモデルを提案し、推論時のビデオ生成を省略することで効率化しつつ、汎用性と性能を向上させた。
原題: Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation / Jingyu Li, Zhe Liu, Dongnan Hu 他
日本語で読む → - 論文身体化推論/VLMAI
RoboPIN: ピン留めチェーン・オブ・ソートによる接地された身体化推論
身体化推論の各ステップを視覚的証拠に固定する「ピン留めチェーン・オブ・ソート」を提案し、エンティティ追跡の一貫性を保つデータセットとモデルを構築した。
原題: RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought / Yaoting Huang, Yifu Yuan, Linqi Han 他
日本語で読む → - 論文深度推定画像認識
自己教師あり単眼ビデオ深度推定のための3D一貫性最適化
ビデオフレームを独立に扱う従来法の問題を解決するため、深度推定を多視点3D再構成問題として捉え、3D一貫性最適化フレームワークを導入した。画像レベルのフォトメトリックレンダリング、ワールド座標の幾何学的整合、多スケール時間勾配一貫性の3つの制約でフレームを統一的に最適化し、自己教師あり学習とゼロショット臨床環境で最先端の精度を達成した。
原題: 3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation / Yuanye Liu, Ke Zhang, Junzhe Jiang 他
日本語で読む → - 論文VLA/検索拡張ロボティクス
再学習せずに検索せよ:テスト時に視覚言語行動モデルを新タスクへ拡張する手法
新しいタスクへの適応を、モデルの再学習ではなく、デモンストレーションの検索で置き換える手法を提案。凍結したポリシーが検索した軌跡を条件付けに使い、タスク追加をパラメータ更新なしで実現する。
原題: Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time / Jeongeun Park, Juhan Park, Taekyung Kim 他
日本語で読む → - 論文歩行ロボティクス
LoComposition: 歩容事前知識なしの地形適応型・高エネルギー効率四足歩行
報酬設計をタスク・制約・エネルギー最小化・地形適応に分離し、歩容の事前知識なしで効率的な四足歩行を実現。実機Go2でゼロショット転送に成功し、コスト・オブ・トランスポートを56%削減した。
原題: LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors / Loukas Kordos, Leonard T. Franz, Simon Rappenecker 他
日本語で読む → - 論文位置認識画像認識
G2IA: 幾何ガイド付きインスタンス認識検索と洗練によるクロスモーダル位置認識
カメラ画像とLiDAR地図間の位置認識を、幾何情報とインスタンス特徴を統合した記述子で検索し、局所形状と空間配置の整合性を検証して再ランキングする手法を提案した。
原題: G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition / Xianyun Jiao, Jingyi Xu, Zhongmiao Yan 他
日本語で読む → - 論文ディープフェイク検出cs.MM
音声・映像ディープフェイク検出のための教師-学生構造によるドメイン適応アンサンブルモデル
音声と映像の両方を扱うディープフェイク検出モデルを、教師-学生フレームワークでドメイン適応させ、未知のデータセットでの性能を向上させる手法を提案した。
原題: Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection / Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee
日本語で読む → - 論文デモンストレーション学習機械学習
位相限定キュレーションは役に立たない:デモンストレーション選別における位相別メトリクス選択の否定的結果
操作デモの位相構造に着目し、各位相で最適なメトリクスを選んでキュレーションする手法を提案・検証したが、3つのタスクで常に最良でなく、むしろ悪化する場合があることを示した。
原題: Phase-Localized Curation Does Not Help: A Negative Result on Per-Phase Metric Selection for Demonstration Filtering / Aarav Bedi
日本語で読む → - 論文世界モデル評価機械学習
身体化された意思決定のための世界モデルはどう評価されるべきか:意思決定中心の立場
世界モデルの評価方法が多様化し、主張と評価の不一致が問題となっている。本論文は、身体化された意思決定に使う世界モデルは、視覚的なリアリティよりも介入推論や計画・政策最適化の有用性で評価すべきだと論じ、L0-L7の階層的評価枠組みを提案する。
原題: How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position / Yang Yu, Shiyuan Zhang, Yifei Sheng 他
日本語で読む → - 論文マニピュレーションロボティクス
DragMesh-2: 関節物体との物理的に妥当な器用な手と物体のインタラクション
関節物体を器用な手で操作するための接触駆動フレームワークを提案し、物理信号を注入する学習機構により接触負荷の変化に対するロバスト性を向上させた。
原題: DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects / Tianshan Zhang, Yijia Duan, Yanjun Li 他
日本語で読む → - 論文強化学習機械学習
大規模並列オン方策強化学習のための信頼領域拡散ポリシー
大規模並列シミュレーションを用いたオン方策強化学習で拡散ポリシーを安定して訓練する手法TruDiを提案し、多様なベンチマークで性能を実証した。
原題: Trust-Region Diffusion Policies for Massively Parallel On-Policy RL / Huy Le, Onur Celik, Denis Blessing 他
日本語で読む → - 論文VLA画像認識
考えるより先に動け:視覚言語行動モデルにおける強化学習を用いた潜在推論と早期終了戦略
視覚言語行動モデルにおいて、明示的なテキスト推論を避け、潜在変数による推論を強化学習で最適化し、信頼度に応じて推論を早期終了することで、高速かつ高精度な行動決定を実現した。
原題: Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models / Dianqiao Lei, Lianlei Shan
日本語で読む → - 論文遠隔操作ロボティクス
巧みな操作のための双方向遠隔操作フレームワーク
この論文は、器用な遠隔操作のためのモジュール式双方向遠隔操作フレームワークを提案し、実世界のタスクでその有効性を検証しています。
原題: A Bilateral Teleoperation Framework for Dexterous Manipulation / Stefano Dalla Gasperina, Dong Ho Kang, Haiyun Zhang 他
日本語で読む → - 論文VLA画像認識
多様な潜在世界モデルによる効率的なマルチモーダル推論
視覚入力の複数の解釈を潜在空間で並列に推論し、強化学習で計算資源を適応配分するマルチモーダル推論フレームワークDLWMを提案した。
原題: DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning / David Huang, Lianlei Shan
日本語で読む → - 論文遠隔操作/データ収集ロボティクス
万能操作外骨格:リアルタイムトルクフィードバックによるコンプライアント全身ポリシーの学習
上肢外骨格UMEを開発し、触覚トルクフィードバック付き遠隔操作で力覚データを収集、コンプライアントな全身操作ポリシーを学習する手法を提案。
原題: Universal Manipulation Exoskeleton: Learning Compliant Whole-body Policies with Real-time Torque Feedback / Litian Liang, Jingxi Xu, Xinda Qi 他
日本語で読む → - 論文自動運転/VLA画像認識
RT-VLA: 知識蒸留によるリアルタイム視覚言語行動モデル
大規模なVLAモデルの推論遅延を解決するため、教師モデルSimLingoから知識蒸留で軽量な学生モデルRT-VLAを構築し、推論時間を大幅に削減しつつ運転性能と言語推論を維持する手法を提案した。
原題: RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation / Xiangyu Huang, Zhenlin Hua, Han Zhou 他
日本語で読む → - 論文経済学/知識資本econ.GN
資本の知識理論:自然知能と人工知能の価値、第1巻
生産能力がソフトウェアやデータ、知識に依存する現代経済において、知識を資本として捉える理論を構築し、その生成・管理・評価の仕組みを分析する。
原題: A Knowledge Theory of Capital:The Value of Natural and Artificial Intelligence, Volume 1 / Jeffrey Gardiner
日本語で読む → - 論文物理世界モデル機械学習
分離可能なニューラルアーキテクチャによる物理世界モデル:数学理論から応用まで
テンソル分解とニューラル近似を組み合わせた分離可能なニューラルアーキテクチャ(SNA)を提案し、偏微分方程式の解法として理論的保証と高速計算を実現した。
原題: Separable Neural Architectures as Physical World Models: from Mathematical Theory to Applications / Reza T Batley, Andrew Kichline, Sourav Saha
日本語で読む → - 論文3D人物復元画像認識
Multi-HMR 2: 多人数カメラ中心の人物検出・メッシュ復元・追跡
カメラ座標系での正確な3D位置推定と人物検出を実現する、DETRベースの多人数メッシュ復元フレームワークを提案した。
原題: Multi-HMR 2: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking / Guénolé Fiche, Philippe Weinzaepfel, Romain Brégier 他
日本語で読む → - 論文記憶・表現学習AI
AIエングラム:人工知能における記憶痕跡の探索
深層ニューラルネットワークに生物学的記憶痕跡に相当する「AIエングラム」を幾何学的枠組みで特定し、記憶の合成・消去を線形演算で実現する手法を提案した。
原題: AI Engram: In Search of Memory Traces in Artificial Intelligence / Jea Kwon, Dong-Kyum Kim, Jiwon Kim 他
日本語で読む → - 論文探索ロボティクス
VANDERER: 未来予測と視覚的好奇心に基づく拡散ポリシーによる地図不要の探索
単眼カメラのみを用いて、視覚的好奇心モジュールで拡散ポリシーを誘導し、地図なしで環境を効率的に探索するフレームワークを提案した。
原題: VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy / Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy 他
日本語で読む → - 論文画像編集画像認識
ChordEdit再考:再現・簡素化・新たな洞察による一段階画像編集の再定義
一段階画像編集手法ChordEditを再現・解析し、その動作メカニズムを解明して簡素化した論文。
原題: Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights / Minghan Li, Jeremy Moebel, Mengyu Wang
日本語で読む → - 論文3Dオブジェクト関節化画像認識
インストラクト・パーティキュレート:運動学的制御によるフィードフォワード3Dオブジェクト関節化のスケーリング
3Dメッシュと目標の運動学的仕様(部品記述、接続、関節タイプなど)を入力として、対応する部品分割と関節運動パラメータを予測するモデルを提案。大規模な異種データセット(15万以上の関節化3Dオブジェクト)で訓練し、カテゴリ横断やAI生成メッシュへの一般化を向上させた。
原題: Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control / Ruining Li, Yuxin Yao, Matt Zhou 他
日本語で読む → - 論文セキュリティ/深度推定画像認識
傷ついたレンズ、ずれた深度:受動的なカメラ側光学攻撃
カメラレンズの小さな傷が明るい光源と相互作用して深度推定を誤らせる物理的攻撃手法SLASHを提案し、単眼深度推定と3D物体検出でその有効性を実証した。
原題: Scratched Lenses, Shifted Depth: Passive Camera-Side Optical Attacks / Qinlin He, Zeming Zhuang, Yongji Wu 他
日本語で読む → - 論文画像編集画像認識
360度屋内パノラマ編集に向けた、リフォーカス型クロスアテンションによるチューニング不要拡散モデル
チューニング不要で対象領域のみを正確に編集できる拡散モデル編集手法FocusDiffを提案し、360度屋内パノラマ編集にも応用した。
原題: Toward 360-Degree Indoor Panorama Editing via Tuning-Free Diffusion Model with Refocusing Cross-Attention / Dinh-Khoi Vo, Nhut-Thanh Le-Hinh, Viet-Tham Huynh 他
日本語で読む → - 論文画像編集画像認識
条件付けが重要:拡散画像編集における反転と注意の安定化
テキスト条件付けの精度が拡散モデルの反転安定性と編集品質に与える影響を理論・実験で示し、条件付けの改良とトークン単位の注意制御を備えたSimEditを提案した。
原題: Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing / Zheyuan Zhan, Hongchen Li, Can Wang 他
日本語で読む → - 論文安全強化学習機械学習
証明可能な安全性を備えつつスケーラブルな強化学習
安全な強化学習において、学習したバックアップポリシーを用いて暗黙的な制御不変集合を生成し、微分可能な射影層で安全性を厳密に保証する2段階フレームワークPS2-RLを提案した。
原題: Provably Safe, Yet Scalable Reinforcement Learning / Kai S. Yun, Zeyang Li, Navid Azizan
日本語で読む → - 論文システム同定制御
環境制約下の入力駆動システムに対する環境認識型安定ニューラルクープマン動力学学習
環境変化を考慮しつつ安定性と入力状態安定性を保証する、ニューラルODEとクープマン作用素を統合した予測モデル学習手法を提案した。
原題: Environment-Aware Stable Neural Koopman Dynamics Learning for Input-Driven Systems under Environmental Constraints / Lin Feng
日本語で読む → - 論文変形物操作ロボティクス
しわなしロバスト性:並列シミュレーションと認定変形操作のためのロバストMPC
GPU並列の微分可能シミュレータとロバストMPCを組み合わせ、ロープや布などの変形物操作をリアルタイムで安全に行う制御手法を提案した。
原題: Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation / Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti 他
日本語で読む →