論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/2 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御機械学習
ゲーミングコンセンサス:クラウドソース型ファクトチェックにおける協調操作
クラウドソース型ファクトチェックのマトリックス分解アルゴリズムが、少数の協調的なユーザーによる戦略的投票で操作され得ることを理論的・実証的に示し、実際のデータで最大10.7%の低品質ノートが操作可能であることを明らかにした。
原題: Gaming Consensus: Coordinated Manipulation in Crowdsourced Fact-Checking / Nikil Roashan Selvam, Jay Baxter, Sophie Hilgard 他
日本語で読む → - 論文探索画像認識
EAGLE-360: 360度環境における身体化された能動的全域から局所への探索
360度パノラマ環境での能動的視覚探索を改善するため、グローバルな事前情報を活用して探索空間を段階的に絞り込むフレームワークを提案し、大規模データセットと位置エンコーディングの改良により性能を向上させた。
原題: EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$ / Jingtao Xu, Zizhuo Lin, Jianwen Sun 他
日本語で読む → - 論文3Dセグメンテーション画像認識
仮想ドローンを飛ばして3Dガウシアンをオンラインでセグメンテーション
3Dガウシアン表現のシーンを、事前設定なしで1秒以内にインタラクティブにセグメンテーションする新しいフレームワークSAGOを提案。仮想ドローンによる次視点計画として問題を定式化し、従来比50倍以上の高速化を実現。
原題: Online Segment 3D Gaussians via Launching Virtual Drones / Liwei Liao, Rongjie Wang, Ronggang Wang
日本語で読む → - 論文分散学習/プライバシー保護機械学習
プライバシー保護と検証可能な近似分散符号化計算
本論文は、連合学習と分散学習の両方でプライバシー保護と悪意行動への耐性を統合するモデル非依存のフレームワークを提案し、符号化計算技術と攻撃駆動の評価で有効性を示した。
原題: Privacy-Preserving and Verifiable Approximate Distributed Coded Computing / Xavier Martínez-Luaña, Alba Gude-Santos, Manuel Fernández-Veiga 他
日本語で読む → - 論文予知保全機械学習
ターボファン劣化モデリングのための解釈可能な液体潜在状態ダイナミクス
液体ニューラルネットワークを用いて、航空機エンジンの健全性監視データから劣化過程を解釈可能な潜在状態としてモデル化し、予測精度と状態の解釈性を向上させた。
原題: Liquid Latent State Dynamics for Interpretable Turbofan Degradation Modeling / Weizhi Nie, Weijie Wang, Yuting Su
日本語で読む → - 論文ベンチマーク自然言語
EduArt: 大規模言語モデルにおける美術史知識を評価する教育レベルのベンチマーク
イタリアの高校と米国のAP美術史試験から収集した871問の人間作成問題を用いて、マルチモーダルLLMの美術史知識と視覚推論を評価するベンチマークを提案。形式や言語、画像の有無が性能に与える影響を分析した。
原題: EduArt: An educational-level benchmark for evaluating art history knowledge in large language models / Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza
日本語で読む → - 論文空間推論画像認識
SpaceEra++: ビデオにおける3次元空間推論のための統合フレームワーク
本論文は、ビデオから3次元空間推論を行うための統合フレームワークSpaceEra++を提案する。フレーム選択戦略と空間整合手法を導入し、空間理解の精度を向上させた。
原題: SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video / Weili Guan, Haoyu Zhang, Meng Liu 他
日本語で読む → - 論文3Dシーン生成AI
SimWorlds: 動的3Dシーン生成のためのマルチエージェントシステム
テキストから動的で編集可能な4Dシーンを生成するマルチエージェントフレームワークを提案し、物理整合性を検証するベンチマークも導入した。
原題: SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation / Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen 他
日本語で読む → - 論文模倣学習画像認識
ComplexMimic: 複雑な3D環境における人間とシーンのインタラクション模倣
複雑な3D環境での人間とシーンのインタラクション模倣を実現するフレームワークを提案。不完全なモーションキャプチャデータから、模倣とインタラクションの二つの専門家を学習し、難易度に応じた蒸留戦略で自然で物理的に妥当な動作を生成する。
原題: ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments / Lu Pan, Hongwei Zhao
日本語で読む → - 論文拡散モデル/手と物体のインタラクション画像認識
JointHOI: 接触マップの同時生成による手と物体のインタラクション生成の強化
テキストから手と物体のインタラクションを生成する際、接触マップを同時生成する単一ステージの拡散モデルを提案し、物理的整合性を向上させた。
原題: JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation / Mingyeong Song, Jungbin Cho, Jisoo Kim 他
日本語で読む → - 論文モデルベースRL機械学習
潜在世界モデルの閉ループ性能予測:非マルコフ報酬下でのMPCとモデルベースRLのためのオフライン・チェックポイント選択
潜在世界モデルの訓練中に、閉ループ性能が低下しても検証損失が改善し続ける問題に対し、報酬観測可能性割合(ROF)などの構造的診断指標を用いて、オフラインで最適なチェックポイントを選択する手法を提案した。
原題: Predicting Closed-Loop Performance of Latent World Models: Offline Checkpoint Selection for MPC and Model-Based RL Under Non-Markovian Rewards in LunarLander / Nikolai Smolyanskiy
日本語で読む → - 論文ビデオ生成/モーション制御画像認識
QWERTY: クエリ変形によるビデオ拡散トランスフォーマーの学習不要モーション制御
ビデオ拡散トランスフォーマー(DiT)において、学習なしでユーザー指定のオブジェクト変形やオプティカルフローに基づくモーション制御を実現するフレームワークを提案。クエリのセマンティック部分空間を変形することで、生成軌道を所望のモーションへ導く。
原題: QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers / Kyobin Choo, Youngmin Kim, Hyunkyung Han 他
日本語で読む → - 論文セキュリティcs.CR
クラウドエッジ推論における大規模視覚言語モデルへの視覚トークン操作攻撃
エッジとクラウド間で送信される視覚トークンを攻撃者が改ざんし、モデルの精度を大幅に低下させる攻撃手法を提案・評価した論文。
原題: Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models / Zikai Zhang, Rui Hu, Olivera Kotevska 他
日本語で読む → - 論文コード生成/強化学習機械学習
DecompRL: モジュール型コード生成の学習による難問解決
LLMが解けない問題を、問題を小さなモジュールに分解して再結合することで解く強化学習アルゴリズムDecompRLを提案。GPUコストを約50倍削減し、標準的な生成では解けない問題を解決する。
原題: DecompRL: Solving Harder Problems by Learning Modular Code Generation / Juliette Decugis, Fabian Gloeckle, Francis Bach 他
日本語で読む → - 論文強化学習AI
インタラクティブなゲームプレイのためのコーチ可能なエージェント
強化学習エージェントに、実行時にスタイル(タスクの解き方の変更)を指示できるフレームワークを提案し、複数の複雑なドメインで有効性を示した論文。
原題: Coachable agents for interactive gameplay / Roberto Capobianco, Harm van Seijen, Nolan D. Bard 他
日本語で読む → - 論文画像分類画像認識
深層学習によるマルチラベル画像分類の再考:分類体系、課題、展望
深層学習を用いたマルチラベル画像分類(MLIC)の包括的なサーベイ論文であり、手法を6つのグループに分類し、課題と将来の研究方向をまとめている。
原題: Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook / Xuelin Zhu, Xiu-Shen Wei, Jiawei Ge 他
日本語で読む → - 論文3Dシーングラフ生成画像認識
DeWorldSG: ワールドモデル事前知識による深度認識3Dセマンティックシーングラフ生成
RGB-Dシーケンスから時間的に安定した3Dセマンティックシーングラフを生成するフレームワークを提案。物体を確率的3Dノードとして表現し、ワールドモデルの事前知識で関係性を補完することで精度を大幅に向上させた。
原題: DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors / Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha 他
日本語で読む → - 論文ワールドモデル機械学習
Valdi: 価値拡散ワールドモデル
拡散モデルを用いた不確実な未来予測と、オンラインMPCのための高速な潜在計画を両立するワールドモデルを提案。CarRacing環境での予備実験により、単一拡散ステップで決定論的MLPベースラインに匹敵する性能を示した。
原題: Valdi: Value Diffusion World Models / Christopher Lindenberg, Kashyap Chitta
日本語で読む → - 論文サイバーフィジカルシステム/セキュリティcs.CR
カメレオン:MLサロゲートによるメモリ破壊攻撃からのサイバーフィジカルシステムの回復
メモリ破壊攻撃を受けたCPSを、機械学習ベースのサロゲートでコンパートメントを置き換えることで、システムを停止させずに回復させるフレームワークを提案した。
原題: Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates / Mohsen Salehi, Karthik Pattabiraman
日本語で読む → - 論文ナビゲーションロボティクス
X-NavDP: グループQスコア再重み付けマッチングによる新規行動と異種エンボディメントへのナビゲーション拡散ポリシーの一般化
ナビゲーション拡散ポリシーを強化学習で事後訓練し、多様なロボット形態や困難なシナリオへの一般化を向上させるフレームワークGQRMを提案。シミュレーションと実世界で成功率を大幅に改善した。
原題: X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching / Tianyu Yang, Yiming Zeng, Wenzhe Cai 他
日本語で読む → - 論文ネットワーク管理cs.NI
共ドリフトの解明:自己運転ネットワークのためのプロアクティブなマルチインテント障害予測と根本原因の曖昧性解消
自己運転ネットワークにおける3つのマクロインテント(テレメトリ、分析、作動)間の因果的結合による障害伝播を捉え、障害予測と根本原因の特定を同時に行うフレームワークMILDを提案した。
原題: Untangling Co-Drift: Proactive Multi-Intent Failure Prediction and Root-Cause Disambiguation for Self-Driving Networks / Md. Kamrul Hossain, Walid Aljoby
日本語で読む → - 論文パラレルロボットロボティクス
Tripody: 高所建設作業のための過拘束3-SPR型パラレルロボット
天井建設作業向けに、車輪付き3自由度パラレルロボットを開発し、過拘束機構と弾性変形を利用して高剛性と高精度を実現した。
原題: Tripody: An Overconstrained 3-SPR-like Parallel Robot for High-Reach Construction Tasks / Julien Kindle, Jakub Raczy, Riccardo Balbi 他
日本語で読む → - 論文ロボット表現/影生成ロボティクス
投影された視覚的抽象表現を通じたロボットのコミュニケーション学習
ロボットが自身の影を動的に表現するシステムを提案。柔らかい皮膚を持つ多指ハンドと学習された影の自己モデルを用いて、目標の影画像や動画に合わせて手の動きを最適化する。
原題: Robot Learning to Communicate through Projected Visual Abstractions / Danyang Yan, Boyuan Wang, Jiaxun Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
VLN-AVP:ハイブリッド長期短期記憶を用いた自動バレーパーキングのためのゼロショット視覚言語ナビゲーション
事前地図に依存せず、視覚言語モデルとBEVモデルを組み合わせ、自然言語指示に従って駐車場をナビゲートするゼロショットフレームワークを提案。短期知覚記憶と長期トポロジー記憶を導入し、新規の地下駐車場ベンチマークで高い成功率を達成した。
原題: VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking / Yijian Li, Xiangru Mu, Changze Li 他
日本語で読む → - 論文VLA/ロボット操作ロボティクス
AC-VLA: 構成学習によるロバストな分布外行動実行
VLAモデルの分布外汎化を改善するため、LLMによるタスク分解と非対称マスキングを組み合わせた構成学習フレームワークAC-VLAを提案した。
原題: AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning / Xiaojiang Peng, Kai Peng, Jie Lu 他
日本語で読む → - 論文VLA/操作ロボティクス
VistaVLA: 幾何・意味認識型3Dガウス基底VLAによるロボット操作
3Dガウスプリミティブを用いて幾何と意味を統合した3D認知表現を構築し、VLAポリシー学習のためのコンパクトな文脈トークンとして接地する新しい2段階フレームワークを提案。
原題: VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation / Mohan Liu, Zhihao Gu, Xuanyu Chen 他
日本語で読む → - 論文モーション計画ロボティクス
敵対者としてのワールドモデル:堅牢なモーション計画のためのマルチエージェント自己対戦ファインチューニング
密集交通における堅牢なモーション計画のために、プランナーのワールドモデルを敵対者として用いる自己対戦ファインチューニング手法AWMを提案し、nuPlanとInterPlanで有効性を示した。
原題: World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning / Tong Nie, Yuewen Mei, Junlin He 他
日本語で読む → - 論文経路計画ロボティクス
カバレッジ経路計画:古典的基礎、最近の進展、そして将来の方向性
本論文は、ロボットのカバレッジ経路計画(CPP)に関する包括的なサーベイであり、2015年から2026年までの125の代表的な研究を6つのカテゴリに分類して、古典的手法から学習ベースの手法までの進化を概観する。
原題: Coverage Path Planning: Classical Foundations, Recent Advances, and Future Directions / Zongyuan Shen, Shalabh Gupta, Shancheng Zhao 他
日本語で読む → - 論文VLA/MoE/ルーティングロボティクス
運動学で経路を決め、観察で行動する:MoE拡張VLAにおける運動学教師付きエキスパートルーティング
MoEを備えたVLAモデルで、行動軌跡の運動学的クラスタリングに基づく教師信号でルーターを訓練し、推論時は観察のみでエキスパートを選択する手法KinRTを提案。DIYロボットプラットフォームを自作し、既存手法より20%以上高い性能を示した。
原題: Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA / Tianhang Yang, Yanze Zheng, Junjie Wang 他
日本語で読む → - 論文水中ロボットロボティクス
大型可変折りたたみ翼を備えた小型ハイブリッド水中グライダーの設計、モデリング、および実験的検証
小型ハイブリッド水中グライダーに、独立駆動の折りたたみ・偏向可能な翼を搭載し、多体動力学モデルとパラメータ同定手法を提案して、様々な形態での正確なモデリングと検証を行った。
原題: Design, Modeling and Experimental Validation of a Miniature Hybrid Underwater Glider With Large-Range Foldable Deflectable Wings / Yongjian Zhu, Yusen Tao, Feitian Zhang
日本語で読む →