論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文SLAMロボティクス
水中環境におけるフォトリアリスティックな単眼SLAM: WaterSplat-SLAM
水中単眼SLAMのための新しいシステムを提案し、セマンティックな媒体フィルタリングとガウス写像を用いて、頑健なカメラ追跡と高忠実度の密度マッピングを実現した。
原題: WaterSplat-SLAM: Photorealistic Monocular SLAM in Underwater Environment / Kangxu Wang, Shaofeng Zou, Chenxing Jiang 他
日本語で読む → - 論文経路計画ロボティクス
厳密な終了条件を備えた双方向ヒューリスティック探索による最適運動力学経路計画
双方向ヒューリスティック探索と厳密な終了条件を統合した、漸近最適な運動力学サンプリングベース経路計画アルゴリズムBTIT*を提案し、既存手法より高速な初期解と収束性を実証した。
原題: Optimal Kinodynamic Motion Planning Through Anytime Bidirectional Heuristic Search with Tight Termination Condition / Yi Wang, Bingxian Mu, Shahab Shokouhi 他
日本語で読む → - 論文ナビゲーションロボティクス
失敗認識を備えた模倣学習による安全なロボットナビゲーション
成功デモのみに頼る模倣学習の限界を指摘し、失敗データを価値推定に活用して政策学習は成功デモに限定する枠組みを提案。衝突率を減らしつつ成功率を維持することを実証した。
原題: Learning from Demonstration with Failure Awareness for Safe Robot Navigation / Xianghui Wang, Siwei Cheng, Shanze Wang 他
日本語で読む → - 論文自動運転ロボティクス
HAD: 階層拡散とメトリック分離型強化学習を組み合わせたエンドツーエンド運転
自動運転のエンドツーエンド計画において、粗密の階層拡散ポリシーと複数運転目標を分離して最適化する強化学習手法を提案し、NAVSIMとHUGSIMで大幅な性能向上を達成した。
原題: HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving / Wenhao Yao, Xinglong Sun, Zhenxin Li 他
日本語で読む → - 論文軌道予測機械学習
スーパーエージェントと交絡因子:周辺エージェントが車両軌道予測に与える影響
周辺エージェントの情報が軌道予測精度を低下させる場合があることを発見し、条件付き情報ボトルネックを導入して不要な情報を圧縮・無視することで予測性能とロバスト性を向上させた。
原題: Super Agents and Confounders: Influence of surrounding agents on vehicle trajectory prediction / Daniel Jost, Luca Paparusso, Martin Stoll 他
日本語で読む → - 論文3Dシーン理解画像認識
SceneTeract: 3Dシーンにおけるエージェント機能アフォーダンスとVLMの接地
3Dシーンの機能性をエージェントの制約下で検証するフレームワークを提案し、複雑な活動を原子アクションに分解して幾何学的シミュレーションで検証する。また、VLMの機能推論能力の評価と、報酬エンジンとしての活用も行う。
原題: SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes / Léopold Maillard, Francis Engelmann, Tom Durand 他
日本語で読む → - 論文ナビゲーション画像認識
対話を超えたベンチマーキング:協調的インスタンス物体ナビゲーションの再現可能なベンチマーク
本論文は、協調的インスタンス物体ナビゲーション(CoIN)のための再現可能なベンチマークQAsk-Navを提案し、ナビゲーションと質問応答の能力を独立に評価できるようにした。また、軽量な統一モデルLight-CoNavを開発し、既存手法より小型・高速でありながら、未知の物体や環境への汎化性能が高いことを示した。
原題: Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation / Edoardo Zorzi, Francesco Taioli, Yiming Wang 他
日本語で読む → - 論文ビデオ生成/世界モデルeess.IV
世界モデルとしてのビデオ生成モデル:効率的なパラダイム、アーキテクチャ、アルゴリズム
ビデオ生成モデルを世界シミュレータとして実用化するための効率性に焦点を当て、効率的なモデリングパラダイム、ネットワークアーキテクチャ、推論アルゴリズムの3次元で体系的なレビューを提供する。
原題: Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms / Muyang He, Hanzhong Guo, Junxiong Lin 他
日本語で読む → - 論文VLA画像認識
クロスビュー関係から学ぶ多視点空間推論
多視点の空間推論能力を高めるための大規模データセットXVRを構築し、視覚言語モデルを微調整して、対応付け・検証・位置特定のタスクで性能を向上させ、ロボット操作にも効果があることを示した。
原題: Learning Multi-View Spatial Reasoning from Cross-View Relations / Suchae Jeong, Jaehwi Song, Haeone Lee 他
日本語で読む → - 論文視線ジェスチャ認識HCI
TinyGaze: 市販モバイル端末での軽量視線ジェスチャ認識
市販モバイル端末のARKitデータを用いて、軽量モデルTinyHARで視線ジェスチャ認識とユーザー識別を高精度に実現するパイプラインを提案した。
原題: TinyGaze: Lightweight Gaze-Gesture Recognition on Commodity Mobile Devices / Yaxiong Lei, Hyochan Cho, Fergus Buchanan 他
日本語で読む → - 論文VLA/評価ベンチマーク機械学習
LIBERO-Para: VLAモデルの言い換え頑健性を評価する診断ベンチマークと指標
VLAモデルが指示の言い換えに対して脆弱であることを示すベンチマークを構築し、失敗の主因が物体レベルの語彙変化による計画段階の軌道逸脱であることを明らかにした。また、言い換え難易度を定量化する指標PRIDEを提案した。
原題: LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models / Chanyoung Kim, Minwoo Kim, Minseok Kang 他
日本語で読む → - 論文強化学習/拡散ポリシー機械学習
FlowRL: 拡散ポリシーを用いた強化学習の分類法とモジュール型フレームワーク
拡散モデルやフローモデルをポリシーとして用いる強化学習アルゴリズムを体系的に分類し、JAXベースのモジュール型コードベースと標準ベンチマークを提供した論文。
原題: FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies / Chenxiao Gao, Edward Chen, Tianyi Chen 他
日本語で読む → - 論文VLA画像認識
SpatialStack: 3D VLM空間推論のための階層的幾何学-言語融合
3D空間推論に弱い視覚言語モデルに対し、視覚・幾何・言語表現を階層的に融合するフレームワークを提案し、複数のベンチマークで最高性能を達成した。
原題: SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning / Jian Zhang, Shijie Zhou, Bangya Liu 他
日本語で読む → - 論文強化学習機械学習
予測ベースのマルコフ違反スコアによる強化学習における非マルコフ観測の検出
強化学習の観測がマルコフ性を満たさない場合を検出するため、予測誤差に基づくマルコフ違反スコア(MVS)を提案し、複数の環境とアルゴリズムでその有効性を検証した。
原題: Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning / Naveen Mysore
日本語で読む → - 論文VLM/シーン理解画像認識
画像とテキストから学ぶ限界:視覚言語モデルと身体化されたシーン理解
視覚言語モデル(VLM)が人間のシーン理解をどの程度捉えられるかを、15種類のタスクで人間の回答と比較し、特にアフォーダンス(行為可能性)の理解に構造的な欠陥があることを示した論文。
原題: The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding / Gillian Rosenberg, Skylar Stadhard, Bruce C. Hansen 他
日本語で読む → - 論文ビデオ生成画像認識
VideoWeaver: 身体化エージェントのためのマルチモーダル・マルチビュー動画間変換
複数カメラの視点を共有4D潜在空間で整合させ、拡散モデルを用いて視点一貫性のある動画変換を実現する初のマルチビューV2Vフレームワークを提案した。
原題: VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents / George Eskandar, Fengyi Shen, Mohammad Altillawi 他
日本語で読む → - 論文触覚画像認識
触覚の言語化:二重分岐学習による振動からテキストへの変換
振動触覚信号から自然言語の説明文を生成する初の試みとして、周期・非周期成分を分離する二重分岐学習と動的融合機構を備えたViPACを提案し、専用データセットLMT108-CAPを構築して有効性を実証した。
原題: The Language of Touch: Translating Vibrations into Text with Dual-Branch Learning / Jin Chen, Yifeng Lin, Chao Zeng 他
日本語で読む → - 論文データセット機械学習
CUA-Suite: コンピュータ操作エージェント向け大規模人手注釈ビデオデモンストレーション
コンピュータ操作エージェントの学習に必要な連続ビデオデモを大規模に提供するデータセット群を構築し、約1万タスク・55時間の専門家ビデオと高密度注釈を公開した。
原題: CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents / Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin 他
日本語で読む → - 論文ワールドモデル/解釈可能性機械学習
強化学習におけるワールドモデルは何を学習するのか?環境シミュレータの潜在表現の探索
強化学習用のワールドモデル内部の表現を解釈可能性手法で分析し、ゲーム状態の変数が線形に解読可能な形で表現され、因果介入により機能していることを示した。
原題: What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators / Xinyu Zhang
日本語で読む → - 論文オフライン強化学習機械学習
微分可能な世界モデルを用いたオフライン強化学習の推論時ポリシー最適化
事前学習済みポリシーと学習済み世界モデルを用いて、推論時にポリシーパラメータを勾配法で最適化するフレームワークを提案し、D4RLベンチマークで性能向上を確認した。
原題: Inference Time Policy Optimization for Offline RL with Differentiable World Models / Rohan Deb, Stephen J. Wright, Arindam Banerjee
日本語で読む → - 論文ビデオ生成/推論高速化画像認識
WorldCache: コンテンツ認識キャッシングによるビデオワールドモデルの高速化
拡散トランスフォーマーを用いたビデオワールドモデルの推論を高速化するため、動き適応型しきい値やブレンディング・ワーピングによる特徴再利用を導入したトレーニング不要のキャッシング手法を提案。
原題: WorldCache: Content-Aware Caching for Accelerated Video World Models / Umair Nawaz, Ahmed Heakl, Ufaq Khan 他
日本語で読む → - 論文世界モデル機械学習
FluidWorld:反応拡散ダイナミクスを世界モデルの予測基盤として用いる
自己注意機構を使わず、反応拡散型の偏微分方程式の積分によって未来予測を行う世界モデルFluidWorldを提案し、TransformerやConvLSTMと同等のパラメータ数で比較して、再構成誤差の低減や長期ロールアウトの安定性で優れることを示した。
原題: FluidWorld: Reaction-Diffusion Dynamics as a Predictive Substrate for World Models / Fabien Polly
日本語で読む → - 論文世界モデル/表現学習機械学習
潜在世界の探査:潜在表現における創発的離散記号と物理構造
V-JEPA 2の潜在表現を離散記号列に変換する軽量プローブAIMを提案し、物理的カテゴリ(把持角度、物体形状、動作時間構造)で記号分布が有意に異なることを示した。
原題: Probing the Latent World: Emergent Discrete Symbols and Physical Structure in Latent Representations / Liu hung ming
日本語で読む → - 論文模倣学習機械学習
行動量子化を用いた模倣学習の理論的理解
連続制御に自己回帰モデルを適用する際の行動量子化の理論的基盤を確立し、量子化誤差の伝播と統計的サンプル複雑性への影響を解析した論文。
原題: Understanding Behavior Cloning with Action Quantization / Haoqun Cao, Tengyang Xie
日本語で読む → - 論文世界モデル/無線eess.SP
同型世界モデルによる無線CSIの構造化潜在ダイナミクス
無線チャネル状態情報(CSI)の時間発展を潜在空間でモデル化する自己教師ありフレームワークを提案し、リー代数に基づく同型更新で構造化された潜在表現を学習する。
原題: Structured Latent Dynamics in Wireless CSI via Homomorphic World Models / Salmane Naoumi, Mehdi Bennis, Marwa Chafii
日本語で読む → - 論文自動運転/トークン化画像認識
DriveTok: 3D運転シーンのトークン化による統一的な多視点再構成と理解
多視点の運転シーンを効率的にトークン化する3Dシーン・トークナイザーを提案し、画像再構成やセマンティックセグメンテーション、深度予測、3D占有予測を統一的に扱えることを示した。
原題: DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding / Dong Zhuo, Wenzhao Zheng, Sicheng Zuo 他
日本語で読む → - 論文VLA/強化学習機械学習
AcceRL: 視覚言語行動モデルのための分散非同期強化学習と世界モデルフレームワーク
同期バリアと環境データ取得コストによるボトルネックを解消するため、環境ロールアウト・モデル推論・勾配更新を物理的に分離した分散非同期RLフレームワークを提案し、スループットとサンプル効率を大幅に向上させた。
原題: AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models / Chengxuan Lu, Shukuan Wang, Yanjie Li 他
日本語で読む → - 論文強化学習機械学習
統一ポリシー価値分解による迅速な適応
ポリシーと価値関数が低次元の目標埋め込みを共有する枠組みを導入し、事前学習で二線形分解を行い、テスト時には勾配更新なしで即座に新しいタスクへ適応する手法を提案した。
原題: Unified Policy Value Decomposition for Rapid Adaptation / Cristiano Capone, Luca Falorsi, Andrea Ciardiello 他
日本語で読む → - 論文交通シミュレーション機械学習
交通シミュレータから代理世界モデルへ:Enactor
交通マイクロシミュレータの限界を克服するため、Transformerベースのアクター中心生成モデルを提案し、交差点での物理的に一貫した軌道生成を実現。SUMOと組み合わせたシミュレーション・イン・ザ・ループで長期的な性能を評価した。
原題: Enactor: From Traffic Simulators to Surrogate World Models / Yash Ranjan, Rahul Sengupta, Anand Rangarajan 他
日本語で読む → - 論文事前学習/ファインチューニング機械学習
ファインチューナーの誤謬:ファインチューニングデータで事前学習すべき時
限られたドメインデータを事前学習から繰り返し混ぜる「専門事前学習(SPT)」が、ファインチューニング後の性能と汎化を改善し、必要な事前学習トークンを最大1.75倍削減することを示した論文。
原題: The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data / Christina Baek, Ricardo Pio Monti, David Schwab 他
日本語で読む →