論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文モーショントラッキングロボティクス
LIMMT: モーショントラッキングには少ない方が良い
物理ベースのヒューマノイドモーショントラッキングにおいて、データ品質(物理的実現可能性、多様性、複雑さ)に基づいてデータを選別することで、全データセットの3%未満のデータでより良い追跡性能を達成できることを示した初のデータ中心的研究。
原題: LIMMT: Less is More for Motion Tracking / Yu Guan, Zekun Qi, Chenghuai Lin 他
日本語で読む → - 論文状態推定ロボティクス
GAIT: 慣性-脚トークンへの注意機構を用いた脚ロボットの固有受容状態推定
脚ロボットの状態推定において、慣性計測と脚ごとの計測を個別のトークンとして扱い、注意機構で各計測の重要度を学習する手法を提案。接触状態に応じた重み付けを明示的な接触推定なしで実現し、未見の歩容や地形でも高い推定精度を示した。
原題: GAIT: Legged Robot Proprioceptive State Estimation with Attention over Inertial-Leg Tokens / Young-Rang Seo, Hajun Kim, Sangmin Kim 他
日本語で読む → - 論文データセット構築ロボティクス
ロボティクスデータセット構築をアーティファクトベースのビルドプロセスとしてモデル化する
ROSバッグ記録からMLデータセットを生成する逐次スクリプトを、依存グラフ上のアーティファクトベースのビルドプロセスとしてモデル化し、Bazel拡張のBagzelを実装。反復的なデータセット更新を大幅に高速化した。
原題: Modeling Robotics Dataset Construction as an Artifact-Based Build Process / Leon Pohl, Lukas Beer, George Sebastian 他
日本語で読む → - 論文群制御画像認識
DroneShield-AI: 混雑空域におけるリアルタイム自律ドローン脅威検知・行動意図分類・群知能のためのマルチモーダルセンサ融合フレームワーク
RF信号、音響、視覚の各センサを融合し、ドローンの脅威検知と行動意図分類、群行動分析を行うオープンなフレームワークを提案した。
原題: DroneShield-AI: A Multi-Modal Sensor Fusion Framework for Real-Time Autonomous Drone Threat Detection, Behavioral Intent Classification, and Swarm Intelligence in Contested Airspace / Marius Bayizere
日本語で読む → - 論文共設計/進化計算/強化学習ロボティクス
浮力支援ロボットの挑戦的移動のためのガウス進化的スペシャリストによる高速共同設計
形態と制御を同時最適化するため、設計空間を分割して多様な行動を捉えるガウス進化的スペシャリスト(GES)を提案し、浮力支援脚ロボットBALLUで性能向上と障害物越えを実証した。
原題: Rapid co-design of Buoyancy-assisted robots for Challenging Locomotion using Gaussian Evolutionary Specialists / Ankit Sinha, Nitish Sontakke, Dennis Hong 他
日本語で読む → - 論文強化学習ロボティクス
因果報酬ワールドモデル:自動スキル生成のためのゼロショット報酬設計
因果関係を明示的にモデル化した報酬ワールドモデルを提案し、LLMによる報酬生成を因果的制約で導くことで、環境フィードバックなしのゼロショット報酬設計を実現した。
原題: Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation / Yang Yang, Yuchuang Tong, Zhengtao Zhang 他
日本語で読む → - 論文説明可能AI/自律システムロボティクス
危険環境における説明可能な自律性のための抽象アーキテクチャ
自律ロボットシステムの信頼性向上のため、説明可能性を設計段階から組み込む抽象アーキテクチャを提案し、原子力産業での適用例を示した論文。
原題: An Abstract Architecture for Explainable Autonomy in Hazardous Environments / Matt Luckcuck, Hazel M Taylor, Marie Farrell
日本語で読む → - 論文世界モデル機械学習
BRo-JEPA: 潜在空間におけるモジュラー変換の学習
視覚入力から代数規則を学習できるかという問いに対し、算術演算を潜在空間での回転として表現する世界モデルBRo-JEPAを提案し、未学習の演算へのゼロショット汎化を達成した。
原題: BRo-JEPA: Learning Modular Transformations in Latent Space / Divyansh Jha, Yuanfang Xie, Brennen Yu 他
日本語で読む → - 論文強化学習/生成的ポリシー機械学習
ラグランジアン摂動拡散ステアリング:生成的ポリシーのための潜在強化学習
凍結した生成的ポリシーに対し、ノイズ空間の小さな摂動を学習して性能を改善する軽量適応手法LP-DSを提案。ロボット操作や移動、器用操作のベンチマークで成功率と報酬を向上させた。
原題: Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies / Hikmet Simsir, Ozgur S. Oguz
日本語で読む → - 論文科学発見AIAI
科学のための自己改訂発見システム:エージェント型人工知能の圏論的枠組み
科学における発見を、証拠や操作の型を変える「表現体制の改訂」として捉え、圏論を用いて定式化した。材料科学のエージェント型発見システムを構築し、タンパク質力学モデルの改訂例で実証した。
原題: Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence / Fiona Y. Wang, Markus J. Buehler
日本語で読む → - 論文世界モデリング画像認識
対話型ビデオ世界モデリングに向けて:フロンティア、課題、ベンチマーク、将来動向
本論文は、ユーザーのアクションを条件としたビデオや3D生成による対話型世界モデリングの研究動向、技術的課題、評価ベンチマークを体系的にレビューし、将来の研究方向を提案する。
原題: Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends / Jiuming Liu, Chaojun Ni, Mengmeng Liu 他
日本語で読む → - 論文心的状態推論AI
MindClaw: 精密介入のための閉ループ具現化心的状態推論
ロボットが他者の心的状態をリアルタイムに推論し、必要な時だけ介入する閉ループフレームワークMindClawを提案した。
原題: MindClaw: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention / Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang 他
日本語で読む → - 論文モデルベース強化学習機械学習
すべてのモデルは誤り、どこが誤りかを知ることが有用:強化学習におけるモデル不確実性について
モデルベース強化学習におけるモデルの不正確さを扱う枠組みを提案し、不確実性を適切に扱うことでモデルの悪用を防ぎ、ハードウェア上での直接学習や安全な探索の成功を示した。
原題: All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning / Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele 他
日本語で読む → - 論文視点制御画像認識
どこを見るべきか:基礎モデルは能動的探索を通じて目標視点に到達できるか?
エージェントが3D環境内で能動的に視点を調整し、目標画像と一致する観測を得る「目標視点再現」タスクを導入し、ベンチマークTVRBenchを構築。既存モデルの成功率は低く、訓練フレームワークで改善を試みた。
原題: Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration? / Liyang Li, Muzhi Zhu, Zhiyue Zhao 他
日本語で読む → - 論文世界モデル画像認識
物理的に制御可能な世界モデルによる物理的物体理解
部分観測から物体の物理的構造や相互作用の法則を学習する確率的ワールドモデルを提案し、物体の抽出や3D操作、物理関係の計算を実現した。
原題: Physical Object Understanding with a Physically Controllable World Model / Rahul Venkatesh, Klemen Kotar, Lilian Naing Chen 他
日本語で読む → - 論文アライメント機械学習
大規模言語モデルは集約された人間の好みではなく、個別化された好みを学習すべきである
本論文は、大規模言語モデルのアライメントにおいて、多様な人間の好みを単一の報酬信号に集約するのではなく、個人ごとの好みを学習すべきだと主張するポジションペーパーである。
原題: Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences / Cristina Garbacea
日本語で読む → - 論文戦略的機械学習機械学習
部分的な公平性認識:戦略的エージェントのための信念誘導型戦略メカニズム
戦略的機械学習における公平性制約の公開と隠蔽のジレンマを緩和するため、公平性制約の候補集合を公開し基底制約を隠す部分的な公平性認識問題を提案し、エージェントが信念を更新しながら適応するメカニズムを導入した。
原題: Partial Fairness Awareness: Belief-Guided Strategic Mechanism for Strategic Agents / Xinpeng Lv, Chunyuan Zheng, Yunxin Mao 他
日本語で読む → - 論文VLA画像認識
DeepLatent: 並列潜在視覚推論による画像思考
視覚言語モデルにおいて、画像を中間推論ステップに埋め込む「画像で考える」パラダイムを強化するため、並列に潜在視覚状態を生成するフレームワークDeepLatentを提案した。
原題: DeepLatent: Think with Images via Parallel Latent Visual Reasoning / Dongchen Lu, Zhimo Li, Mao Shu 他
日本語で読む → - 論文オフライン強化学習機械学習
行動不変なタスク表現学習とTransformer基盤の世界モデルによるオフラインメタ強化学習
オフラインメタ強化学習におけるコンテキストとポリシーの分布シフト問題を解決するため、情報理論に基づくタスク表現学習とTransformer型確率的世界モデルを統合したフレームワークを提案した。
原題: Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning / Fuyuan Qian, Menglong Zhang, Song Wang 他
日本語で読む → - 論文公正性/分類機械学習
独立操作を超えて:ピア模倣を考慮した個人公正性重視の戦略的分類
エージェントが特徴を操作して有利な判定を得る戦略的分類において、個人公正性を考慮し、周囲の承認されたピアを模倣する操作をモデル化する新しい枠組みを提案した。
原題: Beyond Independent Manipulation: Individual Fairness-aware Strategic Classification with Peer Imitation / Xinpeng Lv, Chunyuan Zheng, Yunxin Mao 他
日本語で読む → - 論文VLM/ベンチマーク画像認識
RoboStressBench: 身体化シーンにおける物理的視覚ストレスに対するVLMロバスト性のベンチマーク
視覚言語モデル(VLM)の実環境でのロバスト性を評価するため、物理的レンダリング方程式に基づき、視覚ストレスを材料・視点・照明・幾何の4次元に分解したベンチマークRoboStressBenchを提案した。
原題: RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes / Leyi Wu, Yifan Zhao, Jinjie Zhang 他
日本語で読む → - 論文ビデオ理解画像認識
ビデオ複雑度の属性ベース尺度
ビデオと質問のペアに対するビデオLLMの失敗確率として複雑度を定義し、参照データセットと属性語彙を用いて非パラメトリックに推定する新しい尺度VideoABCを提案した。
原題: An Attribute-Based Measure of Video Complexity / Aditya Sarkar, Yi Li, Zihao Wang 他
日本語で読む → - 論文共創AIAI
相互作用中心の知能:人間とAIの共創に関する相互作用ベースの理論に向けて
従来のAI研究が個体の計算に焦点を当ててきたのに対し、この論文は知能が相互作用から生まれると主張し、人間とAIの共創を分析する枠組み「相互作用中心の知能」を提案する。
原題: Interaction-Centered Intelligence: Toward an Interaction-Based Theory of Human-AI Co-Creation / Nicholas Davis
日本語で読む → - 論文制御理論制御
期待値最大化としての一般化モデル予測経路積分制御
MPPI制御を確率的最適制御の推論問題に対するEMアルゴリズムの特殊ケースとして解釈し、ガウス分布以外にも拡張した一般化フレームワークを提案し、収束性を解析した。
原題: Generalized Model Predictive Path Integral Control as Expectation--Maximization / Jiarui Wang, Sina Sharifi, Mahyar Fazlyab
日本語で読む → - 論文ベンチマークcs.SE
BlueFin: 財務スプレッドシートにおけるLLMエージェントのベンチマーク
財務専門家向けのスプレッドシート操作タスクを集めたベンチマークBlueFinを提案し、最先端LLMの性能が低いことを示した。
原題: BlueFin: Benchmarking LLM Agents on Financial Spreadsheets / Srivatsa Kundurthy, Clara Na, Colton Moraine 他
日本語で読む → - 論文ベンチマーク/地理的位置特定画像認識
ERGeoBench:マルチモーダル大規模言語モデルにおける身体化推論と地理的位置特定のための包括的ベンチマーク
身体化された地理的位置特定能力を評価する新しいベンチマークERGeoBenchを提案し、現在のMLLMが高レベルの地理的意味は推論できるが、細かい知覚や空間的一貫性に課題があることを示した。
原題: ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models / Kaiwen Xue, Tao Wei, Guoxin Zhang 他
日本語で読む → - 論文VLAAI
視覚言語行動モデルにおける閉ループ神経活性制御
視覚言語行動モデルのテスト時介入を固定係数から適応的な閉ループ制御に変え、タスク成功率と概念制御の安定性を向上させる手法を提案した。
原題: Closed-Loop Neural Activation Control in Vision-Language-Action Models / Abhijith Babu, Ramneet Kaur, Nathaniel D. Bastian 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
他者の夢を見る:マルチエージェント強化学習における世界モデル内の潜在チームメイトモデリング
協調型マルチエージェント強化学習において、チームメイトの内部方策や意図を世界モデル内で潜在変数としてモデル化し、心の理論ヘッドで推論することで、多様な協調相手への適応を可能にするアーキテクチャを提案した。
原題: Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning / Tomas Leroy-Stone
日本語で読む → - 論文強化学習機械学習
生存強化学習:スケーラブルな自己教師ありRLに向けて
自己教師ありの対比強化学習の限界を克服するため、目標状態での滞在時間を最大化する分類ベースの生存価値学習フレームワークを提案し、長期的な移動タスクで既存手法を2〜8倍上回る性能を達成した。
原題: Survival Reinforcement Learning: Toward Scalable Self-Supervised RL / Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard 他
日本語で読む → - 論文世界モデル機械学習
部分空間分解JEPA:潜在世界モデルにおける進行と内容の分離
JEPAの潜在表現を進行用と内容用の直交部分空間に分割し、制御性能と驚きの検出を向上させた。
原題: Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models / Lucas Thil, Jesse Read, Rim Kaddah 他
日本語で読む →