論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/15 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文教育AI自然言語
LectūraAgents: 適応型パーソナライズAI支援学習と身体化教育のためのマルチエージェントフレームワーク
教授エージェントが専門エージェントチームを率いて、学習者に合わせた講義内容を研究・計画・レビューし、身体動作を伴う教育を適応的に行うマルチエージェントフレームワークを提案した。
原題: LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching / Jaward Sesay, Yue Yu, Siwei Dong 他
日本語で読む → - 論文グラフ学習機械学習
TCHG: 信頼性の高い動的信頼予測のための三重信頼条件付き異種グラフ学習
信頼予測において、信頼証拠を3つのチャネル(エンティティ信頼性、相互作用行動信頼性、文脈的信頼)に分解し、それぞれ異なる機能をグラフ伝播に割り当てる新しいフレームワークTCHGを提案した。
原題: TCHG: Tri-Trust Conditioned Heterogeneous Graph Learning for Reliable Dynamic Trust Prediction / Bohao Liao, Boyu Deng, Qipeng Song 他
日本語で読む → - 論文時系列予測機械学習
Phys-JEPA: 物理情報を組み込んだ潜在世界モデルによる多変量時系列予測
物理法則を潜在状態に直接組み込んだ予測アーキテクチャを提案し、気候・交通・電力データで予測精度を向上させた。
原題: Phys-JEPA: Physics-Informed Latent World Models for Multivariate Time-Series Forecasting / Weizhi Nie, Weichao Liu, Honglin Guo 他
日本語で読む → - 論文VLA画像認識
ロボット操作コマンド生成のためのオブジェクト中心映像理解の分離
映像デモからロボット操作コマンドを生成する際、動作認識と物体識別を分離し、タスク関連物体を特定する新しい手法を提案。TSMと物体選択アルゴリズムを統合し、精度と汎化性を向上させた。
原題: Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands / Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang 他
日本語で読む → - 論文デジタルツイン制御
サイバーフィジカルシステム向けサンドボックス対応デジタルツイン
制御器の未変更バイナリをLinuxサンドボックスで実行し、外部プラントシミュレータと接続する閉ループデジタルツインを構築。内部実行とプラント状態を同期記録し、脆弱性検出やテストの基盤を提供する。
原題: Sandbox-Enabled Digital Twin for Cyber-Physical Systems / Meet Udeshi, Md Raz, Prashanth Krishnamurthy 他
日本語で読む → - 論文強化学習機械学習
方向条件付きポリシー:構成部分ゴールスコアリングによるオンライン目標条件付き強化学習
目標までの距離の勾配のみに依存する方向条件付きポリシーを提案し、オンライン目標条件付き強化学習の性能を向上させた。
原題: Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning / Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan 他
日本語で読む → - 論文ロボット制御ロボティクス
実ロボット5球ジャグリングのためのタスク誤差残差学習
方向性のあるタスク誤差を教師信号とする残差学習と、タスク誤差モデルによるサンプル選択を組み合わせ、人間型アームでの3〜5球ジャグリングを安定して実現した。
原題: Task-Error Residual Learning for Real-Robot Five-Ball Juggling / Kai Ploeger, Jan Peters
日本語で読む → - 論文VLA画像認識
セマンティックフリップ:身体化質問応答と空間定位における堅牢な拒否のための合成OOD生成
視覚言語モデルが回答不能なクエリに対して過信する問題を解決するため、クエリとビデオメモリを独立に変換してOODペアを合成し、軽量な拒否モジュールを訓練するフレームワークを提案した。
原題: Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization / Dongbin Na, Chanwoo Kim, Giyun Choi 他
日本語で読む → - 論文動作計画ロボティクス
HOLO-MPPI: 階層的方策最適化によるマルチシナリオ動作計画
オフラインで学習した高レベル方策をMPPIのサンプリング事前分布として用い、多様なシナリオで頑健な動作計画を実時間で行うフレームワークを提案した。
原題: HOLO-MPPI: Multi-Scenario Motion Planning via Hierarchical Policy Optimization / Youngjae Min, Jovin D'sa, Faizan M. Tariq 他
日本語で読む → - 論文変形物体/物理モデル/一人称視点画像認識
EgoPhys: 一人称視点動画から変形物体の汎用的物理モデルを学習する
一人称視点のRGB動画のみから変形物体の物理デジタルツインを構築するフレームワークを提案し、未知物体へのゼロショット一般化を実現した。
原題: EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video / Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang 他
日本語で読む → - 論文画像編集画像認識
ResEdit: 精密な生成的画像編集のための残差埋め込み
拡散画像生成モデルを反転により編集に応用し、残差画像エンコーディングを追加条件として最適化することで、画像の同一性保持と編集可能性を両立させる手法を提案した。
原題: ResEdit: Residual embeddings for precise generative image editing / Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy 他
日本語で読む → - 論文LLMエージェント自然言語
ACCORD: 言語エージェントのための行動条件付き文脈接地
ユーザー指示は暗黙の前提を含むため、LLMエージェントが環境情報を能動的に取得・統合して行動するフレームワークACCORDを提案し、タスク成功率を大幅に向上させた。
原題: ACCORD: Action-Conditioned Contextual Grounding for Language Agents / Lai Jiang, Cheng Qian, Zhenhailong Wang 他
日本語で読む → - 論文ヒューマノイド操作/VLA/強化学習ロボティクス
ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
原題: ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning / Wei Xiao, Weiliang Tang, Yuying Ge 他
日本語で読む → - 論文操作学習ロボティクス
R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
原題: R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies / Xiuwei Xu, Haowen Sun, Angyuan Ma 他
日本語で読む → - 論文IoT/センサ制御
GreenBox: リアルタイム通知SMSを備えた自動交通事故検知システムのプロトタイピング
Arduino UnoとGSMモジュールを用いて、衝突・横転・浸水を検知し、事故時にSMSで通知するIoTベースの交通事故検知システムのプロトタイプを開発した。
原題: GreenBox: Prototyping of an Automatic Road Accident Detection System with Real-Time Notification SMS / Júlio Rocha, Salviano Soares, António Valente 他
日本語で読む → - 論文プランニングロボティクス
ロボットはいつ再計画すべきか?時間変動MDPにおける後悔に基づく更新スケジューリング
非定常環境で動作するロボットが、限られた計算予算の中でいつ再計画すべきかを、後悔(リグレット)理論に基づいて決定する手法を提案した論文。
原題: When Should a Robot Replan? Regret-Guided Update Scheduling in Time-Varying MDPs / Negin Musavi, Gokul Puthumanaillam, Ruben Hernandez 他
日本語で読む → - 論文LLM評価自然言語
AuAu: 大規模言語モデルにおける権威主義的整合性の監査のためのベンチマーク
大規模言語モデル(LLM)の応答における権威主義的傾向を評価する包括的なベンチマーク「AuAu」を提案し、17モデルを評価して権威主義的応答率やシステムプロンプトによる操作可能性を明らかにした。
原題: AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models / Andreas Einwiller, Max Klabunde, Florian Lemmerich
日本語で読む → - 論文3D再構成/データセット画像認識
MVM-IOD: 3D再構成手法の評価のための産業用オブジェクト中心ベンチマークデータセット
産業用ロボットアームでカメラを動かして撮影した産業部品の画像と基準カメラ姿勢・点群を含むデータセットを新たに構築し、既存の3D再構成・姿勢推定手法を評価した。
原題: MVM-IOD: An Industrial Object-Centric Benchmark Dataset for the Evaluation of 3D Reconstruction Methods / Robert Langendörfer, Markus Hillemann, Markus Ulrich
日本語で読む → - 論文モデルベース強化学習機械学習
BRICKS-WM: インターフェース合成力学による構造化世界モデルの再利用性構築
モデルベース強化学習において、環境ダイナミクスをエージェントと背景のモジュールに分離し、学習済み背景モジュールを再利用可能にする構造化世界モデルフレームワークを提案した。
原題: BRICKS-WM: Building Reusability via Interface Composition Kinetics for Structured World Models / Shaowei Zhang, Jiahan Cao, Xunlan Zhou 他
日本語で読む → - 論文視覚グラウンディング画像認識
必要なときだけ集中:適応的ルーティングと協調グラウンディングによる学習不要の視覚グラウンディング
複雑な高解像度画像中の細部認識が苦手なMLLMに対し、サンプルの難易度に応じて処理を適応的に割り当てる学習不要のフレームワークLazyMCoTを提案。簡単なクエリは高速に処理し、難しいケースにはモデルの注意機構と外部視覚専門家を組み合わせた2段階精緻化で正確な局所領域を生成する。
原題: Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding / Yifan Wang, Peiming Li, Shiyu Li 他
日本語で読む → - 論文最適化ロボティクス
弾性ODYN:ロボティクスにおける実行不可能な制御と学習のための微分可能最適化
制約が矛盾する実行不可能な二次計画問題を、滑らかな弾性緩和を用いて解く微分可能なQPソルバーを提案し、制御や学習タスクでの安定性を向上させた。
原題: Elastic ODYN: Differentiable Optimization for Infeasible Control and Learning in Robotics / Aristotelis Papatheodorou, Jose Rojas, Ioannis Havoutis 他
日本語で読む → - 論文姿勢推定画像認識
既知の3Dモデルが無い点群からの回転対称性に基づく物体姿勢推定
3Dモデルが利用できない工業部品の点群から、回転対称性を活用して姿勢と点群を同時に最適化し、姿勢推定を行う手法を提案した。
原題: Rotational Symmetry based Object Pose Estimation from Point Clouds in the Absence of Known 3D Models / Weichen Dai, Ruixun Yu, Yangjie Tang 他
日本語で読む → - 論文操作ロボティクス
PATCH: アクションチャンク条件付き潜在パッチ革新監視によるロボット操作
ロボット操作中に予期しない局所的な環境変化を検出し、介入と復帰を行うための監視手法を提案。
原題: PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation / Yanan Zhou, Ranpeng Qiu, Yincong Chen 他
日本語で読む → - 論文VLA/圧縮画像認識
視覚言語行動モデルのための学習型画像圧縮
VLAロボットの制御性能を保ちつつ帯域を節約するため、カメラ視点や空間領域ごとの重要度に応じてビットレートを適応配分する学習型画像圧縮フレームワークSPARCを提案した。
原題: Learned Image Compression for Vision-Language-Action Models / Hyeonjun Kim, Jegwang Ryu, Sangbeom Ha 他
日本語で読む → - 論文視覚オドメトリ画像認識
MVOFormer: ロバストな単眼視覚オドメトリのためのフロー意味トランスフォーマー
単眼視覚オドメトリのための新しいトランスフォーマーフレームワークを提案し、幾何学的動きと意味情報を融合して動的物体を区別し、ゼロショット汎化性能を向上させた。
原題: MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry / Jituo Li, Shunwang Sun, Jialu Zhang 他
日本語で読む → - 論文世界モデル/ビデオ生成画像認識
Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
原題: Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation / Jie Zhang, Xiaoyue Chen, Anzhe Chen 他
日本語で読む → - 論文模倣学習/計画機械学習
FlowMPC: ワールドモデルによるフローマッチングポリシーの改善
フローマッチングによる模倣学習ポリシーに学習済みワールドモデルを組み合わせ、テスト時にMPPI計画を行うFlowMPCを提案し、操作タスクで成功率を向上させた。
原題: FlowMPC: Improving Flow Matching policies with World Models / Chandon Hamel
日本語で読む → - 論文VLA/検索拡張ロボティクス
再学習せずに検索せよ:テスト時に視覚言語行動モデルを新タスクへ拡張する手法
新しいタスクへの適応を、モデルの再学習ではなく、デモンストレーションの検索で置き換える手法を提案。凍結したポリシーが検索した軌跡を条件付けに使い、タスク追加をパラメータ更新なしで実現する。
原題: Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time / Jeongeun Park, Juhan Park, Taekyung Kim 他
日本語で読む → - 論文深度推定画像認識
自己教師あり単眼ビデオ深度推定のための3D一貫性最適化
ビデオフレームを独立に扱う従来法の問題を解決するため、深度推定を多視点3D再構成問題として捉え、3D一貫性最適化フレームワークを導入した。画像レベルのフォトメトリックレンダリング、ワールド座標の幾何学的整合、多スケール時間勾配一貫性の3つの制約でフレームを統一的に最適化し、自己教師あり学習とゼロショット臨床環境で最先端の精度を達成した。
原題: 3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation / Yuanye Liu, Ke Zhang, Junzhe Jiang 他
日本語で読む → - 論文歩行ロボティクス
LoComposition: 歩容事前知識なしの地形適応型・高エネルギー効率四足歩行
報酬設計をタスク・制約・エネルギー最小化・地形適応に分離し、歩容の事前知識なしで効率的な四足歩行を実現。実機Go2でゼロショット転送に成功し、コスト・オブ・トランスポートを56%削減した。
原題: LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors / Loukas Kordos, Leonard T. Franz, Simon Rappenecker 他
日本語で読む →