論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/9 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3D生成cs.GR
AniGen: アニメーション可能な3Dアセット生成のための統一的S^3フィールド
単一画像から、形状・骨格・スキニングを整合的に生成するアニメーション可能な3Dアセット生成フレームワークを提案した論文。
原題: AniGen: Unified $S^3$ Fields for Animatable 3D Asset Generation / Yi-Hua Huang, Zi-Xin Zou, Yuting He 他
日本語で読む → - 論文VLA画像認識
HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデル
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
原題: HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents / Tencent Robotics X, HY Vision Team, : 他
日本語で読む → - 論文強化学習機械学習
GIRL: 情報理論的幻覚制御による生成的想像強化学習
モデルベース強化学習において、想像上のロールアウトのドリフトを防ぐため、凍結された基盤モデルからのクロスモーダルな接地信号と不確実性適応型の信頼領域ボトルネックを導入した新しい潜在世界モデルフレームワークを提案した。
原題: GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control / Prakul Sunil Hiremath
日本語で読む → - 論文評価ベンチマーク画像認識
GameWorld: マルチモーダルゲームエージェントの標準化・検証可能な評価に向けて
ブラウザ環境で動作するマルチモーダル大規模言語モデル(MLLM)を汎用ゲームエージェントとして評価するためのベンチマークGameWorldを提案し、34種類のゲームと170のタスクを通じて、現状のエージェントが人間の能力に遠く及ばないことを示した。
原題: GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents / Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin 他
日本語で読む → - 論文機械学習の哲学機械学習
機械学習のレトリック
機械学習を修辞学の観点から分析し、それが中立ではなく説得の技術であると論じる。特に「操作のサービス化」というビジネスモデルを考察する。
原題: The Rhetoric of Machine Learning / Robert C. Williamson
日本語で読む → - 論文制御制御
ピボット式一方向アクチュエータを用いた実用的なユニバーサル追従制御
ピボット式一方向アクチュエータを搭載したロボット車両の追従制御問題を扱い、制約を考慮した制御則を設計して実用的な追従性能を保証する。
原題: Practical Universal Tracking With Pivoted Unidirectional Actuation / Ian J. Willebeek-LeMair, Craig A. Woolsey
日本語で読む → - 論文自動運転自然言語
ICR-Drive: 言語駆動型自動運転のための指示反事実ロバスト性評価
言語指示に基づく自動運転モデルが、言い換えや曖昧さ、ノイズ、誤解を招く指示などの変種に対してどれほど頑健かを評価する診断フレームワークを提案した。
原題: ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving / Kaiser Hamid, Can Cui, Nade Liang
日本語で読む → - 論文XR/アクセシビリティcs.CE
INTERACT: リアルタイム手話通訳と感情認識を備えたAI駆動の拡張現実フレームワークによるアクセシブルなコミュニケーション
聴覚障害者や多言語ユーザー向けに、XR環境で音声認識、手話アバター、多言語翻訳、感情認識を統合したAIプラットフォームを提案し、パイロット評価で高い満足度と精度を示した。
原題: INTERACT: An AI-Driven Extended Reality Framework for Accesible Communication Featuring Real-Time Sign Language Interpretation and Emotion Recognition / Nikolaos D. Tantaroudas, Andrew J. McCracken, Ilias Karachalios 他
日本語で読む → - 論文世界モデル機械学習
マルチトークン予測と潜在意味拡張による一貫した世界モデルの構築
LLMの内部世界モデルの一貫性を高めるため、マルチトークン予測(MTP)の理論的利点を分析し、構造的幻覚を防ぐ潜在意味拡張MTP(LSE-MTP)を提案した。実験で表現の整合性向上と幻覚低減を確認した。
原題: Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement / Qimin Zhong, Hao Liao, Haiming Qin 他
日本語で読む → - 論文相互作用生成画像認識
InfBaGel: 動的知覚と反復的洗練による人-物体-シーン相互作用生成
人-物体-シーン相互作用の生成を、動的なシーン変化を考慮しつつ、粗から精への反復的生成フレームワークで実現した。データ不足は疑似データ生成で補い、衝突回避のガイダンスも導入した。
原題: InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement / Yude Zou, Junji Gong, Xing Gao 他
日本語で読む → - 論文VLA/アンラーニング画像認識
VLA-Forget:身体化基盤モデルのための視覚言語行動アンラーニング
ロボット操作のためのVLAモデルから、安全でない・スプリアス・プライバシー関連の行動を除去するアンラーニング手法を提案。知覚・言語・行動の各層を段階的に更新し、不要な知識を忘れつつ有用な能力を保持する。
原題: VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models / Ravi Ranjan, Agoritsa Polyzou
日本語で読む → - 論文ナビゲーション画像認識
仮説グラフ精緻化:カスケード誤差修正を伴う仮説駆動探索による身体化ナビゲーション
本論文は、身体化エージェントのナビゲーションにおいて、フロンティア予測を修正可能な仮説ノードとして依存関係を考慮したグラフメモリに表現し、検証駆動のカスケード修正により誤ったサブグラフを刈り取るフレームワーク「HGR」を提案する。
原題: Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation / Peixin Chen, Guoxi Zhang, Jianwei Ma 他
日本語で読む → - 論文計画/世界モデル機械学習
潜在世界モデルを用いた階層的計画
視覚世界モデルを複数の時間スケールで学習し、長期モデルの予測を短期モデルのサブゴールとして利用する階層的MPC手法を提案。実機操作やシミュレーションで長期的タスクの成功率を向上させた。
原題: Hierarchical Planning with Latent World Models / Wancong Zhang, Basile Terver, Artem Zholus 他
日本語で読む → - 論文VLA画像認識
身体化AIのための加法的合成潜在行動の学習
視覚遷移から潜在行動を学習する際に、物理運動の加法的・合成的構造を強制するモデルAC-LAMを提案し、下流のポリシー学習の性能を向上させた。
原題: Learning Additively Compositional Latent Actions for Embodied AI / Hangxing Wei, Xiaoyu Chen, Chuheng Zhang 他
日本語で読む → - 論文制御機械学習
マルチタスク制御と適応のためのニューラルオペレータ
タスク記述から最適制御則への写像をニューラルオペレータで学習し、未見タスクや分布外設定への汎化と、軽量更新から全体微調整までの適応戦略を実現した。
原題: Neural Operators for Multi-Task Control and Adaptation / David Sewell, Xingjian Li, Stepan Tretiakov 他
日本語で読む → - 論文身体化知覚画像認識
動的環境における頑健な身体化知覚:分離重み融合によるアプローチ
実世界の動的環境での分布変化に頑健な身体化知覚のための、ドメインIDや過去データを必要としない段階的学習フレームワークを提案。環境スタイルの干渉を除去し、意味的特徴抽出を促す分離表現と、新旧知識をパラメータ空間で融合する重み融合戦略により、破滅的忘却を抑えつつ適応を実現。
原題: Robust Embodied Perception in Dynamic Environments via Disentangled Weight Fusion / Juncen Guo, Xiaoguang Zhu, Jingyi Wu 他
日本語で読む → - 論文継続学習機械学習
動的環境における自律AIエージェント学習のための適応メモリ結晶化
動的環境で継続的に学習するAIエージェントのために、記憶を液体・ガラス・結晶の3段階で安定化させる新しいメモリアーキテクチャを提案し、理論的保証と実験的評価を行った。
原題: Adaptive Memory Crystallization for Autonomous AI Agent Learning in Dynamic Environments / Rajat Khanda, Mohammad Baqar, Sambuddha Chakrabarti 他
日本語で読む → - 論文世界モデル/マルチエージェント画像認識
ActionParty: 生成ビデオゲームにおけるマルチサブジェクト行動バインド
ビデオ拡散モデルで複数のエージェントを同時に制御するための世界モデルを提案し、各被写体の状態トークンを導入して行動と被写体の対応を明確化した。Melting Potベンチマークで最大7プレイヤーを同時制御できる初のビデオ世界モデルを実証した。
原題: ActionParty: Multi-Subject Action Binding in Generative Video Games / Alexander Pondaven, Ziyi Wu, Igor Gilitschenski 他
日本語で読む → - 論文強化学習機械学習
非定常性で失われるランクと勾配:強化学習における可塑性損失を緩和するサンプル重み減衰
強化学習の可塑性損失をネットワーク最適化の理論的観点から分析し、勾配減衰を補正する軽量な手法「サンプル重み減衰」を提案した。
原題: The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning / Zihao Wu, Hongyao Tang, Yi Ma 他
日本語で読む → - 論文VLA画像認識
LatentUM: 潜在空間統合モデルによるインターリーブ型クロスモーダル推論の可能性を解き放つ
視覚理解と生成を共通の潜在空間で表現する統合モデルLatentUMを提案し、ピクセル空間を介さずに柔軟なクロスモーダル推論と生成を実現した。
原題: LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model / Jiachun Jin, Zetong Zhou, Xiao Yang 他
日本語で読む → - 論文セキュリティ/VLA画像認識
FlowHijack: フローマッチング型視覚言語行動モデルに対する動力学を考慮したバックドア攻撃
フローマッチング型VLAモデルのベクトル場動力学を標的とした初のバックドア攻撃フレームワークを提案し、ステルス性の高いトリガーで高い攻撃成功率を達成した。
原題: FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models / Xinyuan An, Tao Luo, Gengyun Peng 他
日本語で読む → - 論文データセット/物理推論画像認識
PhysInOne: 一つのスイートで実現する視覚物理の学習と推論
物理現象を捉えた大規模合成動画データセットPhysInOneを構築し、物理に基づく映像生成や将来予測、物理特性推定などの性能向上を示した。
原題: PhysInOne: Visual Physics Learning and Reasoning in One Suite / Siyuan Zhou, Hejun Wang, Hu Cheng 他
日本語で読む → - 論文模倣学習ロボティクス
人間のビデオからのロボット学習:サーベイ
ロボットが人間の行動ビデオからスキルを獲得する手法を包括的にレビューし、タスク・観察・行動指向の転移経路とデータ基盤を整理したサーベイ論文。
原題: Robot Learning from Human Videos: A Survey / Junyi Ma, Erhang Zhang, Haoran Yang 他
日本語で読む → - 論文VLA機械学習
明示的な物理的実現可能性はVLA学習に有効か?実証研究
拡散型VLAポリシーの訓練に幾何学的な実現可能性の監視を追加し、障害物回避操作タスクで物理的信頼性と性能が向上することを実証した。
原題: Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study / Yubai Wei, Chen Wu, Hashem Haghbayan
日本語で読む → - 論文模倣学習ロボティクス
LIDEA: 暗黙的特徴蒸留と明示的幾何学的整合による人間からロボットへの模倣学習
人間のデモ動画を利用してロボットの模倣学習を効率化するため、2D特徴蒸留と3D幾何学的整合を組み合わせたフレームワークLIDEAを提案した。
原題: LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment / Yifu Xu, Bokai Lin, Xinyu Zhan 他
日本語で読む → - 論文模倣学習ロボティクス
最良から学ぶ:模倣学習におけるデータ品質のための滑らかさ駆動メトリクス
軌道の滑らかさに基づいてデモンストレーションをスコアリングする軽量フレームワークRINSEを提案し、データ品質の低い軌道をフィルタリングすることで模倣学習の性能を向上させる。
原題: Learning from the Best: Smoothness-Driven Metrics for Data Quality in Imitation Learning / Soham Kulkarni, Raayan Dhar, Yuchen Cui
日本語で読む → - 論文制御制御
線形システムに対する強化学習とモデル予測制御の統合に関する系統的レビューと分類法
線形システムを対象に、強化学習とモデル予測制御の統合研究を系統的にレビューし、多次元の分類法を提案して設計パターンや課題を整理した論文。
原題: A Systematic Review and Taxonomy of Reinforcement Learning-Model Predictive Control Integration for Linear Systems / Mohsen Jalaeian Farimani, Roya Khalili Amirabadi, Davoud Nikkhouy 他
日本語で読む → - 論文VLA画像認識
LARY: 汎用視覚-行動対応のための潜在行動表現ベンチマーク
人間の行動ビデオから学習した潜在行動表現の能力を評価する統一ベンチマークを構築し、汎用視覚基盤モデルが専門の潜在行動モデルより優れ、潜在空間が物理行動空間とより良く整合することを示した。
原題: LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment / Dujun Nie, Fengjiao Chen, Qi Lv 他
日本語で読む → - 論文群制御制御
マルチロボットネットワークのための角度ベースの位置特定と剛性維持制御
マルチロボットネットワークにおいて、角度剛性と方位剛性の関係を明らかにし、分散型の角度ベース位置特定法と、ミッション実行中に角度剛性を維持する勾配ベースの制御器を提案した。
原題: Angle-based Localization and Rigidity Maintenance Control for Multi-Robot Networks / J. Francisco Presenza, Leonardo J. Colombo, Juan I. Giribet 他
日本語で読む → - 論文シミュレーション/自己中心視点画像認識
EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータ
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
原題: EgoSim: Egocentric World Simulator for Embodied Interaction Generation / Jinkun Hao, Mingda Jia, Ruiyan Wang 他
日本語で読む →