論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/9 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3D再構成画像認識
StereoSplat+:拡散支援型プログレッシブ推論によるフィードフォワードステレオガウシアンスプラッティング
単一のステレオペアから高品質な3Dガウシアンシーンを再構成するため、フィードフォワード推定器と拡散モデルによる反復的な視点補完を組み合わせた手法を提案した。
原題: StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference / Zihua Liu, Masatoshi Okutomi
日本語で読む → - 論文熱画像/物理推定画像認識
熱画像を超えて:時間分解熱観測からの熱物性推定
熱画像の時間変化から、シーンの熱拡散率などの熱物性を推定するフレームワークThermoFieldを提案。ニューラル場と微分可能な熱伝導シミュレーションを統合し、幾何・熱物性・温度変化を同時に再構成する。
原題: Beyond Thermal Imaging: Inferring Thermophysical Properties from Time-Resolved Thermal Observations / Chenghao Xu, Malcolm Mielle, Olga Fink
日本語で読む → - 論文敵対的攻撃/防御画像認識
敵対的デコイ:ViTにおける注意ベース防御の誤誘導
Vision Transformerの注意スコアに基づく防御を欺くため、独立に最適化した画像パッチ(デコイ)を導入し、注意を標的トークンへ向けさせる手法を提案した。
原題: Adversarial Decoys: Misdirecting Attention-Based Defenses in ViT / Giulia Marchiori Pietrosanti, Giulio Rossolini, Giorgio Buttazzo
日本語で読む → - 論文世界モデル機械学習
ハミルトニアンビデオ力学モデルにおける時間的一般化の実現
固定ステップで訓練された世界モデルの時間解像度の一般化問題を、ハミルトニアン生成ネットワークの連続時間エネルギー関数に基づいて解決し、訓練外の時間ステップでも安定した予測を実現する手法を提案した。
原題: Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models / Eli Laird, Corey Clark
日本語で読む → - 論文動作予測画像認識
3D認識LLMによる自己中心視点の人間動作予測
自己中心視点の映像と3Dシーン特徴から、将来の動作と説明文を同時に予測する新しいモデルEgo3DLMを提案。3D空間理解と言語生成を統合し、単一の自己回帰パスで姿勢と言語を相互に接地させる。
原題: Ego-Human Motion Prediction with 3D-Aware LLM / Yujin Bae, Jaewoo Jeong, Hyeonseong Kim 他
日本語で読む → - 論文継続学習画像認識
生涯表現:視覚モデルのための継続的自己教師あり学習に関するサーベイ
ラベルなしデータの連続的な流れからモデルを適応させる継続的自己教師あり学習(CSSL)の包括的なサーベイを提供し、評価プロトコル、忘却防止戦略の分類、今後の課題を整理した。
原題: Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models / Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen 他
日本語で読む → - 論文全身動作生成画像認識
GIRAF: 関節物体との汎用的な人間インタラクションの実現
関節を持つ物体との全身インタラクションを生成するテキスト条件付き拡散モデルを提案し、物体中心表現と混合ドメイン学習、接触ベースのデータ拡張により未見の物体構成への汎化を実現した。
原題: GIRAF: Towards Generalizable Human Interactions with Articulated Objects / Xiaohan Zhang, Sebastian Starke, Alexander Winkler 他
日本語で読む → - 論文ディープフェイク検出画像認識
AI改変動画検出のためのアンサンブル深層学習アプローチ
音声と映像の両方を分析するマルチモーダルなディープフェイク検出システムを構築し、複数モデルのアンサンブルにより汎化性能を向上させた。
原題: Ensemble Deep Learning Approaches for AI-Altered Video Detection / Laiba Khan, Hung-Mao Wu, Wei Lin 他
日本語で読む → - 論文強化学習機械学習
強化学習エージェントにおける障害様表現型のトランス診断空間
強化学習エージェントに認知評価信号を操作して7つの心理障害(不安、躁病、強迫性チェック、うつ、衝動性、依存症、PTSD)を誘発し、用量反応関係や障害間の相互作用を分析した研究。
原題: A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents / Hari Prasad
日本語で読む → - 論文VLA画像認識
具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリング
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
原題: Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence / Shuailei Ma, Jiaqi Liao, Xinyang Wang 他
日本語で読む → - 論文模倣学習AI
フィードバック操作正則化:模倣学習におけるオフラインエージェントのアライメントを可能にする
評価フィードバックを補正信号として利用し、模倣学習ポリシーのアライメントを改善するアルゴリズム非依存の手法FMRを提案し、Safety Gymnasium環境で最大98%の不整合削減を実証した。
原題: Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning / Benjamin Poole, Minwoo Lee
日本語で読む → - 論文動画生成画像認識
SparseCtrl-HOI: 人間と物体のインタラクション動画生成のためのスパース時間制御
人間と物体のインタラクション動画生成において、少数のキーフレームと高レベルな動作プリエントのみを用いて、物理的に妥当な遷移を生成するスパース時間制御フレームワークを提案した。
原題: SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation / Shenbo Xie, Mingrui Cai, Xu Yang 他
日本語で読む → - 論文ワールドモデルAI
ワールドモデルの定義とロードマップ
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
原題: A Definition and Roadmap for World Models / Xinyuan Chen, Haoyu Guo, Shi Guo 他
日本語で読む → - 論文需要応答/サイバーセキュリティ機械学習
需要応答は敵対的データ改ざんによるサイバー攻撃への脆弱性を高めるか?
電力価格予測モデルへの敵対的攻撃が産業用需要応答の意思決定に与える影響を分析し、攻撃によって需要応答の利益が減少するが、検出困難な範囲では約90%の利益が維持されることを示した。
原題: Does Demand Response Increase Vulnerability to Cyber Attacks by Adversarial Data Modifications? / Clemens Kortmann, Eike Cramer
日本語で読む → - 論文VLA機械学習
検証済みコード世界モデルによるワールドタイム計算
ドメインのダイナミクスをコードとして記述し、多数の検証可能な世界モデルから生成した軌道データでLLMを微調整することで、未学習の世界への汎化性能を大幅に向上させる手法を提案。
原題: World-Time Compute with Verified Code World Models / James Schwoebel, Ingrida Semenec, Jenia Rousseva 他
日本語で読む → - 論文世界モデル機械学習
ランク1のコーナー:タスクは世界モデルからどれだけの価値等価性を必要とするのか?
世界モデルの品質はタスクが依存する予測座標(クロージャ)によって決まることを示し、訓練目的の次元数がクロージャの表現に与える影響をDreamerV3で測定した。
原題: The Rank-One Corner: How Much Value Equivalence Does a Task Need from a World Model? / Donna Vakalis
日本語で読む → - 論文溶接ロボット/セグメンテーション画像認識
建設現場の自動溶接ロボット向け転移学習によるシーム分割精度向上:BiSeNetV2の限界克服
反射や照明変動に弱い溶接シーム分割を、転移学習とハイブリッド損失関数で改善し、軽量なまま高精度を実現した。
原題: Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network / Keonvin Park, Yong Ann Voeurn, Hyeokjun Kweon 他
日本語で読む → - 論文ステレオマッチング画像認識
URS-Stereo: 不確実性ガイドによる残差探索を用いたリアルタイムステレオマッチング
粗密ステレオマッチングの伝搬視差の不確実性を予測し、探索範囲を適応的に移動させることで、誤った伝搬によるマッチング失敗を防ぎ、リアルタイム性を保ちつつ精度を向上させるフレームワークを提案した。
原題: URS-Stereo: Uncertainty-Guided Residual Search for Real-Time Stereo Matching / Pouya Sohrabipour, Chaitanya kumar reddy Pallerla, Dongyi Wang
日本語で読む → - 論文通信セキュリティcs.IT
6Gセンシングセキュリティ:都市ビームフォーミングと攻撃者検出のための分散ゲーム理論RL
6Gの統合センシング・通信(ISAC)環境で、ビームフォーミングを操作する攻撃者を検出するため、ゲーム理論と強化学習を組み合わせた手法を提案し、シミュレーションで有効性を示した。
原題: 6G Sensing Security: Distributed Game-Theoretic RL for Urban Beamforming and Attacker Detection / Parmida Geranmayeh, Onur Günlü
日本語で読む → - 論文エッジAI/イベントビジョン画像認識
組み込みイベントベースビジョンのためのハードウェア認識型グラフニューラルネットワーク枝刈り
イベントカメラ用のグラフ畳み込みニューラルネットワークを、FPGAなどの組み込みプラットフォームに適応させるため、ハードウェア認識型の枝刈りと量子化を提案し、メモリ使用量と精度のトレードオフを最適化した。
原題: Hardware-aware Graph Neural Networks prunning for embedded event-based vision / Piotr Wzorek, Kamil Jeziorek, Tomasz Kryjak
日本語で読む → - 論文ビデオ生成画像認識
AlayaWorld: 長時間・プレイ可能なビデオワールド生成
ゲームワールドを自動生成するためのフルスタックのオープンソースフレームワークを提案し、リアルタイムでのインタラクションと多様なアクションを可能にする。
原題: AlayaWorld: Long-Horizon and Playable Video World Generation / AlayaWorld Team, Kaipeng Zhang, Chuanhao Li 他
日本語で読む → - 論文空間知能/都市規模再構築画像認識
WildCity: 実世界の都市規模テストベッド - レンダリング、シミュレーション、空間知能のための
自律走行車両が収集した都市規模のマルチモーダルデータセットを構築し、都市全体の3D再構築とクローズドループシミュレーションのベースラインを確立した。
原題: WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence / Xiangyu Han, Mengyu Yang, Jiaqi Li 他
日本語で読む → - 論文グラフィックデザイン編集cs.GR
StructuredEdit: 制約を考慮したグラフィックデザイン編集のための微分可能パラメータ伝播
デザイン編集をピクセル生成ではなくパラメータ操作として捉え、微分可能ラスタライザを通じて制約違反を逆伝播させる学習法を導入し、制約充足率を大幅に向上させた。
原題: StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation / Veeramanohar Avudaiappan, Ritwik Murali
日本語で読む → - 論文VLA/強化学習機械学習
大規模視覚言語行動モデルにおける効率的かつ汎用的な強化学習のためのオフライン教師信号の活用
オフライン教師信号を強化学習に組み込むことで、OOD性能を保ちつつ学習効率を約2倍に向上させるハイブリッド手法を提案・評価した。
原題: Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models / Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov
日本語で読む → - 論文視覚事前学習画像認識
高密度空間知覚のための視覚事前学習
境界線と形状の不連続性に着目した自己教師あり学習「マスク境界モデリング」を提案し、深度推定などの空間知覚タスクで性能を向上させる視覚基盤モデルLingBot-Visionを開発した。
原題: Vision Pretraining for Dense Spatial Perception / Zelin Fu, Bin Tan, Changjiang Sun 他
日本語で読む → - 論文VLA画像認識
CanvasAgent: 視覚ツールのオーケストレーションによる複雑な画像生成・編集の実現
複雑な画像生成・編集を、複数の視覚ツールを順次呼び出すマルチモーダルエージェントで実現する。大規模データセットと強化学習でツール選択を学習する。
原題: CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration / Hairui Zhu, Yiying Yang, Tengjin Weng 他
日本語で読む → - 論文LLM安全性自然言語
遡及的思考連鎖(RetroCoT):モデル世代を横断する安全診断としての法医学的再構築プロンプト
大規模言語モデルの安全性評価が、直接的な有害要求だけでなく、法医学的再構築という別の語用論的枠組みでも突破されることを示し、新たな攻撃手法RetroCoTを提案した。
原題: Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations / Samira Hajizadeh
日本語で読む → - 論文LLM解釈性自然言語
知識は知っている、言語化は語る:LLMにおける数学的可解性の潜在方向の解きほぐし
LLMの内部表現から、数学問題の可解性に関する知識と言語化を別々にプローブし、捏造が主に言語化の変化に起因することを示し、活性化ステアリングで棄権を改善した。
原題: Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs / Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos
日本語で読む → - 論文確率推論stat.ML
ベイジアンネットワークの分解:局所推論と並列推論
高次元ベイジアンネットワークの推論を、有向凸部分グラフと最小d分解木を用いて低次元の部分モデルに分解し、計算コストを削減して並列計算を可能にする手法を提案した。
原題: Decomposition for Bayesian Networks: Local and Parallel Inference / Pei Heng, Xinyi Hu, Yi Sun
日本語で読む → - 論文ワールドモデル画像認識
表現オートエンコーダを用いたマルチプレイヤー対話型ワールドモデル
複数エージェントの行動を条件付けし、動的な物理環境をリアルタイムで生成する初のマルチプレイヤーワールドモデルを提案。ロケットリーグの10,000時間のゲームプレイで訓練し、5億パラメータの潜在拡散モデルが4人対戦を毎秒20フレームで生成する。
原題: Multiplayer Interactive World Models with Representation Autoencoders / Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary 他
日本語で読む →