論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/20 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文医用画像認識画像認識
基盤表現を用いた文脈学習による手術解剖認識
手術映像における解剖構造の正確な認識を目的とし、大規模データセットATLAS-120kと、基盤モデルの埋め込みと軽量な時間推論を組み合わせたモデルATLASを提案した。
原題: Surgical Anatomy Recognition with Context Learning using Foundation Representations / Ronald L. P. D. de Jong, Tim J. M. Jaspers, Raf A. H. Vervoort 他
日本語で読む → - 論文異常検出機械学習
正常世界モデルの学習による少数ショット境界較正異常検出
正常なイベントから正常世界モデルを学習し、少数の異常例で境界を較正することで異常検出を行う手法を提案。ハイパーグラフとエントロピーに基づくエネルギー関数を用い、NASA C-MAPSSデータセットで高い性能を達成した。
原題: Learning a Normal World Model for Few-Shot Boundary-Calibrated Abnormality Detection / Weizhi Nie, Weichao Liu, Weijie Wang 他
日本語で読む → - 論文強化学習/探索機械学習
報酬なし事前学習:占有被覆最大化による強化学習
報酬が疎な環境で、報酬を使わずに探索ポリシーを事前学習し、下流タスクで迅速に適応する手法ROVERを提案。占有度のエントロピー最大化と仮想シンク状態で探索を促進する。
原題: Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization / Marco Pratticò, Pietro Novelli, Massimiliano Pontil 他
日本語で読む → - 論文AIセキュリティcs.CR
OVIG: 勾配信号によるAI学習完全性の楽観的検証
外部委託されたAI学習の完全性を、勾配差の経験的境界を用いて検証する楽観的フレームワークOVIGを提案。
原題: OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals / Hongxu Su, Jianzhu Yao, Huan Zhang 他
日本語で読む → - 論文ドメイン適応画像認識
VT-DUDA: 視覚トークン条件付けによる拡散誘導型教師なしドメイン適応
拡散モデルを用いた教師なしドメイン適応において、テキストプロンプトだけでなくソース画像の視覚トークンを条件付けに追加し、ターゲットスタイルの合成を改善する手法を提案。
原題: VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation / Xuan Qi, Daniele Berardini, Dario Serez 他
日本語で読む → - 論文行動認識画像認識
T-MOR: 動作を考慮した骨格表現の学習による人間行動認識
骨格系列から転移可能な行動表現を学ぶフレームワークT-MORを提案。ビデオと言語の教師信号で骨格表現を整列させ、軽量な骨格入力のみで高精度な行動認識を実現する。
原題: T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition / Di Yang, Mahmoud Ali, Quan Kong 他
日本語で読む → - 論文非視線計測physics.optics
任意形状の中継面を用いた3Dガウシアン過渡レンダリングによる非視線計測
平面壁や密なサンプリングを仮定せず、任意形状の中継面からの測定データを用いて隠れたシーンを3Dガウシアンで表現し、微分可能な過渡レンダリングで直接再構成する手法を提案。実データで最先端の精度を達成した。
原題: Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering / Yi Wang, Ziyu Zhan, Yuran Wang 他
日本語で読む → - 論文音楽生成cs.SD
LK Jam: ロール認識GRUを用いたリアルタイム人-AI対話型音楽生成システムのシステムアーキテクチャと実装
軽量GRUと高効率オーディオホストアーキテクチャを用いて、低遅延で双方向のリアルタイム音楽生成システムを構築した論文。
原題: LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU / Yakun Liu, Zhiyu Jin, Dong Liu 他
日本語で読む → - 論文言語モデル自然言語
大規模言語モデルにおける二項式の語順選好の行動的・表象的証拠
大規模言語モデルが言語的な二項式(例:men and women)の語順選好をどの程度捉えているかを、多言語データセットとプロービングを用いて分析し、モデルの内部表現が選好の強さを部分的に符号化していることを示した。
原題: Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models / Zhiqing Yang, Yilun Liu, Yunpu Ma 他
日本語で読む → - 論文3D再構築画像認識
φ-Scene: 物理的に基づいた画像から3Dシーンへの再構築
単一画像から3Dシーンを再構築する際に、物体の物理的安定性を考慮し、支持関係を推定して順に配置することで、浮遊や貫通などの物理的に不自然な再構築を防ぐ手法を提案した。
原題: $φ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction / Haodong Li, Lulu Shao, Haolin Lu 他
日本語で読む → - 論文画像フォレンジック画像認識
SARIF: 堅牢な画像フォレンジックのためのセグメント・アニシング
画像改ざん領域の特定を高精度かつ堅牢に行うため、Segment Anything Model (SAM) を活用したフレームワークSARIFを提案。フィードバック誘導型マスクデコーダとデュアルエンコーダ設計により、フォレンジック痕跡を捉えつつ自動で改ざん領域をセグメンテーションする。
原題: SARIF: Segment Anything for Robust Image Forensics / Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee
日本語で読む → - 論文ロボット学習/メモリ圧縮画像認識
観測履歴をエージェントメモリに圧縮:TransformerからリカレントTransformerへの蒸留
長い観測履歴を扱うロボット応用向けに、フル履歴Transformerの圧縮戦略をリカレントTransformerへ蒸留し、固定サイズメモリで性能ギャップを縮める手法を提案した。
原題: Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers / Philippe Weinzaepfel, Christian Wolf, Bülent Mert Sariyildiz 他
日本語で読む → - 論文セキュリティ/自動運転画像認識
BadDreamer: 自動運転向けビデオワールドモデルに対する転移可能なバックドア攻撃
自動運転のビデオワールドモデルに、特定のトリガー(黄色い配達ライダー)が現れると未来フレームで消えるように学習させるバックドア攻撃を提案し、下流の行動予測を危険な方向に誘導できることを示した。
原題: BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving / Zhe Shuai, Xiaopeng Xie, Yikun Zeng
日本語で読む → - 論文VLA画像認識
半教師あり視覚-言語-行動モデル
ロボットの行動予測に必要な教師付きデモデータを減らすため、未ラベルの軌道から信頼できる擬似行動を生成する自己蒸留型教師-学生フレームワークSemiVLAを提案した。
原題: Semi-Supervised Vision-Language-Action Model / Hongyang He, Jiuming Liu, Victor Sanchez
日本語で読む → - 論文強化学習機械学習
ベルマン方程式の逆転:Q値から世界モデルへ
価値ベースの強化学習エージェントが十分な報酬関数で訓練されると、暗黙的に環境の遷移モデルを符号化することを証明し、そのモデルを抽出するP学習を提案した。
原題: Inverting the Bellman Equation: From $Q$-Values to World Models / Alistair Letcher, Mattie Fellows, Alexander D. Goldie 他
日本語で読む → - 論文失敗検出機械学習
VLA-FAIL: 微調整された視覚言語行動モデルのための効率的なタスク失敗検出
視覚言語行動モデル(VLA)の実行時失敗を、失敗データを必要とせず軽量に検出するフレームワークを提案。最終層のマハラノビス距離と行動チャンクの一貫性という2つの検出器を組み合わせる。
原題: VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models / Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer 他
日本語で読む → - 論文LLM蒸留検出機械学習
参照ベースの蒸留検出によるLLMの教師モデル特定
大規模言語モデルが他のモデルから蒸留されたかを、参照チェックポイントとの比較に基づくメンバーシップ推論で検出する手法を提案し、単一教師蒸留ではほぼ完全な精度で教師を特定できることを示した。
原題: Reference-Based Distillation Detection in LLMs / Rajat Rawat, Sizhe Chen, Akshay Anand 他
日本語で読む → - 論文世界モデル機械学習
次の一歩を超えて:長期的計画のための可変長潜在世界モデル
可変長の行動系列に基づいて未来の潜在状態を予測する世界モデルを提案し、長期的計画における誤差蓄積を軽減した。
原題: Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning / Tianqi Du, Qi Zhang, Yifei Wang 他
日本語で読む → - 論文テキストから画像生成画像認識
ELDiff: 証拠学習とテキストから画像への拡散の融合
複数オブジェクトのテキストから画像生成において、セグメンテーションマップの不確実性と意味的競合を扱うため、証拠学習に基づく損失関数を導入し、オブジェクトごとの一貫性を強化する拡散モデルELDiffを提案した。
原題: ELDiff: When Evidential Learning Meets Text-to-Image Diffusion / Qingtao Pan, Kai Ye, Zhihao Dou 他
日本語で読む → - 論文データ生成画像認識
画像1枚で十分:テキストベース世界モデルによるエージェント型ワンショット画像生成と長尾空間知覚
単一の参照画像から、LVLMとLLMを用いて構造化シーン表現を構築し、拡散モデルで物理的に妥当な長尾データを生成するフレームワークWMGen-v1を提案した。
原題: One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception / Keqin Zeng, Shuting Su, Shihao Lin 他
日本語で読む → - 論文身体化事前学習画像認識
HumanScale: 身体中心の人間ビデオは実ロボットデータを凌駕する身体化事前学習の可能性
身体化基盤モデルの事前学習データとして、遠隔操作の実ロボット軌跡と身体中心の人間ビデオを比較し、適切なフィルタリングとラベリング処理を施した人間ビデオが実ロボットデータよりも優れた性能を示すことを発見した。
原題: HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining / Juncheng Ma, Jianxin Bi, Yufan Deng 他
日本語で読む → - 論文セキュリティ/3D物体検出画像認識
Mirage: LiDAR 3D物体検出に対するクリーンラベルバックドア攻撃
LiDAR 3D物体検出モデルに対して、ラベル改変を必要としないクリーンラベルバックドア攻撃を提案し、少量の毒サンプルで高い誤分類率を達成した。
原題: Mirage: a Clean-Label Backdoor against LiDAR 3D Object Detection / Ziba Parsons, Ang Li
日本語で読む → - 論文VLA画像認識
Occ-VLM: 占有度に基づく屋内シーン理解のための視覚言語モデル
2D画像のみから3Dシーン占有度を幾何学的先行情報として再構成し、前景トークンを3D空間に対応付けてLLMで理解する、統一的な3D視覚言語モデルを提案した。
原題: Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding / Jianing Li, Zhou Fang, Yijiang Liu 他
日本語で読む → - 論文ナビゲーションAI
自動対話拡張によるDialNavの性能向上
DialNavの訓練データ不足を解決するため、既存のVLNデータセットから自動で対話データを生成するパイプラインを提案し、大規模データセットRAINbowを構築。さらに、動的な対話ナビゲーションループに合わせた訓練手法とVLN知識を活用した位置推定モデルを導入し、成功率を大幅に向上させた。
原題: Advancing DialNav through Automatic Embodied Dialog Augmentation / Leekyeung Han, Sangwon Jung, Hyunji Min 他
日本語で読む → - 論文強化学習AI
報酬をエージェントとして捉える身体化ワールドモデルの学習
身体化ワールドモデルにおいて、報酬をエージェントとして能動的に評価する枠組みと、動的差分に基づく探索多様化手法を導入し、報酬ハッキングを抑えつつ多様な行動生成を可能にする強化学習手法を提案した。
原題: Reward as An Agent for Embodied World Models / Pu Li, Zhigang Lin, Qiang Wu 他
日本語で読む → - 論文世界モデル機械学習
感覚運動世界モデル:逆動力学による行動のための知覚
逆動力学正則化を導入した潜在世界モデルを提案し、表現の崩壊を防ぎつつ行動に関連する表現を学習することで、報酬なしの軌跡から効率的な計画を可能にする。
原題: Sensorimotor World Models: Perception for Action via Inverse Dynamics / Petr Ivashkov, Randall Balestriero, Bernhard Schölkopf
日本語で読む → - 論文VLA画像認識
FOCA: 未来指向型条件付けによるデータ効率的な視覚言語行動適応
視覚言語行動モデルの少数ショット模倣学習における性能低下を改善するため、未来の相互作用埋め込みと目標観察を活用した未来指向型条件付けフレームワークを提案した。
原題: FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation / Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen 他
日本語で読む → - 論文人型ロボット/動作生成AI
PhysDrift: 人型ロボットの共話動作生成における身体性ギャップの橋渡し
人型ロボットの共話動作生成において、人間中心のパイプラインが持つ身体性の不一致を特定し、それを解消するための新しいデータキュレーション手法と身体性を考慮した生成フレームワークを提案した。
原題: PhysDrift: Bridging the Embodiment Gap in Humanoid Co-Speech Motion Generation / Zhangzhao Liang, Xiaofen Xing, Mingyue Yang 他
日本語で読む → - 論文コンピュテーショナルイメージング画像認識
視覚推論ガイドによるライトフィールドからの遮蔽除去
ライトフィールド統合と視覚言語モデルの推論を組み合わせ、遮蔽物を除去してシーンを復元するフレームワークを提案。合成・実データで最高性能を達成した。
原題: Vision-Reasoning-Guided Occlusion Removal from Light Fields / Mohamed Youssef, Oliver Bimber
日本語で読む → - 論文モデル選択機械学習
少数クラス応用データセットのための効率的なニューラルネットワークモデル選択
実世界の多くは少数クラスであることに着目し、データ特性から分類難易度を測る指標を提案。これにより従来より6〜29倍高速にモデル比較ができ、小型モデルでも精度を保ちつつ効率化できることを示した。
原題: Efficient Neural Network Model Selection for Few-Class Application Datasets / Bryan Bo Cao, Abhinav Sharma, Lawrence O'Gorman 他
日本語で読む →