論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/20 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文計画/LLM機械学習
トランスフォーマーによる計画:計算の連鎖と構造化コンテキストウィンドウ
大規模言語モデルの計画能力の限界を克服するため、トランスフォーマーを反復ループ内で用いるChain of Computation(COC)アーキテクチャを提案し、構造化コンテキストウィンドウにより計画問題を高精度で解けることを示した。
原題: Planning with Transformers: Chain of Computation and Structured Context Windows / Ehsan Futuhi, Nathan R. Sturtevant
日本語で読む → - 論文3D再構成/逆レンダリング画像認識
FF-ProCams: プロジェクタ・カメラシステムのためのフィードフォワード3Dガウススプラッティング
プロジェクタ・カメラシステム向けに、スパースな多視点観測から再照明可能な3Dガウス表現を単一のフォワードパスで推定する逆レンダリングフレームワークを提案し、高精度かつ高速なレンダリングを実現した。
原題: FF-ProCams: Feed-Forward Gaussian Splatting for Projector-Camera System / Ziyao Wang, Yuqi Li, Wenxing Zheng 他
日本語で読む → - 論文3Dインスタンス分割画像認識
CDIS: 2Dマスク追跡と3D-2D投影マージによるクロス次元クラス非依存3Dインスタンス分割
2Dインスタンスマスクをフレーム間で追跡し、3Dスーパーポイントと関連付けることで、3D専用学習なしに一貫した3Dインスタンスラベルを生成するゼロショット手法を提案した。
原題: CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging / Juno Kim, Hye-Jung Yoon, Yesol Park 他
日本語で読む → - 論文強化学習機械学習
関係性を持つ隠れ状態による強化学習における創発的計画行動
モデルフリー強化学習において、環境状態に紐づく関係性を持つ隠れ状態のネットワークが、学習された関係を通じて計画機構を獲得することを示した論文。
原題: Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States / Armin Sommer
日本語で読む → - 論文VLAAI
PGN: 盤古マルチモーダル基盤モデルに基づく視覚言語ナビゲーションシステムの設計と実装
盤古マルチモーダル基盤モデルを用いたオフラインの視覚言語ナビゲーション行動予測システムを構築し、2段階の学習と8つのNPUでの実装により、専門家軌跡に対する行動一致率62.29%を達成した。
原題: PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model / Li Xian, Mingxi Li, Yizheng Wang 他
日本語で読む → - 論文LLMセキュリティcs.CR
適応的敵対者:LLMエージェントセキュリティのためのマルチターン・マルチLLMベンチマーク
LLMエージェントのセキュリティを評価するため、適応的なマルチラウンド攻撃を可能にする21シナリオのベンチマークを提案し、攻撃成功率がターン数に応じて大幅に上昇することを示した。
原題: Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security / Devina Jain, David Hartmann, Chuan Li
日本語で読む → - 論文画像改ざん検出画像認識
現代のVLMにおける強力な画素レベル画像改ざん検出のためのシンプルなドメイン一般化手法
現代のVLMによる画像編集に対応するため、バランスの取れたミニバッチサンプリングと後期注入戦略を用いたシンプルで効果的なドメイン一般化トレーニングフレームワークを提案し、画素レベルの改ざん検出性能とOOD堅牢性を大幅に向上させた。
原題: Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs / Yi Tang, Xinyi Shang, Jiacheng Cui 他
日本語で読む → - 論文画像改ざん検出画像認識
2D手がかりが不十分なとき:信頼できる3D幾何学による画像改ざん位置特定の改善
画像改ざん位置特定において、2Dの手がかりだけでは不十分な場合に、単眼再構成から得た深度と法線の信頼性を評価し、選択的に活用する幾何学認識フレームワークを提案した。
原題: When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry / Guofeng Yu, Zhiqing Guo, Dan Ma 他
日本語で読む → - 論文セグメンテーション画像認識
DA-Fusion: 変形可能アテンションに基づくRGB-D融合トランスフォーマーによる未知物体のインスタンスセグメンテーション
RGBと深度データを変形可能アテンションで融合するトランスフォーマーを提案し、物流のビンピッキング等の乱雑環境での未知物体のインスタンスセグメンテーション精度を向上させた。
原題: DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation / Yesol Park, Hye-Jung Yoon, Juno Kim 他
日本語で読む → - 論文群制御制御
強化学習による確率的多エージェントシステムの最適イベントトリガ分散制御
強化学習を用いて、確率的な不確かさを持つ多エージェントシステムの最適分散制御アルゴリズムを提案し、アクター・クリティック・識別器構造とイベントトリガ制御で通信頻度を削減する。
原題: On Optimal Event-Triggered Distributed Control for Stochastic Multi-Agent Systems via Reinforcement Learning / Ziming Wang, Bingbing Li, Karl H. Johansson 他
日本語で読む → - 論文LLMエージェントAI
報酬駆動型LLMエージェントワークフロー:POMDPルーティングと自己修正の統合による自律的意思決定
LLMエージェントの長期的計画と疎な報酬の問題を解決するため、POMDPルーティングと自己修正報酬モデルを統合したワークフローを提案し、ALFWorldとWebShopで成功率を大幅に向上させた。
原題: Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making / Amez Amanj Ali, Kuo-Kun Tseng
日本語で読む → - 論文深層フェイク検出画像認識
深層フェイク検出のための説明可能なFFTベース空間周波数融合フレームワーク
深層フェイク画像検出のため、空間特徴とFFTによる周波数特徴をクロスアテンションで融合するMSCA-FFTフレームワークを提案し、既存手法より高い性能を達成した。
原題: An Explainable FFT-Based Spatial-Frequency Fusion Framework for Deepfake Detection / Pamela Kirui, Cho Hyuk, Qingzhong Liu 他
日本語で読む → - 論文インタラクション認識画像認識
STAR: 骨格トークンの整列と再配置によるインタラクション認識
骨格系列とRGBビデオを共通の潜在空間で整列させ、骨格のみで動作する高精度な人-ロボット/人-人間インタラクション認識手法を提案した。
原題: STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition / Yuhang Wen, Mengyuan Liu, Zixuan Tang 他
日本語で読む → - 論文拡散モデル/手と物体のインタラクション/多視点生成画像認識
HarmoHOI: 多視点手と物体のインタラクション合成における外観と3Dモーションの調和
手と物体のインタラクション動画を多視点で生成する際に、3D点トラッキングを疑似動画として扱うことで外観と3Dモーションを同時に生成する統一拡散フレームワークを提案した。
原題: HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis / Lingwei Dang, Juntong Li, Zonghan Li 他
日本語で読む → - 論文3D編集画像認識
CNS-Edit++: 結合ニューラル形状表現によるカテゴリ非依存の3D編集
3D形状の編集を、大域的な意味情報と局所的な空間文脈を結合した表現の最適化として定式化し、カテゴリに依存しない編集を可能にするフレームワークを提案した。
原題: CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation / Jingyu Hu, Weilong Yan, Zhengzhe Liu 他
日本語で読む → - 論文顔偽造検出画像認識
InfoDense:メモリ効率の良い増分顔偽造検出のための密度認識型領域決定的リプレイ
増分顔偽造検出において、偽造痕跡が密集した領域を優先的に保存・再生するリプレイ戦略を提案し、限られたメモリでも破滅的忘却を軽減する。
原題: InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection / Jikang Cheng, Hao Shen, Xueyi Zhang 他
日本語で読む → - 論文画像編集/顔保護画像認識
クロスブランチ競合を盾に:統合マルチモーダル画像編集における顔アイデンティティ保護
統合マルチモーダルモデルによる無断の顔編集から身元を守るため、理解・生成の2ブランチの構造的整合性を崩す敵対的保護フレームワークCCSを提案した。
原題: Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing / Weiwei Tan, Junxian Li, Rui Wang 他
日本語で読む → - 論文モデルベース強化学習/安全制御機械学習
世界からのフィードバックから学ぶ:モデルベース強化学習においてモデルの不確実性がリスクシグナルとして機能しない理由
モデルベース強化学習の安全制御において、モデル内部の不確実性をリスク指標として使うと衝突率が悪化することを示し、センサー由来のマージンや衝突ラベルから学習したフィードバックモデルなど、世界からのフィードバック信号を用いることで衝突率を大幅に低減できることを実証した論文。
原題: Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL / Zhaohui Wang
日本語で読む → - 論文世界モデル/強化学習画像認識
PAVXploreRL: 行動探索を伴う物理・行動・視覚の世界モデル強化学習
事前学習済みの潜在世界モデルに強化学習を適用し、物理的妥当性・行動追従性・視覚的忠実性を明示的に最適化することで、専門家データ外の行動への汎化を改善する手法を提案した。
原題: PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration / Han Wang, Zijun Wang, Shuoshuo Xue 他
日本語で読む → - 論文モーション表現学習画像認識
MIME: マルチモーダル対話型モーションエンコーダ
二人の対話的な動きを言語と関連付けるための、専用のマルチモーダルエンコーダを提案した。
原題: MIME: Multimodal Interactive Motion Encoder / Addison Zucek, Prerit Gupta, Kamila Kuatova 他
日本語で読む → - 論文3D生成画像認識
Scene-SAM3D: 微調整不要の多視点シーン資産生成
単一画像から3Dオブジェクトを生成するSAM3Dを、キャリブレーション済みの多視点画像から3Dシーン資産を生成するフレームワークに拡張した。冗長な視点を削減しつつ、隠れた領域の情報を補完し、潜在速度融合と軽量なガウス最適化により高品質なシーンを生成する。
原題: Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning / Yuqi Zhang, Yadan Luo, Xiangyu Sun 他
日本語で読む → - 論文3D再構成画像認識
極端なモーションブラーを伴うスプラットベースの3Dシーン再構成
低照度環境で発生する極端なモーションブラーに対処するため、RGB-D入力とガウシアンスプラッティングを用いて、カメラ姿勢推定と画像デブラリングを同時に行う3Dシーン再構成手法を提案した。
原題: Splat-based 3D Scene Reconstruction with Extreme Motion-blur / Hyeonjoong Jang, Dongyoung Choi, Donggun Kim 他
日本語で読む → - 論文ニューロモーフィック/姿勢推定画像認識
ニューロモーフィックプロセッサ上でのロバストPnPによる物体姿勢推定
イベントカメラデータから物体の姿勢を推定するパイプライン全体をニューロモーフィックハードウェア上で実行可能にし、特に外れ値に頑健なPnP解法をスパイキングニューラルネットワークと組み合わせて実装した。Intel Loihi 2上でエネルギー効率の高さと精度の両立を示した。
原題: Robust PnP on a Neuromorphic Processor for Object Pose Estimation / Tam Ngoc-Bang Nguyen, Mohsi Jawaid, Tat-Jun Chin
日本語で読む → - 論文機械忘却/VLM画像認識
一つのモダリティを忘れる:視覚言語モデルにおけるクロスモーダル忘却の強化
視覚言語モデル(VLM)において、テキストと画像のどちらか一方のモダリティで機械忘却を行った際、その効果が他方にどの程度転移するかを体系的に調査し、非対称で不完全な転移を発見。さらに、転移ギャップを埋める影響ベースの手法CrossInfを提案し、攻撃耐性も向上させた。
原題: One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models / Sudharshan Balaji, Yili Ren, Guangjing Wang 他
日本語で読む → - 論文スタイル転送画像認識
OmniStyle-INR: インプリシットニューラル表現のための普遍的かつマルチモーダルなスタイル転送
画像、動画、3Dシーン、4Dダイナミクスなど様々なデータモダリティに対して、テキストや参照画像に基づくスタイル転送を実現する新しいフレームワークを提案した。
原題: OmniStyle-INR: Universal and Multimodal Style Transfer for INRs / Rafał Kajca, Michał Miziołek, Kornel Howil 他
日本語で読む → - 論文解釈可能性機械学習
検索だけで十分:ツール使用エージェントによる学習不要の解釈可能性
ニューラルネットワークの活性化を解釈する新しい手法HARPを提案。LLMエージェントが活性化データベースを検索し、仮説を立てて線形プローブで検証する。学習不要でありながら、既存の学習ベース手法を上回る性能を示した。
原題: Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent / Sriram Balasubramanian, Soheil Feizi
日本語で読む → - 論文VLAcs.DC
JoyNexus: VLAモデルのためのサービス指向マルチテナント後訓練
VLAモデルの後訓練を効率化するため、マルチテナント対応の統合サービスを提案。訓練・推論・環境サービスを分離し、APIで提供することで、リソース利用の効率化とコスト削減を実現。
原題: JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models / Haoran Sun, Wentao Zhang, Junyang Hua 他
日本語で読む → - 論文因果推論/バンディット機械学習
因果的バンディットのための情報指向サンプリング
操作不可能な変数を含む文脈因果バンディットに対して、トンプソンサンプリングと情報指向サンプリングの因果版を提案し、エントロピー依存の後悔境界を導出した。
原題: Information-Directed Sampling for Causal Bandits / Muhammad Qasim Elahi, Murat Kocaoglu, Mahsa Ghasemi
日本語で読む → - 論文安全制御制御
高次元マニピュレータの安全制御のための動的制約再構築に基づく制御バリア関数
外乱やモデル誤差がある高次元マニピュレータに対し、拡張状態オブザーバで外乱を推定し、その推定値に基づいて制御バリア関数の安全制約を動的に再構築する手法を提案。シミュレーションで安全性と追従性能の向上を確認した。
原題: Dynamic Constraint Reconstruction Based Control Barrier Functions for Safety-Critical Control of High-Dimensional Manipulators / Bingsheng Zhang, Shen Wang, Qiang Wang 他
日本語で読む → - 論文エージェント学習機械学習
再帰的ハーネス自己改善
エージェントの実行トレースを改善するために、ユーザー構築のハーネスを反復的に洗練する手法を提案し、低推論コストで性能を向上させる。
原題: Recursive Harness Self-Improvement / Hyunin Lee, Jinglue Xu, Jeffrey Seely 他
日本語で読む →