論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3D質問応答画像認識
ViewMind3D: モジュール型ビュー認識推論による学習不要の3D質問応答
3D再構成や追加学習を必要とせず、マルチビュー観測から3D空間推論を行う学習不要のフレームワークを提案。質問駆動のビュー選択、言語条件付き物体接地、鳥瞰図インジケータ、役割ベース推論の4モジュールで構成し、ScanQAとSQA3Dで競争力のある性能を達成した。
原題: ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA / Ping-Kun Chiang, Kun-Ru Wu, Po-han Li 他
日本語で読む → - 論文VLA画像認識
EgoGenesis: オンライン固定投影メモリとAction-3D RoPEによる自己中心的世界行動モデリング
自己中心視点の操作ビデオを合成する世界行動シミュレータを提案し、生成データで実ロボットの汎化性能を向上させた。
原題: EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE / Zexuan Yan, Yuzhou Wu, Yue Ma 他
日本語で読む → - 論文ニューロモルフィックコンピューティングcs.ET
ナノ粒子ネットワークによるニューロモルフィックコンピューティング
金属ナノ粒子と分子接合で構成されるネットワークを、静電制御電極により調整可能な非線形力学系として動作させ、ニューロモルフィック計算の性能を最大化する設計指針を提案した論文。
原題: Nanoparticle Networks for Neuromorphic Computing / Jonas Mensing, Wilfred G. van der Wiel, Andreas Heuer
日本語で読む → - 論文画像改ざん検出画像認識
視覚言語モデルは画像内のAI編集を推論できるか?
画像改ざん検出と位置特定のために、強化学習(GRPO)を用いて視覚言語モデルを訓練し、推論トレースを生成させてから判定させる手法を提案した。軽量なセグメンテーションモデルと組み合わせてピクセル単位のマスクを生成し、既存手法と同等の性能を達成した。
原題: Can Vision-Language Models Reason about AI Edits in Images? / Darsha Udayanga, Pin-Yu Chen, Payel Das 他
日本語で読む → - 論文データセット画像認識
ACE-Data-0: 人間中心の環境キャプチャによる具現化データエンジン
家庭環境を校正済みの録音スタジオに変えるデータ収集エンジンACEを提案し、多感覚データセットACE-Data-0を構築した。
原題: ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine / Yukang Cao, Haozhe Xie, Beichen Wen 他
日本語で読む → - 論文VLAAI
フローマッチング不確実性の幾何学:コスト不要の不確実性プロキシとフローベースVLA故障検出への応用
フローマッチング生成モデルの不確実性を速度場の幾何学的性質から捉え、追加コストなしで計算できる不確実性プロキシ(denoising acceleration)を提案し、オンライン故障検出に応用した。
原題: The Geometry of Flow-Matching Uncertainty: A Cost-free Uncertainty Proxy and Its Application in Flow-based VLA Failure Detection / Ziyang Rao, Yiren Zhao, Weiyu Guo 他
日本語で読む → - 論文ニューラルレンダリングeess.IV
Endo-NeRF++: 動的術野再構成のための不確実性を考慮したマルチ解像度ハッシュ符号化ニューラルレンダリング
動的な手術シーンの再構成精度を高めるため、マルチ解像度ハッシュグリッド符号化と時間的特徴融合、不確実性駆動の適応サンプリングを導入したニューラルレンダリング手法を提案した。
原題: Endo-NeRF++: Uncertainty-Aware Neural Rendering with Multi-Resolution Hash Encoding for Dynamic Surgical Scene Reconstruction / Gousia Habib, Laura Ruotsalainen
日本語で読む → - 論文データ削除/フェデレーション学習cs.NI
アンラーニングが失敗するとき:エージェントネットワークのポストトレーニングにおける信頼性の高いデータ削除
自己改善型フェデレーションエージェントネットワークで、削除要求されたデータが後の軌道に影響を残す「影響のこだま」問題を解決するため、MUTEという手法を提案し、LIBEROと実機で効果を検証した。
原題: When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks / Zihao Ding, Jun Huang, Liang Dong
日本語で読む → - 論文量子化/モデル圧縮AI
QuantWAMs: ワールドアクションモデルにおける適切な粒度でのキャリブレーション
ワールドアクションモデル(WAM)向けに、モデル構造・展開分布・タスク目的に合わせた量子化キャリブレーション手法を提案し、メモリ削減と精度維持を実現した。
原題: QuantWAMs: Calibrating at the Right Granularity for World Action Models / Jiacheng Zhou, Jinfan Lv, Ruixuan Li 他
日本語で読む → - 論文知識検索自然言語
EMBL AIライブラリアン:生命科学エージェントのための知識層
AIエージェントが自然言語で質問し、証拠を得られるように、Europe PMCのインターフェースを拡張する知識層を導入した。
原題: EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents / Luigi Sigillo, Matteo Silvestri, Francesco Tabaro 他
日本語で読む → - 論文テキストから画像生成画像認識
拡散モデルのアンカリングとステアリング:推論時のテキストから画像生成の忠実度向上
テキストから画像への拡散モデルにおいて、複雑なプロンプトとの整合性を高めるため、初期ノイズとノイズ除去軌道の両方を制御するトレーニング不要のフレームワークAnchorSteerを提案。
原題: Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time / Xinyi Wang, Yuyang Huang, Yalin Su 他
日本語で読む → - 論文LLMセキュリティcs.CR
ToxScreen: LLMが毒されているかを検出する
敵対者が訓練データにバックドアを仕込んだLLMを検出するためのベンチマークToxScreenを構築し、勾配ベースのプロンプト最適化は失敗するが、攻撃成功率で候補をランク付けするトークン探索が有効であることを示した。
原題: ToxScreen: Detecting Whether an LLM Has Been Poisoned / Anthony Hughes, Nicole Xing, Collin Francel 他
日本語で読む → - 論文映像生成画像認識
CineWeaver: トレーニング不要で参照制御可能なマルチショット長編映像生成による映画的ストーリーテリング
事前学習済みの動画拡散モデルを用いて、再学習なしで複数ショットからなる長編映像を生成する統一フレームワークを提案。位置エンコーディングとアテンション操作で時間的連続性を断ち、ショットごとの参照制御と長期記憶機構を導入した。
原題: CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling / Yuyang Huang, Yabo Chen, Wenrui Dai 他
日本語で読む → - 論文ビデオ生成画像認識
ビデオ表現正則化による複合誤差の軽減
ビデオ拡散ベースの世界モデルにおける自己回帰生成の誤差蓄積が、隠れ表現の次元崩壊と関連することを発見し、表現を安定化させる軽量な正則化手法を提案した。
原題: Mitigating Compounding Error via Video Representation Regularization / Taiye Chen, Qi Zhang, Yisen Wang
日本語で読む → - 論文進化ロボティクスcs.NE
VLMによる主観的評価を用いたアニマットの進化モデル
視覚言語モデル(VLM)による主観的評価を遺伝的アルゴリズムの適応度評価に組み込み、柔軟な形態と移動能力を持つ仮想ソフトロボットの形態と行動を同時進化させる枠組みを提案した。
原題: An evolutionary model of animats with VLM-based subjective evaluation / Shota Miyazaki, Takaya Arita, Reiji Suzuki
日本語で読む → - 論文強化学習機械学習
良いランカー、悪い目的関数:表現力豊かな方策探索下での双線形コントラスト批評家
コントラスト学習による批評家は行動のランキングには優れるが、そのスコアを最大化すると価値関数として不適切で、オフサポートの行動を選んでしまうことを示した論文。
原題: Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search / Ayushman Singh, Siddharth Aphale
日本語で読む → - 論文医療時系列予測機械学習
CalTwin:フィッシャー情報正則化による校正済みでシフトに頑健な医療ワールドモデル
医療ワールドモデルの信頼性を損なう共変量シフトと信頼度の不整合を、フィッシャー情報に基づくシフトペナルティと信頼度不整合ペナルティを組み合わせた単一の正則化目的で統一的に扱う手法を提案し、敗血症予測データセットで評価した。
原題: CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation / Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari 他
日本語で読む → - 論文LLMエージェント自然言語
LLMエージェントのためのファイルシステムベースメモリ:組織化、進化、持続可能性
LLMエージェントの長期記憶としてファイルシステムを用いる設定を体系的に調査し、組織化が検索コストを削減する一方、エージェントの能力限界を明らかにした。
原題: Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability / Sizhe Zhou, Sheldon Yu, Hui Wei 他
日本語で読む → - 論文ワールドモデルAI
CG-World: ワールドモデルのための大規模ワールド状態データセットとプロトコル
産業用CG制作パイプラインから派生した、状態・行動・イベント・観測を統合的に記録する大規模ワールド状態データセットとプロトコルを提案し、介入学習や反事実推論を可能にする。
原題: CG-World: A Large-Scale World-State Dataset and Protocol for World Models / Yiming Cai, Fangjie Yu, Meiqing Yu 他
日本語で読む → - 論文点群レジストレーション画像認識
R-SLPR: コントラスト学習を用いた領域ベースの小規模から大規模への点群レジストレーション
小規模で部分的な点群を大規模な参照点群に位置合わせする問題を、領域提案・領域マッチング・反復精緻化の3段階で解く新しいフレームワークを提案した。
原題: R-SLPR: Region-based Small-to-Large Point-cloud Registration with Contrastive Learning / Yusen Wan, Zeyuan Chen, Qianshi Zou 他
日本語で読む → - 論文群制御制御
連続時間一般化適応ベルマン-フォードアルゴリズムの完全分散特異点フリー所定時間安定化
分散型の最短経路問題を解くGABFアルゴリズムに対し、ユーザー指定時間内に収束する所定時間安定化制御を2つ提案し、ロボット経路計画で有効性を検証した。
原題: Fully distributed singularity-free prescribed-time stabilization of the continuous-time generalized adaptive Bellman-Ford algorithm / Yuanqiu Mo, Jian Qin, Soura Dasgupta
日本語で読む → - 論文強化学習機械学習
SCOUT: スパース報酬強化学習のための文脈別リセットカリキュラム
スパース報酬強化学習において、各タスク文脈に個別のリセットカリキュラムを適応的に与えるオンライン制御手法SCOUTを提案し、ナビゲーションや操作タスクで学習を改善することを示した。
原題: SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning / Siddharth Aphale, Ayushman Singh
日本語で読む → - 論文画像フォレンジック画像認識
FakeIDet3-DB:デジタル攻撃の精緻化とパッチ抽出による安全なIDベンチマーキング
実在の政府発行IDに対するデジタル改ざんデータベースを構築し、プライバシー保護を考慮したパッチ抽出アルゴリズムPACEを提案した。
原題: FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking / Muñoz-Haro Javier, Teruel Andres, Tolosana Ruben 他
日本語で読む → - 論文LLMエージェントAI
軌跡グラフを活用したエージェント型LLMシステムの実行前エラー診断
LLMエージェントの長期的なタスクにおけるエラーを事前に診断するため、過去の軌跡を確率的グラフとしてモデル化し、グラフニューラルネットワークで失敗に繋がる行動パターンを特定するフレームワークを提案した。
原題: Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems / Xu Zheng, Zhuomin Chen, Chaohao Lin 他
日本語で読む → - 論文3Dシーン生成画像認識
Genie Sim PanoWorld: パノラマシーン生成とシミュレーションによる無限屋内3Dワールド生成パイプライン
単一の360度パノラマ画像から、自由に移動可能な高忠実度3Dシーンを再構築する2段階のフィードフォワードパイプラインを提案。軌道制御可能なパノラマ動画を生成し、それを3Dガウシアンシーンに変換することで、シミュレーション用アセットとして利用可能にする。
原題: Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation / Yongxin Su, Linjie Hou, Feng Wang 他
日本語で読む → - 論文エッジAI/LLMエージェントstat.ML
短く考え、賢く委譲し、行動を繰り返す:エッジLLMエージェントのための校正済み推論と不確実性認識型委譲
エッジで動作するLLMエージェントの推論コストを削減しつつ信頼性を保つため、行動が安定したら推論を止めるプローブと、不確実な行動をクラウドに委譲するルールを組み合わせたフレームワークTSDSを提案し、4つのベンチマークで効果を検証した。
原題: Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents / Amirmohammad Farzaneh, Osvaldo Simeone
日本語で読む → - 論文群制御AI
STL-GOを用いた時空間・位相的制約を持つマルチエージェント計画
マルチエージェントの経路計画において、時空間的・位相的制約を扱う論理STL-GOを満たす計画を、MIPとSMTの2つのエンコーディングで解く手法を提案し、UAV探索救助ベンチマークで評価した。
原題: Multi-Agent Planning with Spatio-Temporal and Topological Constraints using STL-GO / Sheryl Paul, Vidisha Kudalkar, Anand Balakrishnan 他
日本語で読む → - 論文空間推論画像認識
意思決定が重要な用途におけるマルチモーダルLLMの説明可能でリソース効率的な空間推論
マルチモーダル大規模言語モデル(MLLM)の空間推論能力を向上させるため、深度情報に加えて物体間の空間関係を明示的な述語としてプロンプトに注入する訓練不要のフレームワークByDeWay-V2を提案した。
原題: Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications / Piyush Jain, Kousik Dasgupta, Rajarshi Roy 他
日本語で読む → - 論文VLAAI
CoTinyVLA: サブ10億パラメータの視覚言語行動モデルへの連鎖思考蒸留
0.9Bパラメータの小型VLAモデルを提案し、35B教師からの階層的CoT蒸留とパラフレーズ拡張により、LIBERO-Plusベンチマークで7Bモデルを上回るロバスト性を達成した。
原題: CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model / Minhyeok Lee, Chiyoung Kim, Chanhoe Gu 他
日本語で読む → - 論文パノプティックセグメンテーション画像認識
DVPSFormer: 自動運転のための効率的なオンライン深度対応ビデオパノプティックセグメンテーション
自動運転向けに、深度・セマンティックセグメンテーション・インスタンス追跡を統合したオンライン4Dシーン理解アーキテクチャを提案。明示的なシーン離散化とオンライン多数決により、リアルタイム処理を実現し、ベンチマークでSOTAを達成。
原題: DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving / Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li 他
日本語で読む →