論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/10 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
Mambaベースの選択的状態空間モデリングがSmolVLA視覚言語行動エキスパートの精度-計算量トレードオフを改善
VLAモデルの精度と計算量のトレードオフを改善するため、SmolVLAの行動エキスパートにMambaの選択的状態空間モデリングを適用し、LIBEROベンチマークで長い実行ホライズンでの成功率向上を実証した。
原題: Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts / Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani 他
日本語で読む → - 論文VLA/空間推論画像認識
空間思考の連鎖:視覚言語モデルのためのモダリティ非依存の空間接地
追加の推論時モジュールを必要とせず、連続的な空間トークンを導入して視覚言語モデルの空間推論能力を向上させる軽量フレームワークを提案した。
原題: Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models / Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian 他
日本語で読む → - 論文世界モデル機械学習
評価プロトコルが結果を決める:LeWorldModelのTwoRoomにおける独立再現
LeWorldModelのTwoRoom環境での結果を独立に再現し、評価プロトコルの違いが結果を大きく左右することを示した。
原題: The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom / Joyjeet Singh
日本語で読む → - 論文LLM推論自然言語
検証器なしテスト時スケーリングのためのコンシリエンス
既存の信頼度ベースの検証器なしテスト時スケーリング手法が複雑なタスクで破綻することを示し、初期の低信頼度から最終的な高信頼度への遷移パターンを評価する新しい選択フレームワーク「コンシリエンス」を提案した。
原題: Consilience for Verifier-Free Test-Time Scaling / Lecheng Kong, Like Hui, Haitao Mao 他
日本語で読む → - 論文手術フェーズ認識機械学習
幻覚と制約:精度を超えた手術ワークフロー認識の規制
医療画像処理におけるAIの幻覚問題を、トポロジー誤差として定義し、線形時相論理と確率的グラフィカルモデルで制約を課すことで、手術フェーズ認識の精度を約10%向上させつつ誤差を大幅に削減する手法を提案した。
原題: Hallucinations and Constraints : Regulating surgical workflow recognition beyond accuracy / John S. H. Baxter, Pierre Jannin
日本語で読む → - 論文エージェントアーキテクチャAI
CEAA: インタラクティブコンピューティングシステムのための認知的身体化エージェントアーキテクチャ
本論文は、Sense-Think-ActパラダイムとBelief-Desire-Intentionモデルを基盤とした、モジュール式の認知アーキテクチャを提案し、インタラクティブな3D仮想環境で動作する身体化された知的仮想エージェントの実装を容易にすることを目指している。
原題: CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems / Aimilios Hadjiliasi, Louis Nisiotis
日本語で読む → - 論文バイオメトリクス画像認識
眼周辺領域のソフトバイオメトリクス:調査とマルチメディアフォレンジクスおよび偽情報検出への応用
眼周辺領域の画像から性別・年齢・民族などの属性を推定する技術を総覧し、監視映像や合成メディア検出などのフォレンジクス応用と課題を整理した論文。
原題: Periocular Soft Biometrics: A Survey and Applications to Multimedia Forensics and Disinformation Detection / Fernando Alonso-Fernandez, Kevin Hernandez-Diaz, Josef Bigun
日本語で読む → - 論文人間-シーンインタラクション画像認識
人間とシーンのインタラクションのための効率的な接触表現
人間と環境の接触情報をスパースなマスクで表現し、計算を高速化しつつ精度も向上させる手法を提案した論文。
原題: Efficient Human-Contact Representation for Human-Scene Interaction / Nghia Vu, Tuong Do, Binh X. Nguyen 他
日本語で読む → - 論文世界モデル最適化AI
VERDI: 継続的な世界モデル最適化における検索は転移ではない
事前学習済み世界モデルをユーザー指定の目的に最適化する際、過去の成功戦略をそのまま再利用するのではなく、対象モデルでの実験検証を経て初めて転移可能な知識とする継続的フレームワークVERDIを提案。最適化指紋と検証機構により探索コストと負の転移を大幅に削減した。
原題: verdi: retrieval is not transfer for continual world model optimization / Junyu Wu, Shiqin Nie, Youyi Kou 他
日本語で読む → - 論文世界モデル機械学習
ツイン・ロールアウト:対話型ビデオ世界モデルにおけるノイズ結合型反事実分岐
この論文は、ビデオ世界モデルが生成した軌道に対して、行動を変えた場合の反事実的な生成を研究し、ノイズ結合による正確な反事実生成と検証可能な評価指標を提案している。
原題: Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models / Yu Ma, Hongli Shi, Xinran Xu
日本語で読む → - 論文医療データ処理画像認識
グリッドはイベントを消し去ったのか?医療ワールドモデルパイプライン監査のためのEndoClock
医療データを固定レートのグリッドに同期する前処理が、タスクに必要な証拠を消し去る問題を指摘し、証拠がどこに残るかを分類する監査手法EndoClockを提案した。
原題: Did the Grid Erase the Event? EndoClock for Auditing Medical World-Model Pipelines / Yarin Udi, Tom Sharon-Shahak, Roee Masad 他
日本語で読む → - 論文SLAM画像認識
大規模シーン再構成のためのローカルからグローバルへのループクロージャを備えたマルチサブマップ暗黙的ニューラルSLAM
NeRFベースのSLAMを大規模環境に拡張するため、マルチサブマップ構造と二段階のループクロージャ機構を導入し、記憶爆発を防ぎつつ高精度な再構成とロバストな位置推定を実現した。
原題: Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction / Tianchen Deng, Chongdi Wang, Nailin Wang 他
日本語で読む → - 論文映像超解像画像認識
MotionCraft: スパース注意機構を用いた潜在世界モデリングによる映像高精細化
動きを考慮した潜在状態予測と適応的スパース注意機構を組み合わせた映像超解像フレームワークを提案し、高品質で時間的に一貫した再構成を実現した。
原題: MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling / Rong Fu, Chunlei Meng, Yangchen Zeng 他
日本語で読む → - 論文報酬モデルAI
TrustRoboReward: 選好順序付き等調スコア編集によるマルチパラダイムロボット報酬モデル
ロボット操作の強化学習における報酬モデルのボトルネックを解決するため、ペアワイズ選好とビデオQAを統合したマルチパラダイム報酬モデリングフレームワークを提案し、スコアと選好の矛盾を等調回帰で解消する。
原題: TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models / Yidong Wang, Yan Zhan, Ziteng Feng 他
日本語で読む → - 論文3Dシーン補完画像認識
RayLift: 3D幾何学事前知識を用いた相補的なレイ単位証拠のリフティングによるセマンティックシーン補完
カメラベースの3Dセマンティックシーン補完において、ステレオ深度の不確実性を考慮し、レイ単位の証拠を適応的にサンプリング・重み付けすることで、高精度な3D構造復元を実現するフレームワークを提案した。
原題: RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion / Meng Wang, Hongxia Yu, Wenzhe He 他
日本語で読む → - 論文世界モデル画像認識
人口規模にスケーラブルなマルチエージェント世界モデリング
エージェント数に依存しない共有世界状態と統一レンダリングインターフェースを導入し、推論時にエージェント数を任意に拡張できるマルチエージェント世界モデルKhoraを提案した。
原題: Population-Scalable Multi-Agent World Modeling / Renjie Zhao, Yuxiang Wu, Mingyu Zhang 他
日本語で読む → - 論文ナビゲーション画像認識
360CityArena: 具身エージェントのための現実的な仮想都市ナビゲーションベンチマーク
360度動画から構築した写実的な都市環境で、具身エージェントの都市探索能力を評価するベンチマークを提案。人間と最先端モデルの性能差が大きいことを示した。
原題: 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents / Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa 他
日本語で読む → - 論文VLSI/省電力cs.AR
Eco-SoC:エネルギー比例型人工知能のための持続可能なVLSIアーキテクチャ
エッジAI向けに、活性化スパース性に応じてビット精度を動的に調整し、消費電力を削減するVLSIアーキテクチャを提案。カーボンフットプリントと寿命も評価し、持続可能性を追求している。
原題: Eco-SoC: A Sustainable VLSI Architecture for Energy-Proportional Artificial Intelligence / Jatin Chopra
日本語で読む → - 論文計画/強化学習AI
多様な計画ポリシーの発見:品質多様性最適化によるマルチモーダル具現化エージェント
マルチモーダル具現化エージェントのための多様な計画ポリシーを品質多様性最適化で発見し、行き詰まり時に別のポリシーへ切り替えることでタスク成功率を向上させる。
原題: Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization / Pengfei Xu, Yong Liu, Xiaoya Nan 他
日本語で読む → - 論文VLA/空間理解画像認識
回復から低下へ:アクション事後学習がVLMの後層深度デコード可能性を減少させる仕組み
VLA構築のためのアクション事後学習が、VLMの空間理解(特に深度知覚)をどのように劣化させるかを、層ごとのプローブで分析した論文。後層のMLP干渉が主因であることを特定した。
原題: From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability / Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou
日本語で読む → - 論文マルチモーダル検出画像認識
証拠に基づく法医学的推論によるマルチモーダルメディア改ざんの検出と位置特定
画像とテキストのクロスモーダル改ざんを検出し、その根拠となる証拠の位置を特定する新しいフレームワークを提案。推論の透明性を高め、証拠と結論の整合性を強制する手法を導入した。
原題: Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation / Yichun Yeh, Yiheng Li, Xiaobo Hu 他
日本語で読む → - 論文生成モデル機械学習
二次のドリフトモデル
生成モデルの一種であるドリフトモデルを二次の力学系に拡張し、フーリエ空間での加速的な収束を実現する手法を提案した。合成データ、時系列、ロボット制御で性能を検証している。
原題: Second Order Drifting Models / Drake Brown, Yuhao Huang, Shih-Hsin Wang 他
日本語で読む → - 論文手術ロボティクス/カメラ制御AI
SurgLAT: 深度認識ロボット腹腔鏡制御のための外科的潜在注意追跡
本論文は、動的な手術シーンにおける外科医の意図を潜在的な注意状態として追跡し、自律的な腹腔鏡カメラ制御を行うフレームワークSurgLATを提案する。凍結DINOv3エンコーダと状態条件付きトークンミキサーを用いて注意をモデル化し、RCM制約を考慮したロボット展開を実現する。
原題: SurgLAT: Surgical Latent Attention Tracking for Depth-Aware Robotic Laparoscope Control / Rulin Zhou, Qiujie Song, Yujie Ma 他
日本語で読む → - 論文3D追跡画像認識
EgoTrack3D: 自己中心視点3D物体追跡のためのモジュラーフレームワーク
自己中心視点のRGBビデオから動的な3Dシーン表現を再構築・維持するモジュラーフレームワークを提案し、静的・動的物体の持続的な3D追跡を実現した。
原題: EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking / Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang 他
日本語で読む → - 論文シミュレーションAI
Lingjing: オープンエンドな都市におけるマルチエージェント具現化タスクのためのシミュレーションテストベッド
異種エージェント(UAV、地上ロボット、自動運転車)が協調する都市環境を再現するシミュレーションプラットフォームを提案し、12の視覚言語モデルを9つの都市タスクで評価した。
原題: Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities / Xiaohe Li, Yiru Wang, Junhao Fan 他
日本語で読む → - 論文LLM評価/道徳推論AI
CORDA:大規模言語モデルにおける階層的・危害中心の道徳推論のベンチマーク
道徳原則が衝突する状況での優先順位付け能力を評価するベンチマークCORDAを提案し、10の指示チューニング済みLLMが直接的な危害回避を優先する傾向などを明らかにした。
原題: CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models / Siddarth Singh, Victoria Williams, Simon Rosen 他
日本語で読む → - 論文画像スタイライゼーション画像認識
原点を守る:スムーズな遷移を伴う連続画像スタイライゼーション
本論文は、画像の内容を保ちながらスタイルを連続的に制御できるスタイライゼーション手法を提案する。2段階の訓練戦略とスタイル強度を考慮したスプライン補間により、離散的な強度レベルから連続的なスタイル操作を実現する。
原題: Staying True to the Origin: Continuous Image Stylization with Smooth Transitions / Rui Xu, Hanmo Zhang, Songhua Liu
日本語で読む → - 論文VLAAI
Capek 0.5: 実行中心の視覚言語モデルによる具現化知能
ロボットの実行プロセスに着目し、空間推論・時間理解・行動誘導・状態検証の4つの能力を専門家モデルで学習し、統合する視覚言語モデルCapek 0.5を提案した。
原題: Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence / Ying Chen, Weizhen Li, Zhe Hu 他
日本語で読む → - 論文メモリ/長期エージェントAI
MemPrism: 長期的エージェントのためのタスク条件付き関係メモリビュー
長期タスクのエージェント向けに、経験を永続的に保存しつつ、現在のタスクに応じて動的に関係性を構築するメモリフレームワークを提案。固定表現による表現ミスマッチを解消し、長い軌跡での性能向上とメモリ消費削減を実証。
原題: MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents / Zhisheng Chen, Bingfan Zeng, Bangde Cao 他
日本語で読む → - 論文ビデオ生成画像認識
ビデオワールドモデルのためのアドレス可能なメモリ
インタラクティブなビデオワールドモデルで、長いロールアウト中に過去のフレームを正確に参照できない問題を解決するため、トレーニング不要のメモリフレームワークWorldTraceを提案。圧縮メモリに仮想位置を割り当ててアドレス可能性を保ち、新しいベンチマークLoopBenchで性能を検証した。
原題: Addressable Memory for Video World Models / Xindi Wu, Sven Elflein, James Lucas 他
日本語で読む →