論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/7 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/ナビゲーションAI
WNM-3D: 3Dシーン条件付けによるクローズドループVLNのための世界ナビゲーションモデル
連続的な視覚言語ナビゲーション(VLN)のための生成的世界行動モデルを提案し、3Dシーン表現を条件として将来の視覚と行動を同時生成することで、クローズドループのナビゲーション性能を向上させた。
原題: WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN / Yuehao Huang, Yunzi Wu, Xiaotao Zhang 他
日本語で読む → - 論文世界モデル機械学習
デュエリング・ワールドモデル:コモンモード外乱除去のためのアドバンテージ型アクションチャネル
潜在世界モデルにおいて、アクションの平均効果を差し引くことで、エージェントが制御しない動き(外乱)の影響を除去し、アクションの効果を明確に分離する手法を提案した。
原題: Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection / Jiazhuo Li, Yiming Fei, Zhiruo Zhou 他
日本語で読む → - 論文推論モデルAI
トランスフォーマーは創発的な世界モデルをうまく使えない:ハノイの塔の再訪と思考の錯覚
ハノイの塔の変種課題において、小規模トランスフォーマーは世界モデルを獲得するが、大規模推論モデルは表現が劣化して失敗することを示し、その因果関係を解明した論文。
原題: Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking / Devin Pereira, Willem Zuidema
日本語で読む → - 論文VLAロボティクス
StepTrigger:VLM搭載脚ロボットに対する接触状態トリガ型バックドア攻撃
脚ロボットの足裏圧力・接地パターンを隠しトリガとして学習させ、VLMプランナーの目標選択を密かに切り替えるバックドア攻撃を提案し、良性接触と悪性接触を選別する方策を評価した。
原題: StepTrigger: Contact-State-Triggered Backdoor Attacks on VLM-Powered Legged Robots / Jiageng Zhang, Doniyorkhon Obidov, Kaichen Yang
日本語で読む → - 論文世界モデル/長期予測機械学習
近視眼的な世界モデルを超えて:直接未来予測のための長期的エンドツーエンド学習
世界モデルの長期予測精度を高めるため、再帰的な展開を避け、任意長の行動系列を単一の埋め込みに圧縮して終点観測を一回で予測する非再帰的アーキテクチャDPWMを提案した。
原題: Beyond Myopic World Models: Long-Horizon End-to-End Training for Direct Future Prediction / Xinyi Li, Zaishuo Xia, Chenjie Hao 他
日本語で読む → - 論文VLAロボティクス
オンザフライVLN:空中ロボット向けオンボード視覚言語ナビゲーションスタック
視覚言語モデルによる指示の接地、深度による3D目標生成、Bスプライン計画、強化学習制御を分離したオンボードスタックを構築し、屋内飛行で目標到達を実証した。
原題: VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots / Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto 他
日本語で読む → - 論文ロボット学習ロボティクス
ワールドアクションモデルのための選択的クロスビュー整合性:テスト時カメラ情報なしでの未見視点ロバスト性
ロボットの行動生成モデル(ワールドアクションモデル)において、カメラ視点が変わっても動作が安定するよう、視点に依存しない座標だけに整合性損失を適用する手法を提案し、未見の視点での成功率を向上させた。
原題: Selective Cross-View Consistency for World Action Models: Held-Out Viewpoint Robustness Without Test-Time Camera Information / Bingqi Huang, Bingchuan Wei, Yingkai Cai 他
日本語で読む → - 論文検出・生成画像認識
ディープフェイクと合成メディア:生成・検出・ガバナンス
ディープフェイクの生成モデル(GAN、拡散モデル等)と、それらを見破るための検出手法(CNN、Transformer、周波数解析など)を体系的に整理し、評価方法や社会実装上の課題を概観したサーベイ。
原題: Deepfakes and Synthetic Media: Generation, Detection, and Governance / Alexandros Gazis, Efstathios Karypidis, Kleanthi Santamouri 他
日本語で読む → - 論文世界モデル画像認識
LAWM-3D: 人間のビデオから3D認識潜在アクションを学習し、汎用ロボット世界モデルを実現
人間のビデオから自己教師ありで3D認識可能な潜在アクションを学習し、ロボットの世界モデルを構築する手法を提案。マルチビュー入力の課題を解決するため、幾何学的整合性とRGB-D再構成を導入。
原題: LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models / Jiarui Yang, Jiale Zhange, Jiawei Li 他
日本語で読む → - 論文単一細胞解析機械学習
コホートハイジャック:コンパニオン細胞除去に対する単一細胞アノテーションの堅牢性
単一細胞アノテーションの精緻化が、対象細胞を変えずに周辺細胞の除去によって操作可能かどうかを検証し、攻撃手法とその影響を評価した。
原題: CohortHijack: Robustness of Single Cell Annotation to Companion Cell Removal / Arash Vashagh, Yasmin Vashagh
日本語で読む → - 論文音声映像生成画像認識
Vorch-Omni: 視覚と聴覚のマルチタスク統合オーケストレーション
音声と映像の生成・編集・参照合成を単一モデルで統一的に扱うマルチタスクフレームワークを提案し、条件付けマスクとタスク識別子により多様な入出力構成を柔軟に処理する。
原題: Vorch-Omni: Multi-Task Orchestration of Sight and Sound / Vorch Team, Xiaoyu Chen, Yang Ding 他
日本語で読む → - 論文群制御cs.NI
受動的な鏡から能動的なエージェントへ:ネットワーク上の物理AIのためのホロニックデジタルツイン
無線ネットワーク上で物理AIをリアルタイムに協調させるため、ホロニックデジタルツインのネットワーク(HDT-Nets)を提案し、能動推論と因果マルコフブランケットを用いて環境を能動的に推論する。
原題: From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks / Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad
日本語で読む → - 論文侵入検知cs.CR
自動車CANネットワークにおける教師なし侵入検知のための行動残差化
CANバスの各IDごとに正常な挙動からの残差を特徴量として抽出し、教師なし検知器の性能を向上させる手法を提案した。
原題: Behavioral Residualization for Unsupervised Intrusion Detection in Automotive CAN Networks / Chandan Hegde, Mukundh R Reddy
日本語で読む → - 論文ニューラルレンダリング画像認識
浮遊放射輝度ネットワーク
明示的なレイトレーシング可能なジオメトリと連続的なニューラル放射輝度関数を組み合わせた新しいニューラルシーン表現を提案し、インタラクティブなレンダリングや変形、編集を可能にした。
原題: Floating Radiance Networks / Krzysztof Byrski, Rafał Tobiasz, Grzegorz Wilczyński 他
日本語で読む → - 論文3Dシーン生成/強化学習AI
iARCS: 反復エージェント強化学習による制御可能な3Dシーン生成
事前学習済みの3Dシーン生成器を自然言語のタスク要件に適応させる反復エージェント強化学習フレームワークを提案。物理的妥当性とレイアウト品質を向上させつつ、タスク固有の制約(歩行可能性、到達可能性、クリアランス)を満たすシーンを生成する。
原題: iARCS: Iterative Agentic RL for Controllable 3D Scene Generation / Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel 他
日本語で読む → - 論文LLM制御機械学習
CircuitSteer: スパースオートエンコーダ回路による幾何学的に整列した多層ステアリング
大規模言語モデルの行動制御を改善するため、スパースオートエンコーダを用いて複数層にわたる意味回路を特定し、その特徴からステアリングベクトルを合成して多層介入を行う手法を提案した。毒性や拒否などのタスクで、既存手法より品質を保ちつつ効果的な制御を実現した。
原題: CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits / Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad 他
日本語で読む → - 論文協調学習/公平性/セキュリティcs.CR
Fairis: 公平性を考慮したアグリゲーションによる公平性ポイズニング攻撃への影響封じ込め
協調機械学習において、悪意あるクライアントによる公平性ポイズニング攻撃を防ぐため、各クライアントの更新に公平性スコアに基づく重み付けを行うサーバー側の再重み付け手法Fairisを提案し、理論的保証と実験評価を行った。
原題: Fairis: Fairness-Aware Aggregation with Provable Influence Containment against Fairness Poisoning Attacks in Collaborative Machine Learning / Devharsh Trivedi, Nesrine Kaaniche, Nikos Triandopoulos 他
日本語で読む → - 論文ワールドモデルAI
TaskSense: ワールドモデルにおいて重要なものに焦点を当てる
視覚制御のためのワールドモデルにおいて、タスクに関連する領域のみに注意を向ける確率的空間アテンション機構を導入し、逆動力学の補助損失で訓練することで、タスク無関係な背景の影響を抑えつつ、制御性能を向上させるフレームワークを提案した。
原題: TaskSense: Focusing on What Matters in World Models / SM Mazharul Islam, Manfred Huber
日本語で読む → - 論文医用画像解析eess.IV
網膜画像のアルゴリズム統計解析
OCT網膜画像の構造差を正規化圧縮距離(NCD)と異方性フィルタで定量化し、医師の視野測定値と照合して予測誤差約0.5dBを達成。非計量な深層学習より高精度で、緑内障進行の可視化にも応用した。
原題: Algorithmic statistics of retinal images / Loan Huynh, Ronald Zambrano, Layton Aho 他
日本語で読む → - 論文経済シミュレーションAI
経済エージェントからエージェント経済へ:経済世界モデルのためのシステム設計図
経済世界モデル(EWM)を構築するための実装ロードマップを提案し、エージェントの行動と市場・制度の相互作用から経済動学を生成するシステムを6段階の能力ラダーで整理した。既存研究のサーベイとリソース公開も行う。
原題: From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models / Jiale Han, Xiang Li, Jing Qian 他
日本語で読む → - 論文VQA/空間認識画像認識
GST-Bench: ビデオからVLMsはグローバルな空間認識を獲得できるか?
連続的な長期間ビデオからグローバルな空間認識を評価する新しいベンチマークGST-Benchを提案し、22の最先端VLMを評価した結果、人間との大きなギャップを明らかにした。
原題: GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? / Qifeng Zhang, Kaixiang Huang, Heng Dong 他
日本語で読む → - 論文エージェント自然言語
SkillZip: 契約保存型グラフ圧縮によるスケーラブルなエージェントスキルライブラリ
大規模言語モデルエージェントのスキルライブラリを、実行可能なまま圧縮するフレームワークSkillZipを提案。セクションレベルのグラフを契約を保って圧縮し、推論時に展開することで、圧縮率と依存関係の保持を両立する。
原題: SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries / Xingyu Tan, Xiaoyang Wang, Qing Liu 他
日本語で読む → - 論文物理シミュレーション/変形物体再構成画像認識
BendTwin: 曲げを考慮した微分可能なばね-質量モデルによるロバストな密から疎への物理再構成
ビデオ観測から変形物体の物理的特性を再構成するため、曲げ剛性と減衰を導入した微分可能なばね-質量モデルを提案し、従来の軸方向ばねのみの手法より安定した再構成と将来予測を実現した。
原題: BendTwin: Robust Dense-to-Sparse Physical Reconstruction with Bending-Aware Differentiable Spring-Mass Models / Yixiong Jing, Qi Wang, Lin Chen 他
日本語で読む → - 論文時系列分類機械学習
自己事前学習は医療時系列の診断改善に本当に有効か?
医療時系列データ(リハビリ、ストレス検出、パーキンソン病検出)において、Transformerモデルに対する自己事前学習の効果を体系的に評価し、精度が最大6ポイント向上することを示した。
原題: Is Self-Pretraining really useful to improve diagnosis in medical Time Series? / Omar Coser, Antonio Orvieto, Paolo Soda 他
日本語で読む → - 論文データセット画像認識
衛星画像の改ざんとディープフェイク位置特定のためのベンチマークデータセット構築に向けて
衛星画像の改ざん検出と位置特定のための、高品質なデータセットが不足している問題に対処するため、コピーペーストや拡散モデルによるインペインティングを含む改ざん画像と本物画像からなるプロトタイプデータセットを構築した。
原題: Towards a satellite image manipulation and deepfake localization benchmark dataset / Jacob Arndt, Debvrat Varshney, Philipe Dias 他
日本語で読む → - 論文LLM応用制御
大規模言語モデルによるリマニュファクチャリング自動化の変革:将来展望とケーススタディ
本論文は、循環経済におけるリマニュファクチャリング(再製造)の自動化に大規模言語モデル(LLM)を活用する可能性を探り、概念フレームワークReManGPTを提案し、3つのケーススタディでその実用性を示した。
原題: Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies / Chang Liu, Sara Behdad, Prabhakar Pagilla 他
日本語で読む → - 論文BMI/神経デコーディング機械学習
NeuroPB: 事前学習された行動表現による神経デコーディングのスケーリング
大規模な行動データから事前学習した運動エンコーダを神経活動に転移させ、限られたペアデータで神経信号から連続運動を高精度に再構成するフレームワークを提案。ロボット軌道での事前学習がマカク軌道と同等の性能を示し、データ規模拡大で性能が向上することを実証。
原題: NeuroPB: Scaling Neural Decoding with Pretrained Behavioral Representations / Luyao Jin, Yonghao Song, Huan Zhao 他
日本語で読む → - 論文エージェントシステム自然言語
EASy: 効率的なLLMベースのエージェントシステムを目指して
LLMベースのエージェントシステムの実行効率を向上させるため、強化学習を用いてタスク性能と計算コストを同時に最適化するフレームワークEASyを提案した。
原題: EASy: Towards Efficient LLM-Based Agentic System / Junnan Liu, Linhao Luo, Thuy-Trang Vu 他
日本語で読む → - 論文VLA/エッジ推論cs.AR
Deltoris: ビットレベル疎性と投機的推論による具現化AIのリアルタイムVLA推論の実現
拡散ベースのVLAモデルのエッジでの高速推論を実現するため、時間的類似性を利用したビット疎性アルゴリズムと投機的推論、専用アクセラレータを設計した。
原題: Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference / Zheng Liu, Zeyu Guo, Zihan Liu 他
日本語で読む → - 論文エージェント型制御/調理ロボット画像認識
大規模言語モデルをフロー制御に組み込む:適応的で信頼できる自動調理のためのエージェント型フレームワーク
調理ロボットのためのエージェント型フレームワークを提案し、ユーザーの個別化された調理要求を構造化された制御プログラムに分解して実行する。複数のAIエージェントが協調してレシピ生成、ワークフロー制御、実行コード生成を行い、実環境での信頼性と適応性を実証した。
原題: Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking / Zihan Song, Hongwei Huang, Yueshuo Sun 他
日本語で読む →