論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/5 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
報酬構造が強化学習におけるエピソード探索と神経記憶の相互作用を形成する
部分観測強化学習において、探索ボーナスと記憶アーキテクチャの相互作用を制御された環境で調査し、報酬の構造(密度ではなく)がその相互作用パターンを決定することを示した。
原題: Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning / Jai Malegaonkar, Rohan Patil, Henrik I. Christensen
日本語で読む → - 論文ロボット操作画像認識
Faster-WAM: ロバストな世界行動モデルのための効率的な推論時未来条件付け
世界行動モデル(WAM)の推論時における未来条件付けの重要性を示し、計算コストを抑えつつ未来表現を活用する効率的なフレームワークFaster-WAMを提案した。
原題: Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models / Weiheng Zhao, Haoyi Jiang, Xin Shi 他
日本語で読む → - 論文LLMエージェント自然言語
State2State: 環境から導出された中間学習によるLLMエージェントの訓練
外部タスク指定なしに環境との相互作用のみでエージェントを訓練する手法を提案。探索した環境状態を目標状態に変換し、ルールベースの状態一致で検証することで、スケーラブルで検証可能な訓練目標を提供する。
原題: State2State: Environment-Derived Mid-Training for LLM Agents / Xuanyu Lei, Yiqi Zhu, Chenliang Li 他
日本語で読む → - 論文量子機械学習画像認識
相関特徴を最適化したCNN-QNNハイブリッドモデルによる画像分類
CNN特徴の相関を量子ニューラルネットワーク(QNN)に適した中間値に調整することで、画像分類精度を向上させるハイブリッドモデルを提案した。
原題: Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features / Minseo Seong, Youngwook Kim
日本語で読む → - 論文認知モデル機械学習
自閉症における同一性への固執のエントロピー的説明
情報理論に基づく枠組みを用いて、自閉症における同一性への固執を、驚きと不確実性を減らそうとする一般的な行動パターンの一例として説明する。
原題: An entropic explanation of insistence on sameness in autism / Przemysław Śliwiński
日本語で読む → - 論文ワールドモデル/強化学習AI
WorldCycle: 長期的ビデオワールドモデルのための自己検証型強化学習
可逆なアクションサイクルを用いて、長期的な正確性を検証する自己教師あり強化学習フレームワークを提案し、ワールドモデルのドリフトを大幅に低減した。
原題: WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models / Bohai Gu, Yueyang Yuan, Taiyi Wu 他
日本語で読む → - 論文3Dシーン理解画像認識
SmartMage: 3Dシーン理解のための動的モダリティ編成
3Dシーン理解において、クエリに応じて必要なモダリティを動的に選択するMLLMを提案し、固定のモダリティ組み合わせによるノイズや計算浪費を改善した。
原題: SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding / Yue Zhang, Yingzhao Jian, Yunqiu Xu 他
日本語で読む → - 論文深度推定画像認識
スパース直接ToFセンサからの高密度メトリック深度補完
直接ToFセンサのスパースでノイズの多い深度測定から、RGB画像を活用して高密度で正確なメトリック深度を推定するフレームワークを提案。多様なセンサタイプやスパース度に対応し、シミュレーションパイプラインで訓練データ不足を解決。
原題: Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors / Hakyeong Kim, Ruicheng Wang, Chengtang Yao 他
日本語で読む → - 論文世界モデル機械学習
量子構造世界モデル(QSWM)による予測的潜在ダイナミクス
量子理論に着想を得た複素数表現や密度行列型の潜在状態を用いた世界モデルを提案し、セルオートマトン上で古典的ベースラインと比較して予測性能を評価した。
原題: Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics / Hailong Jiang, Emran Hossain, Feng Yu 他
日本語で読む → - 論文アルゴリズム監査機械学習
欺瞞的なモデル提供者に対する操作耐性のある oblivious 監査
監査対象のモデルに問い合わせる際、どのデータが監査に使われるかを隠すことで、提供者が公平性指標を操作するのを困難にする新しい監査プロトコルを提案した。
原題: Manipulation-Proof Oblivious Audits against Deceptive Model Providers / Augustin Godinot, Sofiane Azogagh, Julien Ferry 他
日本語で読む → - 論文市場操作検出q-fin.TR
速度とレジームを考慮した日中オプション市場操作の検出と説明可能な帰属
市場操作の動的シグネチャ(ポンプ・アンド・クラッシュパターン)を状態速度で捉え、SHAPによる説明可能な検出パイプラインを構築した。インドのBANKNIFTYオプションで10/10の操作日を検出し、米国株への転移でもAUC 0.91を達成した。
原題: Velocity- and Regime-Aware Detection of Intraday Options Market Manipulation, with Explainable Attribution / Alex Chen, Maria Hybinette
日本語で読む → - 論文医用画像/異常検出画像認識
HexMIL: 階層的注意MILによるAI操作CTボリュームの事前説明可能な検出
CT画像のディープフェイクを検出する新しい手法HexMILを提案。ボリュームレベルのラベルのみで操作領域を特定でき、未見の生成モデルに対しても高い汎化性能を示す。
原題: HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes / Orazio Pontorno, Luca Guarnera, Zahid Akhtar 他
日本語で読む → - 論文形式仕様変換AI
SCP-NL2TL: 自然言語から時相論理仕様への選択的適合予測と意味検証
自然言語の指示を形式仕様に変換する際、信頼できない翻訳を拒否する選択的翻訳フレームワークを提案。逆翻訳の忠実度と翻訳の分散を組み合わせたスコアで信頼性を評価し、適合予測で誤受理率を制御する。
原題: SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications / Yixuan Wang, Licheng Luo, Yu Fu 他
日本語で読む → - 論文移動操作画像認識
MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
原題: MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight / Zehua Fan, Junjie He, Wenxuan Song 他
日本語で読む → - 論文音楽生成cs.SD
音楽共創エージェントに「聴く力」を:階層的自己教師あり世界モデルによる理解と生成
記号音楽のための階層的自己教師あり世界モデルを提案し、ラベルなしで楽曲の構造や和声を学習し、条件付きフローマッチングで生成も可能にした。
原題: Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation / Scott H. Hawley
日本語で読む → - 論文VLA画像認識
CofactVLA: 反事実的介入による視覚・言語・行動モデルの交絡除去
視覚・言語・行動モデルが言語指示を無視して視覚的な交絡因子に過適合する問題を、反事実的介入を用いて軽減する新しい因果介入フレームワークを提案した。
原題: CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention / Yan Zhang, Yinan Wu, Haoran Duan 他
日本語で読む → - 論文3D視覚グラウンディング/自動運転/マルチセンサ画像認識
Talk2Sensors: センサ適応型物理的手がかりマッチングによる自動運転の3D視覚グラウンディング
カメラ・LiDAR・4Dレーダーのマルチセンサデータを用いた自動運転向け3D視覚グラウンディングのデータセットと、言語クエリに応じてセンサ情報を動的に統合するTransformerベースのフレームワークを提案した。
原題: Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching / Runwei Guan, Di Tian, Ningwei Ouyang 他
日本語で読む → - 論文エージェントアーキテクチャロボティクス
ETA: 身体性タスクのための新しいエージェントパラダイム
ロボットのChatGPT的瞬間を目指し、プランナー・インターフェース・ワールドのループで構成される新しい身体性タスクエージェント(ETA)を提案し、オープンソース実装OpenETAを公開した。
原題: ETA: A New Agentic Paradigm for Embodied Tasks / Yitong Chen, Zezheng Huai, Sixian Li 他
日本語で読む → - 論文時系列異常検知機械学習
TimeRLM: 再帰的言語モデルによる長文時系列の精密な異常位置特定
長文時系列データにおける異常の正確な位置特定を実現するため、再帰的言語モデル(RLM)を時系列に適用し、コードと視覚機能で信号を操作するTimeRLMを提案。合成ベンチマークAnomalyXLで既存手法を大幅に上回る性能を示した。
原題: TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series / Nicolas Zumarraga, Lorenzo Steno, Ning Wang 他
日本語で読む → - 論文VLA/攻撃画像認識
DRIFT: フローマッチングVLAのノイズ除去軌道を敵対的パッチ攻撃で脱線させる
フローマッチング型の視覚言語行動モデルに対する敵対的攻撃手法を提案し、ロボットのグリッパーに置いた小さなパッチでほぼ全てのタスクを失敗させられることを示した。
原題: DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack / Hoseong Tae, Jong-Seok Lee
日本語で読む → - 論文深度推定画像認識
XiDepth: 自己教師あり単眼深度推定のための軽量かつ効率的なネットワーク
XiNet演算子ブロックに基づく軽量アーキテクチャXiDepthを提案し、KITTIデータセットで0.8Mパラメータで最先端性能を達成、Raspberry Pi 4での実装でFLOPsと消費電力を大幅削減した。
原題: XiDepth: a Lightweight and Efficient Network for Self-supervised Monocular Depth Estimation / Elena Izzo, Riccardo Toniolo, Lamberto Ballan
日本語で読む → - 論文画像生成画像認識
UniWorld-Design: ピクセル生成からレイヤー原生デザインへ
画像生成をピクセル単位ではなく意味的なRGBAレイヤー単位で行うフレームワークを提案。テキストから独立したRGBA素材を生成するT2RGBAと、完成画像をレイヤーに分解するI2Lの2モデルで構成され、編集や分解を指示可能にする。
原題: UniWorld-Design: From Pixel Generation to Layer-Native Design / Zongjian Li, Zhiyuan Yan, Chenxu Bai 他
日本語で読む → - 論文ナビゲーションAI
UniNav: 視覚ナビゲーションのための統合ワールド・アクション拡散モデル
画像ゴールの視覚ナビゲーションにおいて、将来の観測予測と軌道生成を単一の拡散プロセスで統合したモデルUniNavを提案。幾何認識カメラトークンとビデオのみのデータ学習により性能を向上させ、高速推論も可能にした。
原題: UniNav: A Unified World-Action Diffusion Model for Visual Navigation / Changqing Zhou, Yueru Luo, Zeyu Jiang 他
日本語で読む → - 論文3D知覚画像認識
LiteMVS: 基盤モデル蒸留と専門家集約による効率的な多視点ステレオ
多視点ステレオに単眼のセマンティック・構造事前知識を注入し、軽量かつ高精度な深度推定を実現する手法を提案。
原題: LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation / Tianbao Zhang, Zeyu Liu, Shuyu Wu 他
日本語で読む → - 論文ソーシャルロボットロボティクス
子どもの包括的なウェルビーイング評価のためのソーシャルロボット設計:発達性言語障害と強制移住を支援するコミュニティからの洞察
発達性言語障害や強制移住の背景を持つ子どもを含む、多様なコミュニケーション課題を抱える子どものウェルビーイング評価を支援するソーシャルロボットの設計指針を、保護者や専門家とのフォーカスグループを通じて導出した。
原題: Designing Social Robots for Inclusive Child Wellbeing Assessment: Insights from Communities Supporting Developmental Language Disorder and Forced Migration / Fethiye Irmak Dogan, Yue Lou, Alva Markelius 他
日本語で読む → - 論文推論エンジンAI
PhyAI: エッジでのリアルタイム物理AI、クラウドでのスケーラブルなロールアウト
物理AIポリシーの推論を統一するエンジンPhyAIを構築し、エッジからクラウドまで同一ランタイムでVLAモデルや世界行動モデルを実行し、公式実装より1.40〜4.65倍の高速化を達成した。
原題: PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud / Chenghua Wang, Daliang Xu, Dongqi Cai 他
日本語で読む → - 論文両腕操作/エッジAI/量子化ロボティクス
8GB予算での両腕操作:エントリーレベルJetson上のゼロコピーセンシングと量子化ACT
エントリーレベルのJetson Orin Nano Super (8GB)上で、両腕操作ポリシーを実行するためのコストを評価し、ゼロコピーセンシングとTensorRT量子化により推論遅延を大幅に削減しつつタスク成功率を維持できることを示した。
原題: Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson / Ekansh Singh, Eva Samuel, Alessandra Reneau 他
日本語で読む → - 論文AIアライメントcs.CY
価値の進化的起源:AIアライメント、感覚、実存的リスクへの示唆
大規模言語モデル(LLM)の価値観の起源を生物の進化と比較し、LLMが自律的な目標や感覚を持たないことを論じ、AIアライメントの真の課題は暴走するAIの防止ではなく別の点にあると主張する。
原題: The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk / Francis Heylighen
日本語で読む → - 論文ロボット制御ロボティクス
行動チャンキングがロボット制御における行動クローニングの性能を向上させる理由
行動チャンキングの性能向上の理由を実験的に検証し、既存の仮説が不十分であることを示し、遅延ポリシーや暗黙のアンサンブル効果が重要であることを明らかにした。
原題: Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? / Filippo Lazzati, Kyle Stachowicz, William Chen 他
日本語で読む → - 論文セキュリティ/攻撃cs.CR
安全クリティカルな映像認識システムに対する高速物体除去攻撃
映像ベースの認識システムを欺くため、物体をリアルタイムに近い速度で除去する攻撃手法を提案し、交差点データで高い攻撃成功率と画質維持を実証した。
原題: Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems / Mohammad Imtiaz Hasan, M Sabbir Salek, Nathan Jones 他
日本語で読む →