論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文動作予測画像認識
モーション・フォアサイト:将来の3Dシーンフロー予測のためのビデオモデルの再利用
人間と物体のインタラクションを含む単眼ビデオから、操作される物体上の点の将来の3D軌跡を予測する手法を提案。事前学習済みビデオモデルの知識を活用し、軽量なアダプタで将来予測を行う。
原題: MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction / Homanga Bharadhwaj, Yash Jangir
日本語で読む → - 論文手姿勢予測画像認識
Exo2EgoPose: 外中心デモを活用した視覚言語ガイドによる自己中心3D手姿勢予測
自己中心視点の3D手姿勢予測タスクを新たに提案し、外中心視点のデモ動画をガイドとして活用するフレームワークを開発した。
原題: Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting / Zhaofeng Shi, Heqian Qiu, Lanxiao Wang 他
日本語で読む → - 論文3Dガウススプラッティング画像認識
E3DGS: 色を幾何として埋め込む3Dガウススプラッティングの統一幾何・測光等変性
3Dガウススプラッティングの属性を表現論に基づき行列空間に統一的に埋め込み、SE(3)等変なアーキテクチャを実現した論文。
原題: E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding / Chankyo Kim, Maani Ghaffari
日本語で読む → - 論文具現化知能/ロボティクス理論AI
具現化された機械知能のための未踏のアーキテクチャとしてのバークレーとハイザーマン
エドマンド・C・バークレーを具現化された機械知能の初期理論家として再評価し、デイビッド・L・ハイザーマンと比較して、感覚・状態・制御・行動・適応を中心とした共通の記述スキームを復元し、現在のLLM中心のロボティクスを批判的に評価する論文。
原題: Berkeley and Heiserman as an Unexhausted Architecture for Embodied Machine Intelligence / Christopher A. Tucker
日本語で読む → - 論文3次元再構成画像認識
Event3R: イベントカメラからの非同期・大域3次元再構成のための時空間特徴集約
イベントカメラの非同期ストリームを直接、大域的に一貫した3次元点群に変換するフィードフォワード型フレームワークEvent3Rを提案。時空間ボクセル表現と時間的注意機構、自己教師あり事前学習により、ラベルデータが少ない状況でも頑健な再構成を実現する。
原題: Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation / Jian Huang, Haotian Shen, Xinhao Lou 他
日本語で読む → - 論文シミュレーション画像認識
物理認識マスク拡散モデルによる都市魚眼災害検出のための洪水シミュレーション
魚眼レンズで撮影した単一画像から、拡散モデルを用いて現実的な洪水シミュレーション画像を生成するシステムPhysFloodを提案。水位などの物理変数を操作して多様な洪水シナリオを生成可能。
原題: Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection / Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga 他
日本語で読む → - 論文音声認識/セキュリティcs.SD
SpeechGuard: 音声認識モデルに対するバックドア攻撃のオンライン防御
音声認識モデルに対するバックドア攻撃を実行時に防御する初のオンラインパイプラインを提案。適応的摂動注入で有毒サンプルを検出し、時間周波数マスキングで浄化する。
原題: SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models / Jinwen Xin, Xixiang Lv
日本語で読む → - 論文定理証明AI
MathCoPilot: 数学研究のための人間とAIの共生パラダイムを実現する対話型システム
数学者が高レベルの方向性を指示し、AIエージェントが詳細な形式化と証明を実行する、人間参加型の数学研究支援システムMathCoPilotを提案した。
原題: MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research / Junjie Zhang, Jiayu Liu, Wenbin Liu 他
日本語で読む → - 論文データセット画像認識
静止画像と時空間トマトデータによる強・弱ラベルを用いた検出・セグメンテーション・追跡・ビデオインスタンスセグメンテーションの実現
商業的環境でロボットが取得したトマト植物の画像データセット2種(静止画像とビデオ)を公開し、果実の熟度をピクセルレベルでラベル付けした。
原題: Still image and spatial-temporal tomato data enabling detection, segmentation, tracking, and video-instance segmentation using strong and weak labels / Michael Halstead, Esra Guclu, Mohamed Farag 他
日本語で読む → - 論文GUIエージェント画像認識
HyMobileAgent: データと環境の共スケーリングによる高効率GUIエージェント
モバイルGUIエージェントの性能を、モデル規模だけでなくデータと環境の両方をスケールさせる枠組みで向上させた。合成データ生成、知識パイプライン、大規模アクションデータ、リセット可能な訓練環境、計画・反省機構を統合している。
原題: HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents / Hy Vision Team, Huawen Shen, Zhengyang Tang 他
日本語で読む → - 論文ワールドモデルAI
概念誘導型空間正則化によるAtari Pongのワールドモデル改善
Atari Pongの5つの視覚ワールドモデルを再現し、凍結モデルのロールアウト診断とピクセル空間ゼロショットMBRLで性能低下を確認。ボールなどのタスク重要概念のモデリング不足が原因と仮説し、概念領域の補助再構成損失CGSRegを提案して改善を図る。
原題: Concept-Guided Spatial Regularization for World Models in Atari Pong / Yukuan Lu, Zaishuo Xia, Weyl Lu 他
日本語で読む → - 論文群制御画像認識
ロボットサッカー試合のためのLLMベース自動実況ソリューション
ロボカップの試合映像から統計情報を抽出し、LLMを用いてリアルタイムで自然な実況コメントを自動生成するシステムを提案した論文。
原題: An LLM-Based Automatic Sportscast Solution for Robot Soccer Matches / Francesco Petri, Michele Brienza, Daniele Nardi 他
日本語で読む → - 論文メタマテリアル設計cs.CE
自己組織化ニューラルセルオートマトンによる不規則メタマテリアルのワンショット生成設計
ニューラルセルオートマトンを用いて、単一のテンプレートから多様な不規則メタマテリアル構造を生成するフレームワークを提案し、局所ルールの操作により再学習なしで構造の特性を制御できることを示した。
原題: One-Shot Generative Design for Disordered Metamaterials via Self-Organizing Neural Cellular Automata / Yujie Xiang, Liwei Wang
日本語で読む → - 論文アクセシビリティ/可視化HCI
スケルトン:非視覚的データ体験の視覚的オーサリング
視覚障害者向けデータ可視化のナビゲーション構造を、視覚的な直接操作で設計できるオーサリング環境を提案した論文。
原題: Skeleton: Visual Authoring of Non-visual Data Experiences / Frank Elavsky, Chieri Nnadozie, Lucas Nadolskis 他
日本語で読む → - 論文安全性AI
言葉は安全でも行動は危険:隠れ状態リスク空間におけるテキスト安全性を超えた物理的危険の検出
LLMが身体化エージェントのプランナーとして使われる際、言語的に無害な指示が物理世界で危険になる問題を研究し、コンテンツ危険と物理的危険が表現上分離可能であることを示し、隠れ状態プローブPRISMを提案して高精度で物理的危険を検出する。
原題: When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space / Weimeng Wang, Ziqiang Wang, Zihang Zhan 他
日本語で読む → - 論文ビデオ生成/推論画像認識
多段階視覚推論のための階層的デノイジング
因果的ビデオ生成に階層的潜在変数を統合し、粗い推論から細かい推論へと段階的に進めることで、複雑な多段階視覚推論タスクを効率的に解決するフレームワークを提案した。
原題: Hierarchical Denoising For Multi-Step Visual Reasoning / Zezhong Qian, Xiaowei Chi, Chak-Wing Mak 他
日本語で読む → - 論文推論/エージェントAI
コーディングエージェントはARC-AGI-3を解くために実行可能な世界モデル、単純化、検証を必要とするか?
ARC-AGI-3課題を解くコーディングエージェントにおいて、実行可能な世界モデル、単純化プロンプト、検証の各要素の貢献を比較し、検証が最も効果的であることを示した。
原題: Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3? / Sergey Rodionov
日本語で読む → - 論文自己教師あり学習画像認識
マルチモダリティを教師とする自己教師あり学習:テスト環境への特化
テスト環境で収集したマルチモーダルデータを用いた自己教師あり学習(TST)を提案し、大規模なインターネットデータで事前学習した汎用モデルと同等の性能を達成できることを示した。
原題: Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality / Kunal Pratap Singh, Ali Garjani, Rishubh Singh 他
日本語で読む → - 論文知覚/プライバシーロボティクス
RoboShape: プライバシーを考慮したロボット知覚のための情報理論的ポイントクラウド表現
ロボットが収集するポイントクラウドから、物体認識の性能を保ちつつプライベートな属性情報を除去する圧縮手法を提案した。
原題: RoboShape: Information-Theoretic Point Cloud Representations for Privacy-Aware Robot Perception / Oguzhan Baser, Mirac Sozen, Kaan Kale 他
日本語で読む → - 論文群制御制御
劣化した局所保証下での融合による有限標本コンフォーマル被覆回復:占有マップ推定における
各ロボットの局所占有マップのコンフォーマル予測保証が劣化する状況で、ロボット間でスカラーe値を交換し融合することで、チーム全体の被覆率を回復する分散アルゴリズムを提案した。
原題: Finite-Sample Conformal Coverage Recovery via Fusion under Degraded Local Guarantees in Occupancy Map Estimation / Ritvik Mahajan, Aneesh Raghavan, Karl Henrik Johansson
日本語で読む → - 論文ヒューマンロボットインタラクション画像認識
一目でわかる:顔から見た目の性格を推定する
顔画像のみから初対面の印象に基づく性格(MBTI)を推定するフレームワークGlanceFaceを提案。視覚言語モデルによる意味的先行知識と不確実性を考慮した学習で、ノイズの多い主観的アノテーションに対処し、対話前の適応的初期戦略に活用できる。
原題: Knowing You at First Glance: Inferring Apparent Personality from Faces / Shuhuan Chen, Xiangyu Zhu, Weisong Zhao 他
日本語で読む → - 論文モデルベースRL機械学習
変化点対応ワールドモデル:動力学シフトの検出と古いリプレイの忘却による回復
モデルベース強化学習エージェントが自身の予測誤差から動力学の急変を検出し、古いリプレイバッファを忘却することで、環境変化後の適応を高速化する手法を提案。
原題: Changepoint-Aware World Models: Detecting Dynamics Shifts and Recovering by Forgetting Stale Replay in Model-Based RL / Everest Yang
日本語で読む → - 論文強化学習/表現学習機械学習
強化学習のための因子分解スペクトル表現
遷移カーネルを3モードテンソルとみなし、CP分解とノイズ対比学習で状態・行動・次状態のエンコーダを学習する手法FaStRを提案。表現学習に必要なサンプル数を削減し、高次元の移動タスクで効果を発揮する。
原題: Factorized Spectral Representations for Reinforcement Learning / Junyi Wu, Dan Li
日本語で読む → - 論文強化学習機械学習
DAGR: 状態条件付き目標表現と差分認識型目標クロスアテンション
目標条件付き強化学習において、現在の状態を考慮しない従来の目標表現を、マルチスケールのゲート付きクロスアテンションで状態条件付きに改良する手法DAGRを提案した。ナビゲーションタスクで性能が向上するが、操作やパズルではベースラインと同等以下であり、普遍的な改善ではないことを示した。
原題: DAGR: State-Conditioned Goal Representations via Difference-Aware Goal Cross-Attention / Xing Lei, Wenyan Yang, Xuetao Zhang 他
日本語で読む → - 論文具現化AIq-bio.NC
生物における接地された世界モデルと未来の具現化AI
生物の神経回路が環境との相互作用を通じて世界モデルを構築し、言語がその上に付着するという視点から、現在の具現化AIに欠けている特徴を5つの例で示し、将来のAI設計への示唆を論じた論文。
原題: Grounded world models in biological organisms and future embodied AI / Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro 他
日本語で読む → - 論文活動認識画像認識
ペア関係を超えて:視覚に基づく人間活動認識のための動的操作ハイパーグラフ
手、物体、道具、支持面などの多エンティティ間の高次関係を動的ハイパーグラフでモデル化し、細かい操作認識を改善する手法を提案した。
原題: Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition / Fatemeh Ziaeetabar
日本語で読む → - 論文3Dアセット生成画像認識
UniPhysGen: シミュレーション対応3Dアセットのための統合物理グラウンディング
3Dアセットに統一された物理セマンティクス(関節構造と物理特性)を自動付与するフレームワークと大規模データセット、ベンチマーク、モデルを提案した。
原題: UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets / Xian Li, Rong Wei, Lujie Yang 他
日本語で読む → - 論文VLAAI
UESF-Bench: 統合型身体性探索・追従のためのベンチマークと分析
言語で指示された人物を探索し、その後追従する統合的なタスクのベンチマークを新たに構築し、探索と追従を切り替えるVLAフレームワークを提案・評価した論文。
原題: UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following / Kun Yu, Jianhua Yang, Yixiang Chen 他
日本語で読む → - 論文セキュリティcs.CR
トラフィック認識型ランダム平滑化によるLLMベースのネットワーク侵入検知
LLMベースの侵入検知システムに対して、攻撃者が操作可能な特徴部分にのみガウスノイズを注入する認証付き防御手法を提案し、既存手法より高い認証精度を達成した。
原題: Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection / Zhenpeng Li
日本語で読む → - 論文大規模モデル機械学習
自己改善はしばしば突然起こる:大規模モデルのための悟り風ファインチューニング
大規模モデルに突然の能力向上が起こる「悟り」現象を仮説とし、重み更新なしでモジュールの接続を変更する新しいポストチューニング手法を提案した。
原題: Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models / Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang 他
日本語で読む →