論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/19 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御cs.MA
動的環境強制下での帆走群れのための速度重み付きフロッキング
風速に依存する操縦性の制約を持つ帆走ロボット群れの協調問題を扱い、速度重み付き相互作用則を提案して群れの分極と凝集性を改善した。
原題: Speed-Weighted Flocking for Sailing Swarms under Dynamic Environmental Forcing / Pranav Kedia, Aaron Gan, Hannah J. Williams 他
日本語で読む → - 論文画像編集/透かし画像認識
透かし入り画像は編集可能か?透かしを保持するテキスト誘導画像編集のためのSafeMark
テキスト誘導画像編集において、意味的に妥当な編集を行いながら埋め込まれた透かしを保持するフレームワークSafeMarkを提案した。
原題: Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing / Xiaodong Wu, Qi Li, Xiangman Li 他
日本語で読む → - 論文操作画像認識
SWEET: 画像編集によるスパースな世界モデリングを用いた身体性タスク実行
ロボット操作タスクにおいて、密なビデオ生成の代わりに画像編集モデルを用いてタスク関連のキーフレームを予測するスパースな視覚世界モデルを提案し、計算コストを削減しつつタスク実行を可能にした。
原題: SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution / Yiren Song, Yihan Wang, Xiyao Deng 他
日本語で読む → - 論文シーン生成cs.GR
PhysOmni: 単一画像からの物理基盤マルチオブジェクトシーン生成とリアルタイムインタラクション
単一画像から物理的に一貫性のある3Dシーンを再構成し、リアルタイムで操作可能なビデオを生成するトレーニング不要のフレームワークを提案。
原題: PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction / Xin Zhang, Yabo Chen, Yijie Fang 他
日本語で読む → - 論文ビデオ生成画像認識
PhyWorld: 物理的に忠実な世界モデルによるビデオ生成
ビデオ生成モデルを物理法則に従う世界シミュレータとして機能させるため、2段階のポストトレーニング(フローマッチングとDPO)を導入し、物理的整合性を向上させた。
原題: PhyWorld: Physics-Faithful World Model for Video Generation / Pu Zhao, Juyi Lin, Timothy Rupprecht 他
日本語で読む → - 論文VQA/ベンチマーク画像認識
FineBench:細粒度な人間活動理解のための視覚言語モデルのベンチマークと性能向上
長時間動画における細かい人間の動きや相互作用を評価する新しいベンチマークFineBenchを構築し、既存のオープンソースVLMの弱点を特定。さらにモジュール型フレームワークFineAgentを提案して性能を改善した。
原題: FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding / Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh 他
日本語で読む → - 論文最適化機械学習
事前学習を超えたMuonの再考:VLAとRLVRにおけるスペクトル障害とハイパス対策
Muonオプティマイザの一様なスペクトル白色化が、VLAやRLVRで問題を引き起こすことを示し、高域通過型のNS反復を用いたPionを提案して性能を改善した。
原題: Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR / Chongyu Fan, Gaowen Liu, Mingyi Hong 他
日本語で読む → - 論文ベンチマーク/一人称視点/推論画像認識
EgoCoT-Bench:MLLMの接地・検証可能な操作中心推論のベンチマーク
一人称視点の動画における操作中心の推論を評価する新しいベンチマークを提案し、時空間シーングラフを用いて接地された推論根拠を生成・検証する。
原題: EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs / Yang Dai, Dian Jiao, Tianwei Lin 他
日本語で読む → - 論文映像生成画像認識
Aero-World: 慣性制御に基づく行動条件付き空中映像生成
事前学習済みの画像から映像への拡散モデルを、加速度や角速度などの慣性制御信号に従う空中映像生成器へ変換する手法を提案。実映像とIMUデータで訓練した物理プローブにより、映像の慣性整合性を監視しつつLoRAで微調整する。
原題: Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls / Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang 他
日本語で読む → - 論文操作/軌道予測画像認識
空間プロンプトを用いたエゴセントリック操作の視覚軌道予測
ロボット操作のタスク指示を空間的なプロンプト(バウンディングボックスや点)で行う新しい設定を提案し、エゴセントリック映像から将来のエンドエフェクタ軌道を予測する手法を開発した。
原題: Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation / Yifan Li, Xinyu Zhou, Yunhao Ge 他
日本語で読む → - 論文VLM/ベンチマーク機械学習
EgoBabyVLM: 自然主義的エゴセントリック映像データからのクロスモーダル学習のベンチマーク
乳幼児や成人の自然な一人称視点映像を用いて視覚言語モデルを訓練・評価し、弱い意味的対応しかない現実的なデータでは既存のVLMがうまく学習できないことを示し、新たなベンチマークとチャレンジを提案した論文。
原題: EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data / Dongyan Lin, Phillip Rust, Angel Villar Corrales 他
日本語で読む → - 論文全身復元画像認識
DanceHMR: 単眼ビデオからの手を含む全身人体メッシュ復元
単眼ビデオから全身の動きと手の詳細を安定して復元する新しいフレームワークを提案。
原題: DanceHMR: Hand-Aware Whole-Body Human Mesh Recovery from Monocular Videos / Wenhao Shen, Ming Zhou, Hengyuan Zhang 他
日本語で読む → - 論文敵対的攻撃画像認識
フーリエ形状の表現力を活用した赤外線物体検出への攻撃手法
赤外線物体検出に対する物理的敵対的攻撃において、熱遮断材の形状をフーリエ係数で表現し、微分可能な枠組みで最適化することで、従来の形状ベース手法の表現力と最適化能力のトレードオフを克服した。実世界実験で高い攻撃成功率を達成した。
原題: Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection / Yixing Yong, Jian Wang, Ming Lei 他
日本語で読む → - 論文データ同化stat.ML
SURGE: 拡散サロゲートのための近似・学習不要の粒子フィルタ
拡散モデルを世界モデルとして使い、観測データを粒子フィルタで統合して状態推定の精度を高める手法を提案した論文。
原題: SURGE: Approximation and Training Free Particle Filter for Diffusion Surrogate / Lifu Wei, Yinuo Ren, Naichen Shi 他
日本語で読む → - 論文3D生成画像認識
コードとしての部屋:エージェント的コード合成による俯瞰画像からの3D部屋生成
俯瞰画像から3D部屋を生成するため、MLLMベースのエージェントがBlenderコードを段階的に合成するフレームワークを提案。記憶モジュールで文脈忘却を防ぎ、専用ベンチマークで有効性を検証した。
原題: Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis / Yixuan Yang, Zhen Luo, Wanshui Gan 他
日本語で読む → - 論文生体認証画像認識
デジタル実体のための非衝突生体認証アイデンティティ:幾何学、容量、および100万規模の仮想アイデンティティ提供
AIエージェントやヒューマノイドロボット向けに、実在の人間の生体認証と衝突しない仮想アイデンティティを提供する新しいフレームワークを提案し、幾何学的洞察に基づいて100万規模の非衝突埋め込みを実現した。
原題: Non-Colliding Biometric Identities for Digital Entities: Geometry, Capacity, and Million-Scale Virtual Identity Provisioning / Yuyang Ji, Yixuan Shen, Anil Jain 他
日本語で読む → - 論文ビデオ理解/ベンチマーク画像認識
EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
原題: EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos / Ruiping Liu, Junwei Zheng, Yufan Chen 他
日本語で読む → - 論文敵対的攻撃画像認識
アラビア語手書き文字認識への脅威:組み込みConvNetモデルに対するブラックボックス敵対的攻撃の調査
アラビア語手書き文字認識モデルがブラックボックス敵対的攻撃に対して脆弱であることを実証し、特にPixle攻撃が高い成功率を示すことを明らかにした。
原題: Threats to Arabic Handwriting Recognition: Investigating Black-Box Adversarial Attacks on embedded ConvNet models / Mohsine EL Khayati, Abdelillah Semma, Abdelaziz Courr 他
日本語で読む → - 論文学習最適化cs.DC
AdaptiveLoad: 効率的なビデオ拡散トランスフォーマー学習に向けて
ビデオ生成モデルの学習におけるGPU負荷不均衡を解消するため、メモリと計算量の二重制約による適応的負荷分散と、融合LayerNorm-Modulate CUDAカーネルを提案し、スループットを27.2%向上させた。
原題: AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training / Yucheng Guo, Yongjian Guo, Zhong Guan 他
日本語で読む → - 論文一人称視点ビデオ理解画像認識
EgoInteract: インタラクション理解と予測のための合成一人称視点ビデオ生成
一人称視点のインタラクション理解・予測タスク向けに、制御可能なシミュレータで合成ビデオと高密度アノテーションを生成し、実データでの性能向上を実証した論文。
原題: EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation / Rosario Leonardi, Francesco Ragusa, Daniele Materia 他
日本語で読む → - 論文音声・映像編集画像認識
指示に基づく音声・映像同時編集フレームワークInstructAV2AV
指示文に従って音声と映像を同時に編集する初のエンドツーエンドフレームワークを提案し、大規模データセットと新しい注意機構で高品質な編集を実現した。
原題: InstructAV2AV: Instruction-Guided Audio-Video Joint Editing / Haojie Zheng, Yixin Yang, Siqi Yang 他
日本語で読む → - 論文群制御画像認識
共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
原題: Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models / Kunyu Peng, Zhikun Zhou, Kailun Yang 他
日本語で読む → - 論文VLA画像認識
AtlasVA: 教師なしVLMエージェントのための自己進化型視覚スキルメモリ
VLMエージェントの経験を視覚的に保持する自己進化型メモリフレームワークを提案。空間ヒートマップ、視覚例、テキストスキルの3層で構成し、教師なしで危険・親和性アトラスを進化させて強化学習の報酬として利用する。
原題: AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents / Pan Wang, Yihao Hu, Xiujin Liu 他
日本語で読む → - 論文生成モデル画像認識
表現オートエンコーダによる改良ベースライン
表現オートエンコーダ(RAE)の設計を改良し、再構成性能と収束速度を大幅に向上させた。特に、層の和を用いた表現、REPAとの相補性、CFGのための無料ガイダンスを実現した。
原題: Improved Baselines with Representation Autoencoders / Jaskirat Singh, Boyang Zheng, Zongze Wu 他
日本語で読む → - 論文空間推論AI
デカルトの幻想を超えて:知覚的ボトルネック下での二段階マルチモーダル心の理論の検証
マルチモーダル大規模言語モデルが、他者の視覚的制約を考慮した空間推論(二次の心の理論)を苦手とする問題を指摘し、アンカーベースの空間分解チェーン・オブ・ソートを提案して性能を向上させた。
原題: Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks / Yajing Zhou, Xiangyu Kong
日本語で読む → - 論文世界モデル画像認識
ナノ・ワールドモデル:未来動画予測のミニマル実装
拡散フォーシングを中心とした、将来のビデオ予測のためのコンパクトで再現可能なコードベースを提供し、世界モデルの設計選択を制御された方法で研究できるようにした。
原題: Nano World Models: A Minimalist Implementation of Future Video Prediction / Siqiao Huang, Partha Kaushik, Michael Chen 他
日本語で読む → - 論文画像復元画像認識
劣化周波数曲線:全一括画像復元のための明示的な周波数量化表現
劣化を周波数領域の帯域別エネルギー比で定量化する「劣化周波数曲線(DFC)」を提案し、これをトークンとして活用するDFC-IRフレームワークにより、複合・未知の劣化を含む全一括画像復元で高性能を達成した。
原題: Degradation Frequency Curve: An Explicit Frequency-Quantified Representation for All-in-One Image Restoration / Xinghua Huang, Zhixiong Yang, Chen Wu 他
日本語で読む → - 論文VLA画像認識
臨床視覚言語モデルにおける医療文脈が意思決定を歪める
胸部X線画像と臨床テキストを用いたタスクで、視覚言語モデルがテキストに過度に依存し、無関係な病歴やプロンプトの変更に影響されやすいことを明らかにした論文。
原題: Medical Context Distorts Decisions in Clinical Vision Language Models / David Restrepo, Ira Ktena, Maria Vakalopoulou 他
日本語で読む → - 論文ドローン追跡画像認識
DeTrack: ドローン身体化追跡のためのベンチマークと高度認識デュアルワールドモデル
ドローンが能動的に3D環境で対象を追跡する新しいタスクを定義し、大規模ベンチマークと高度に応じたデュアルワールドモデルを提案した。
原題: DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking / Guyue Hu, Haoming Liu, Siyuan Song 他
日本語で読む → - 論文テキスト追跡画像認識
検出を超えて:シーンテキスト追跡のための構造認識フレームワーク
ビデオ内のシーンテキストを追跡する新しいタスクを定義し、検出不要の二重分岐フレームワークSymTrackを提案。幾何学的歪みや視覚的曖昧さに対処し、3つのベンチマークで最高性能を達成した。
原題: Beyond Detection: A Structure-Aware Framework for Scene Text Tracking / Chenmin Yu, Liu Yu, Daiqing Wu 他
日本語で読む →