論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/6 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習AI
拡散ガイドによる不確実性を考慮した遅延ポリシー最適化
強化学習における遅延フィードバックによる性能劣化を解決するため、拡散モデルで遅延状態と現在状態の関係をモデル化し、その不確実性を重み付けに利用する新しい手法を提案した。
原題: Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization / Junqi Tu, Zejiao Liu, Fangfei Li 他
日本語で読む → - 論文視線推定画像認識
PAGE: 実用的な人間レベルの視線ターゲット推定に向けて
視線ターゲット推定の性能を人間レベルに近づけるため、シーンと頭部特徴の相互作用を明示的にモデル化したPaGEを提案し、大規模な未ラベルデータでの蒸留により軽量で実用的なモデルを実現した。
原題: PAGE: Towards Practical Human-level Gaze Target Estimation / Zhoutong Ye, Chengwen Zhang, Zhaibin Cui 他
日本語で読む → - 論文形状抽象化画像認識
生成画像モデルを活用した学習不要のプリミティブ形状抽象化
3D形状を幾何プリミティブの集合として表現する手法で、生成画像モデルと視覚言語モデルを組み合わせ、学習なしで物体の部品をセグメント化し、スーパークワッドリックを当てはめる。
原題: Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction / Gregor Kobsik, Tim Elsner, Leif Kobbelt
日本語で読む → - 論文教育/評価ベンチマークAI
CSTutorBench: ブロックベースプログラミングのチューターとしての小型言語モデルの評価
ブロックベースのロボティクス環境におけるCSチューターとしての小型言語モデルを評価するベンチマークを提案し、モデル選択とプロンプト改善の指針を示した。
原題: CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming / H. Chad Lane, Bryson Kageler
日本語で読む → - 論文VLA/強化学習AI
VLA Grounder: ブラックボックスVLAモデルのための言語条件付け空間最適化
凍結されたVLAモデルの動作を改善するため、人間の指示をVLAに適したコマンドへ変換する言語条件付け空間ポリシーを強化学習で最適化する手法を提案。
原題: VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models / Damir Shodiev, Aleksei Staroverov, Nikita Kachaev 他
日本語で読む → - 論文群制御cs.IT
無線給電6G閉ループ制御のための通信・計算・エネルギー転送の統合設計
6G時代のロボット制御を支えるセンシング-通信-計算-制御(SC3)閉ループに対し、衛星からの無線給電でエネルギーを供給し、通信・計算・給電の資源配分を最適化して制御性能(LQRコスト)を向上させる枠組みを提案した。
原題: Orchestrating Communication, Computing, and Energy Transfer for Wireless-Powered 6G Closed-Loop Controls / Chengleyang Lei, Wei Feng, Yanmin Wang 他
日本語で読む → - 論文マルチモーダル/偽造検出画像認識
EVAS: 音声-視覚シナジーと誘導境界較正による効率的なマルチモーダル時間的偽造位置特定
長尺動画中の疎な偽造区間を正確に特定するため、多段階の音声-視覚相互作用と境界較正戦略を備えたエンドツーエンドのマルチモーダルフレームワークを提案した。
原題: EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration / Shen Shen, Quan Zhang, Dan Jiang 他
日本語で読む → - 論文偽造検出画像認識
UniSkip-Mamba: 周波数認識型状態空間モデルによる音声・視覚の時間的偽造位置特定
音声・視覚の時間的偽造位置特定(AV-TFL)において、偽造の識別に有効な低・中周波数帯域に注目し、高周波ノイズを除去する周波数認識型の状態空間モデルUniSkip-Mambaを提案した。
原題: UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization / Cangjin Yu, Quan Zhang, Dan Jiang 他
日本語で読む → - 論文異常検知AI
資本市場における不審な取引パターンを特定するクラスタリングベースのフレームワーク
約100万件の金融取引データにK-Means++クラスタリングを適用し、不正取引の検出と分類を行う教師なしフレームワークを提案した。
原題: A Clustering-Based Framework for Identifying Suspicious Trading Patterns in Capital Market / Asif Zaman, Romona Magdalene Sarkar, Sabiha Khair Ohi 他
日本語で読む → - 論文世界モデル/強化学習機械学習
エージェント探索と構造化モデリングの相乗効果によるタスク十分な世界モデルの学習
エージェントが環境を能動的に探索してタスク関連情報を収集し、そのデータからタスクに必要な最小限の表現を世界モデルで学習することで、サンプル効率と汎化性能を向上させる手法を提案した。
原題: Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling / Fan Feng, Yujia Zheng, Minghao Fu 他
日本語で読む → - 論文VLA機械学習
DynaVieW: スキーマ誘導型ワールドモデリングによる階層的視覚ダイナミクスの理解
マルチモーダルLLMが動画や複数画像の時間的変化を体系的にモデル化できない問題に対し、動的スキーマに基づくワールドモデルDynaVieWを提案。状態遷移系列を学習し、視覚ダイナミクスの予測とシミュレーションを実現する。
原題: DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics / Silin Gao, Hao Zhao, Zeming Chen 他
日本語で読む → - 論文世界モデル評価機械学習
オペレータ・オン・Fが価値等価性を補完する:潜在世界モデルの計画時診断
モデルベース強化学習の世界モデル評価において、報酬予測誤差では捉えられない計画関連の誤差を測る新しい診断指標「オペレータ・オン・F」を提案し、TD-MPC2の規模スイープで計画性能の低下を高精度に予測できることを示した。
原題: Operator-on-F complements value-equivalence: a planning-time diagnostic for latent world models / Donna Vakalis
日本語で読む → - 論文VLA画像認識
GuideMe: ストリーミング動画におけるマルチドメインタスクガイダンスと介入
マルチモーダル大規模言語モデルがリアルタイムの手順コーチとして機能できるかを評価するため、多領域のストリーミング動画ベンチマークGuideMeを構築し、既存モデルの性能を分析した。
原題: GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video / Fang Liu, Jinpeng Chen, Ke Xu 他
日本語で読む → - 論文具現化知能AI
具現化オペレータとベンチマーキング:再利用可能で展開可能な具現化知能システムに向けて
具現化知能システムのための再利用可能な機能モジュール「具現化オペレータ」を定義し、その分類法と多次元ベンチマークフレームワークを提案した論文。
原題: Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems / Junwu Xiong, Jiaxuan Gao, Wei Chai 他
日本語で読む → - 論文解釈可能性自然言語
ドットの間を読む:フィラー・トークンに隠された計算の解読
LLMが空白やドットなどの無意味なトークン上で多段階推論を行う際、その内部計算が残差ストリームから読み取れることを示し、教師なしで中間値を高精度に復元する手法を提案した論文。
原題: Reading Between the Dots: Decoding Hidden Computation across Filler Tokens / Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks
日本語で読む → - 論文ディープフェイク検出画像認識
XPlainVerse: 説明可能なディープフェイク検出のための100万規模ベンチマーク
ディープフェイク検出モデルの説明が視覚的証拠に基づくかを評価する大規模ベンチマークを構築し、操作の実体と証拠を正しく特定するかを測る新指標を提案した。
原題: XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection / Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh 他
日本語で読む → - 論文画像生成画像認識
PhysMirror: 物理的に正確な鏡面反射を生成するフレームワーク
テキストから画像を生成する拡散モデルに、3D空間の事前知識を組み込むことで、物理的に正しい鏡面反射を生成する新しい手法を提案。専用の評価指標も導入し、既存手法より高い精度を実証した。
原題: PhysMirror: Physics-Aware Mirror Object Generation / Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le 他
日本語で読む → - 論文教育工学/LLMAI
対話的ガイドかプロンプト改善か?プログラミング学習におけるLLM利用へのチューター足場かけの影響
LLMベースのチューターの2つのタイプ(ソクラテス式ガイダンスとプロンプト改善)が、学生のプロンプト使用、学習成果、その後のLLM利用に与える影響を比較した研究。ソクラテス式ガイダンスが長期的な学習能力向上に有効であることを示した。
原題: Reflective Dialogue or Prompt Refinement? Effects of Tutor Scaffolding on Students' Independent LLM Use for Programming / Jerome Brender, Laila El-Hamamsy, Kim Uittenhove 他
日本語で読む → - 論文動画検出画像認識
SafeGuard: 社会的リスクを伴うAI生成動画検出のためのマルチエージェント認識・推論フレームワーク
AI生成動画の検出において、知覚的証拠と意味的推論を協調させるマルチエージェントフレームワークを提案し、物理法則や社会的論理の違反を検出する新しいベンチマークも導入した。
原題: SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection / Wenlin Wu, Sheng Zhou, Peipei Song 他
日本語で読む → - 論文モデル次数削減機械学習
低次元モデル:ワールドモデルの母
ワールドモデルの機能構造が、現代の自己教師あり学習よりずっと前に、モデル次数削減と制御の文献で独立に開発・展開・解析されていたことを論じる。
原題: Reduced-Order Models: The Mother of World Models / Rajat Ghosh
日本語で読む → - 論文セキュリティ画像認識
大規模視覚言語モデルへの過負荷攻撃による脱獄手法
テキストと画像を再帰的に組み合わせて情報過負荷を起こし、LVLMの安全機構を回避する新しい脱獄攻撃を提案。オープンソース・商用モデルで高い成功率を達成した。
原題: Overloading Large Vision-Language Models for Jailbreaking / Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli
日本語で読む → - 論文VLAWモデル画像認識
WorldBagel:視覚・言語・行動・世界モデルの統合の力
統合型マルチモーダルモデルを用いて、ロボット操作タスクにおける世界モデルの性能を向上させる新しいフレームワークを提案した。
原題: WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling / Zelin Zhao, Min Shi, Bo Yuan 他
日本語で読む → - 論文ベンチマーク画像認識
K9-Bench:犬中心の動画におけるマルチモーダルLLMの評価
犬の行動理解に特化したベンチマークK9-Benchを構築し、907本の動画と約5000のQAペアを用いて、最先端のマルチモーダルLLMのゼロショット性能を評価した。
原題: K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos / Khush Attarde, Yusuf Ali, Megha Thukral 他
日本語で読む → - 論文モーションキャプチャ画像認識
生体力学的知識を活用した多視点マーカーレス手の動きのモーションキャプチャ
手の複雑な動きを追跡するために、生体力学モデルを組み込んだ勾配ベース最適化手法を用いたマーカーレスモーションキャプチャを提案し、従来の2段階手法と比較して、より生体力学的に妥当で、オクルージョンに頑健な結果を得た。
原題: Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements / Pouyan Firouzabadi, J. D. Peiffer, Kunal Shah 他
日本語で読む → - 論文連合学習機械学習
QFedAgent: 量子強化型パーソナライズ連合学習によるマルチエージェント行動認識
量子回路を用いた融合モジュールを組み込んだハイブリッド量子古典連合学習フレームワークを提案し、マルチエージェントの行動認識タスクでパラメータ数を大幅削減しつつ高精度を達成した。
原題: QFedAgent: Quantum-Enhanced Personalized Federated Learning for Multi-Agent Activity Recognition / Quoc Bao Phan, Tuy Tan Nguyen
日本語で読む → - 論文能動的知覚画像認識
探索してセグメント化:パノラマ参照セグメンテーションのための能動的知覚
エージェントが360度環境を能動的に探索し、ユーザーの指示に従って対象物体をセグメンテーションする新しいタスク「能動的パノラマ参照セグメンテーション」を提案し、空間記憶を持つVLMベースのエージェントPanoSeekerを開発した。
原題: Seek to Segment: Active Perception for Panoramic Referring Segmentation / Song Tang, Shuming Hu, Xincheng Shuai 他
日本語で読む → - 論文神経画像処理画像認識
CLABTOOLKIT: 神経画像データの日常的な処理・操作・可視化のためのオープンソースツールキット
神経画像研究で必要な多様なデータ構造(ボリューム、表面、トラクトグラムなど)を統一的に扱うPythonパッケージを開発し、標準フォーマット間の相互変換や処理を簡便にした。
原題: CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data / Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann
日本語で読む → - 論文シーングラフ/活動理解画像認識
シーンを進化させる学習:シーングラフによる人間活動の推論
一人称視点動画から、人間と環境の相互作用を時空間シーングラフとして表現し、その時間的進化をモデル化するグラフベースモデルGLENを提案。活動に基づくグラフ編集予測という新タスクも導入し、複数のベンチマークで優れた性能を示した。
原題: Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs / Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta
日本語で読む → - 論文LLM評価stat.ML
LLMペルソナの二面性:集約傾向とフレーム依存の幾何構造
LLMのペルソナ評価で、従来の集約スコアに加え、質問順序などのフレームに依存する幾何構造が存在することを示し、その二面性を明らかにした論文。
原題: The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry / Yuan Yuan
日本語で読む → - 論文VLAAI
経路レベルの後知恵指示による視覚言語ナビゲーションの意味的探索
視覚言語ナビゲーションエージェントの訓練において、探索軌道と指示の意味的ミスマッチを解決するため、後知恵推論を用いて指示を実際の探索経路に合わせるPhi-Navを提案した。
原題: Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation / Sung June Kim, Sangpil Kim, Honglak Lee
日本語で読む →