論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文探査計画ロボティクス
自律科学探査のためのPOMDP
センサ不確実性下での科学探査計画を、生のセンサデータではなく推論された物理特性に基づいて分岐するPOMDP(SHM-POMDP)を導入し、計算効率と報酬を改善した。
原題: POMDPs for Autonomous Science Exploration / Daniel Guirguis, Nathan Wallace, Hanna Kurniawati 他
日本語で読む → - 論文軌道生成ロボティクス
拡散モデルと一貫性蒸留による人間協調ロボット軌道生成の高速化
人間とロボットの協調環境で、衝突回避を考慮した関節空間軌道を拡散モデルで生成し、一貫性蒸留で推論を高速化する手法を提案した。
原題: Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation / Byeong-Il Ham, Hyun-Bin Kim, Kyung-Soo Kim
日本語で読む → - 論文監視/不確実性ロボティクス
仕様を守り続ける:不確実性下でのリアルタイム監視と海事ケーススタディ
不確実性下でロボットが複雑な仕様を満たすことを監視する枠組みを提案し、データ駆動の到達可能集合を用いてデータ要件を削減。海事ナビゲーションに適用し、シミュレーションと実機実験で有効性を示した。
原題: Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study / Elizabeth Dietrich, Hanna Krasowski, Emir Cem Gezer 他
日本語で読む → - 論文VLAAI
Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?
ビデオ世界モデルと行動予測を組み合わせたWorld Action Models (WAMs)の計算負荷を減らすため、事前学習済みビデオTransformerを表現ハブとし、軽量な出力ヘッドをドッキングする新しい設計原理DoTを提案し、単層行動ヘッドを30層ビデオバックボーンに接続したFaster-WAMを実装。低遅延で競争力のある性能と汎化を実証した。
原題: Faster-WAM: Do World Action Models Need Deep Action Modules? / Liheng Ma, Rui Heng Yang, Zhanguang Zhang 他
日本語で読む → - 論文触覚ロボティクス
ヒューマノイド向け形状適応型全身触覚:3Dプリント共形EITスキン
3Dプリントで作る曲面に沿った電気インピーダンス断層撮影(EIT)触覚スキンを提案し、平面・曲面・顔形状で接触位置推定を検証した。
原題: Toward Geometry-Scalable Whole-Body Touch for Humanoids: A 3D-Printed Conformal EIT Skin / Haofeng Chen, Carson Kohlbrenner, Jiri Kubik 他
日本語で読む → - 論文マニピュレーションロボティクス
AffordTrajDP: 動的アフォーダンス誘導によるロボット操作の視覚運動ポリシー学習
静的アフォーダンスの限界を克服するため、物体のSE(3)姿勢を媒体にアフォーダンス軌道を生成し、時間的に一貫した状態認識ガイダンスを提供する動的フレームワークを提案。ManiSkill3で70%の成功率を達成し、実機でも堅牢性を実証した。
原題: AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation / Gaoyuan Wu, Ziyu Shan, Haoyang Du 他
日本語で読む → - 論文移動操作/VLAロボティクス
DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
原題: DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation / Zheng Yang, Wenjie Zhang, Xiangyu Chen 他
日本語で読む → - 論文VLAロボティクス
OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
原題: OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation / Tianyi Zhang, Ziyang Gong, Zhenjie Yang 他
日本語で読む → - 論文物体検出画像認識
データセット構成が組み込みリアルタイムUAV山火事検出に与える影響:コンパクトYOLOモデルを用いた検証
UAVによる山火事検出において、実画像とAI生成画像の混合やデータ拡張が性能に与える影響を、コンパクトなYOLOモデルで評価した。実データのみの非拡張データセットが最良の性能を示し、合成データや拡張の効果は限定的だった。
原題: Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models / Eduardo de los Santos, Andre S. Kelbouscas, Ricardo B. Grando 他
日本語で読む → - 論文3D再構成画像認識
Swimm3R: 水中3D再構成のための媒質対応SfMとベータスプラッティング
水中環境での散乱や減衰による3D再構成の失敗を解決するため、媒質対応SfMとベータスプラッティングを組み合わせた統一フレームワークを提案し、新たな水中ビデオデータセットで有効性を示した。
原題: Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction / Minseong Kweon, Junaed Sattar
日本語で読む → - 論文全身制御/学習ロボティクス
LooperMuscle: 構造化Mixture-of-Expertsによるヒューマノイド全身追従の高速かつ安定な学習
ヒューマノイドの全身追従タスクにおいて、高速学習手法FastSACの性能低下を、構造化MoEアクターと専門家認識型クリティック、寄与度ルーティングリプレイを組み合わせた閉ループ学習で改善し、PPOに近い精度を約45分で達成した。
原題: LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts / Boyi Liu, Qijin Li, Tianqi Yu 他
日本語で読む → - 論文UAVナビゲーションロボティクス
FlowPilot: 俊敏なUAVナビゲーションのためのリアルタイム世界行動モデリング
深度画像から将来のシーンと軌道を同時に生成するコンパクトな世界行動モデルを提案し、シミュレーションと実機で高速・高機動な飛行を実現した。
原題: FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation / Runqing Wang, Ding Yu, Pengyuan Min 他
日本語で読む → - 論文アバター生成画像認識
Forwardrobe: 単一画像からの衣服対応ガウシアンアバター
単一画像から衣服を明示的に分離して再構成するガウシアンアバター生成フレームワークを提案し、スカートやドレスなどの緩い衣服の動きと編集を可能にした。
原題: Forwardrobe: Garment-Aware Gaussian Avatars from a Single Image / Daisheng Jin, Shuyun Wang, Ying He
日本語で読む → - 論文画像偽造検出画像認識
オープンエンドなAI生成画像偽造の局所化のための段階的決定
AI生成画像の偽造を検出するために、静的で一括の予測ではなく、証拠と不確実性に基づいて局所化マップを段階的に更新する適応的逐次決定プロセスを提案する。
原題: Progressive Decision-Making for Localizing Open-Ended AI-Generated Image Forgeries / Jingyi Hou, Xiaoxia Chen, Leyu Zhou 他
日本語で読む → - 論文因果推論自然言語
証拠タイプの競合:介入データはいつ言語モデルに因果方向を教えられるのか?
介入データが因果推論に有効とされる仮説を、合成環境で観測相関と因果効果が逆符号になるシンプソンのパラドックス状況で検証し、介入サンプルを増やしても因果方向の学習が改善せず、文脈中の証拠タイプが重要であることを示した。
原題: Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction? / Xining Xun
日本語で読む → - 論文模倣学習機械学習
オン・ポリシー相互作用はいつ役立つのか?価値ベース模倣学習における表現のトレードオフ
模倣学習において、専門家とのオン・ポリシー相互作用が学習者の表現要件を緩和し、専門家の価値関数のみを表現できれば十分であることを示し、新しいアルゴリズムOVIを提案した。
原題: When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning / Luca Viano, Antoine Moulin, Audrey Huang 他
日本語で読む → - 論文技術的負債cs.SE
AI集約型サイバーフィジカルシステムにおける隠れた技術的負債の研究、特定、修正
AIコンポーネントを含むサイバーフィジカルシステム(AI-CPS)特有の技術的負債を特徴づけ、その特定と修復の手法を提案する論文。
原題: Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems / Beena
日本語で読む → - 論文セグメンテーション画像認識
アフォーダンスセグメンテーションのための軽量ニューラルネットワーク:デコーダモジュールの改良
ウェアラブルロボット向けに、計算コストを抑えつつ高精度なアフォーダンスセグメンテーションを実現する軽量ニューラルネットワークを提案し、デコーダの役割を分析して既存手法を上回る性能を示した。
原題: Lightweight Neural Networks for Affordance Segmentation: Enhancement of the Decoder Module / Simone Lugani, Edoardo Ragusa, Rodolfo Zunino 他
日本語で読む → - 論文医用画像分割画像認識
低侵襲腹部手術における術中ガーゼ領域分割のための深層学習の初期的検討
実臨床の低侵襲腹部手術動画を用いて、深層学習によるガーゼ領域分割の実現可能性を初めて検証した論文。自動追跡による弱教師データの活用で性能向上も確認した。
原題: First Investigation of Deep Learning for Intraoperative Gauze Segmentation in Minimally Invasive Abdominal Surgery / Priya Tomar, Maximilian Broß, Philipp Feodorovici 他
日本語で読む → - 論文量子アーキテクチャ探索機械学習
DreamQAS: 意思決定に有用な世界モデルによるVQE効率的な量子アーキテクチャ探索
量子回路の構築と動作の合法性が決定的であることを利用し、高コストなVQEフィードバックのみを学習するモデルベース強化学習フレームワークDreamQASを提案した。
原題: DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search / Jiayang Niu, Yan Wang, Jie Li 他
日本語で読む → - 論文VLA画像認識
FaithEyes: マルチエージェントによるプロセス画像検証を用いた忠実なツール使用に向けて
エージェント型視覚言語モデルがツールを不誠実に使う問題を解決するため、プロセス画像の有用性を自己判定するマルチエージェントフレームワークを提案した。
原題: FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification / Haoqing Wang, Xingrun Xing, Wei Xia 他
日本語で読む → - 論文強化学習制御
臨界性モデルを用いた身体性AIの自己進化学習
身体性AIのファインチューニング停滞を解決するため、ポリシー自身の実行結果から将来の失敗確率を予測する臨界性モデルを学習し、失敗しやすいシナリオを重点的にサンプリングして学習データの情報密度を高める自己進化手法を提案した。
原題: Self-Evolving Learning for Embodied AI with Criticality Model / Linxuan He, Yuying Tian, Lingxiang Fan 他
日本語で読む → - 論文マルチエージェント強化学習AI
MARS-RA: マルチモーダル比較による具現化マルチエージェント協調におけるクレジット割り当てのためのランク集約
協調マルチエージェント強化学習におけるクレジット割り当て問題を、大規模マルチモーダルモデルによるエージェント間のペア比較を用いたランク集約問題として再定式化し、ノイズや動的なエージェント参加に頑健な報酬整形手法を提案した。
原題: MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation / Dawei Wang, Di Zhao, Xinyuan Liu 他
日本語で読む → - 論文ビデオワールドモデル画像認識
ShadowDancer: ビデオとその影から統一力学表現を学習し、ビデオワールドモデルに任意のアクションを教える
デモ動画のペア(シャドウペア)を用いて、見た目に依存しない統一的な力学表現を学習し、任意のアクションをフレームレベルで制御できるビデオワールドモデルを提案した。
原題: ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow / Jin Cao, Zian Meng, Kaipeng Zhang
日本語で読む → - 論文データセット/意図認識画像認識
飛行中のボディランゲージ理解を目指したロバストな3Dアバター配置学習
UAV映像に人間の意図を表すアバターを正確に配置するデータセットを構築し、そのデータで学習することで長距離からの人間の動作・意図認識精度を大幅に向上させた。
原題: Learning to Understand Body Language from Flight through Robust 3D Avatar Placing / Dragos Costea, Alina Marcu, Cristina Lazar 他
日本語で読む → - 論文セキュリティcs.CR
世界モデルに基づく具現化AIのセキュリティ:脅威・防御・評価のライフサイクル
世界モデルを核とする具現化AIのセキュリティ脅威を、データ構築から実行・適応までのライフサイクル全体で体系的に調査し、攻撃の分類、防御策、評価プロトコルを提示したサーベイ論文。
原題: Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation / Fazhong Liu, Zhuoyan Chen, Haozhen Tan 他
日本語で読む → - 論文ディープフェイク検出画像認識
不確実性を考慮したマルチビュー構造学習によるディープフェイク検出
ディープフェイク検出において、複数の証拠ストリーム(視覚・意味・構造)の不一致を利用して不確実性をモデル化し、分布シフト下での汎化性能とキャリブレーションを向上させるフレームワークを提案した。
原題: Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning / Muhammad Umar Farooq, Kutub Uddin, Awais Khan 他
日本語で読む → - 論文VLAAI
SpatialCLI: 空間ツールで推論し、その後ツールなしで推論する学習
視覚言語モデルに空間ツールを使った推論を教え、徐々にその能力を内部化させる3段階フレームワークを提案。ベンチマークで大幅な性能向上を実証した。
原題: SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them / Yang Zhou, Zixuan Huang, Sunzhu Li 他
日本語で読む → - 論文3DGS/編集画像認識
FocusGS: 学習済み3Dガウスアセットの局所修復と決定的編集のための空間デルタ層
3Dガウススプラッティングで学習済みのアセットに対し、局所的な修復と決定的な編集を「空間デルタ」として統一的に行う手法を提案。修復は追加のみ、編集は消去と挿入の組み合わせで実現し、既存手法より高い精度を達成した。
原題: FocusGS: Spatial Delta Layers for Local Repair and Deterministic Editing of Trained 3D Gaussian Assets / Yiqun Pan, Yukun Shi
日本語で読む → - 論文サーベイ画像認識
大規模基盤モデル時代の手と物体のインタラクション:再構築、生成、身体化転移
手と物体のインタラクション(HOI)モデリングにおける基盤モデルの活用を体系的にレビューし、幾何・意味・視覚の8つの事前知識に分類して、各タスクへの導入方法とロボット学習への応用を分析した論文。
原題: Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer / Weiquan Lin, Yu Deng, Shiyang Liu 他
日本語で読む →