論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/28 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文クラウドロボティクス/無線リソース管理制御
LUCID: デジタルツイン・イン・ザ・ループによるQoS保証ロボット制御のためのエージェント型AIフレームワーク
クラウドロボティクスにおける軌道計画と無線リソース管理を、LLMエージェントが動的に最適化問題として再構成するフレームワークを提案。大規模シーンを無線対応デジタルツインに変換し、QoS違反を回避する。
原題: LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control / Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu 他
日本語で読む → - 論文安全計画ロボティクス
PanelShield: 産業用パネル操作のための検証可能な閉ループ安全計画
産業用パネル操作の安全性を確保するため、LTLと安全FSMによる二重形式検証を組み込んだ閉ループ計画フレームワークを提案し、違反時の構造化カウンター例による修正を実現した。
原題: PanelShield: Verifiable Closed-Loop Safe Planning for Robotic Industrial Panel Operation / Guipeng Xin, Jiahe Xu, Chenhui Wan 他
日本語で読む → - 論文データセット画像認識
uScenes: 水中ロボット知覚のためのマルチモーダルRGB・3Dソナー画像データセット
水中ロボットの知覚向上のため、3Dマルチビームソナー点群とRGB画像を同期したマルチモーダルデータセットuScenesを構築し公開した。
原題: uScenes: A Multimodal RGB and 3D Sonar Dataset for Underwater Robot Perception / Trung Tien Dong, Zhenqi Wu, Aditya Penumarti 他
日本語で読む → - 論文タスク計画ロボティクス
MaCoPlanner: LLM支援による手動コンパイル型タスク計画と能動的安全検証を備えた産業用パネル操作ロボット
産業用パネル操作ロボット向けに、機器マニュアルから知識をコンパイルし、計画生成前に安全制約を検証するタスク計画フレームワークを提案。独立評価で違反率2.7%を達成し、タスク成功率を大幅に向上させた。
原題: MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation / Guipeng Xin, Jiahe Xua, Mohammad Deghat 他
日本語で読む → - 論文画像改ざん検出画像認識
FUSED: 法医学的・意味的特徴の混合専門家によるAIインペインティング検出と位置特定
拡散モデルによる画像の部分改ざん(インペインティング)を検出・位置特定する統一フレームワークを提案。低レベルの法医学的手がかりと高レベルの意味的特徴をスパースゲート型混合専門家アーキテクチャで組み合わせ、画像全体の操作スコアと画素単位のマスクを予測する。
原題: FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization / Anton Nuzhdin, Marcel Worring, Ivona Najdenkoska
日本語で読む → - 論文ナビゲーションロボティクス
STEGNav: 時空間イベントグラフ推論によるマルチモーダル生涯物体ナビゲーション
従来のシーングラフを時空間イベントグラフに拡張し、VLMベースのエージェントが目標物体と探索フロンティアを統合的に推論する訓練不要のナビゲーションフレームワークを提案した。
原題: STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation / Yang Chen, Zhenyu Huang, Wenbo Fu 他
日本語で読む → - 論文タスク仕様ロボティクス
人間の自己制約推論に基づくロボットタスク仕様のための線形時相論理変換
自然言語のロボット指示を線形時相論理(LTL)に変換する際、構造的知識をモデル内部に組み込む自己制約推論(SCR)フレームワークを提案し、制約充足と汎化性能を向上させた。
原題: Linear Temporal Logic Translation via Human-Inspired Self-Constrained Reasoning for Robot Task Specification / Haofei Hou, Fanxu Meng, Shunyi Zhao 他
日本語で読む → - 論文HRIロボティクス
雑談から親密さへ:協調タスクにおけるロボットの自己開示の探求
産業用マニピュレータを用いて、雑談中の自己開示の度合い(低・高)が人間とロボットの協調に与える影響をユーザー研究(N=50)で調査した。低開示条件の方が参加者の自己開示が多く、チームワークと調整の評価も高かった。
原題: From Small Talk to Rapport: Exploring Robot Self-Disclosure in Collaborative Tasks / Kaitlynn Taylor Pineda, Anvii Mishra, Brian Chien 他
日本語で読む → - 論文動作生成ロボティクス
PAMoR: ヒューマノイドロボットのためのリアルタイムパラメトリック感情動作生成
ロボットの動作に感情を定量的にパラメータ化して組み込む手法を提案。価覚醒座標を制御パラメータとして用い、リアルタイムで全身動作を生成する。
原題: PAMoR: Parameterized Affective Motion Generation in Real Time for Humanoid Robots / Yan Pan, Lingfan Bao, Tianhu Peng 他
日本語で読む → - 論文マルチエージェント/ベンチマークロボティクス
CoCoBench: 具現化マルチエージェントタスク計画のための協調調整ベンチマーク
マルチエージェントの協調失敗を細かく診断できるベンチマークCoCoBenchを提案し、897の検証済みインスタンスで4種類の協調構造を評価する。
原題: CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning / Yang Chen, Ye-Xin Xie, Lirong Che 他
日本語で読む → - 論文群制御ロボティクス
未校正センサを用いた確率的マルチロボットガス源位置推定:分散推定アプローチ
センサの個体差や非線形性に頑健なランクベース特徴を用いて、各ロボットが局所信念を推定し、専門家の積で統合することで、校正なしでガス源を高精度に特定する分散フレームワークを提案した。
原題: Probabilistic Multi-Robot Gas Source Localization with Uncalibrated Sensors: A Distributed Estimation Approach / Wanting Jin, Marc Zoel Arias Mitjà, Alcherio Martinoli
日本語で読む → - 論文TAMP/基盤モデル/部分観測ロボティクス
途中で計画する:部分観測操作におけるTAMP実行のためのイベントトリガ型基盤モデル計画
部分観測環境での操作タスクに対し、可視状態のみで計画し、物体発見を再計画イベントとして扱うLLM/VLMベースのTAMPフレームワークを提案し、RLBench/CoppeliaSimで評価した。
原題: Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation / Puru Ojha, Narendhiran Vijayakumar, Nav Singhal 他
日本語で読む → - 論文把持検出ロボティクス
変形した無菌カートンの訓練不要な吸着把持検出:視覚言語モデルと幾何学的表面スコアリングを用いて
変形した飲料カートンを選別するロボットのため、訓練なしで対象物の識別と把持点選択を分離し、視覚言語モデルと幾何学的スコアリングで吸着点を選ぶシステムを提案。実機で88.2%の単一物体把持成功率を達成。
原題: Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring / Marin Maletic, Goran Vasiljevic
日本語で読む → - 論文VLAAI
CEDAR: 言語誘導型身体的行動のための検証可能なインターフェースとしてのオートマトン
自然言語の指示を正規言語として表現し、決定性有限オートマトンに変換することで、制約を検証可能な実行可能なオブジェクトとして扱うフレームワークを提案。Minecraftで時間的・空間的制約を維持し、LLMクエリを削減できることを示した。
原題: CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action / Lekai Chen, Alvaro Velasquez, Ashutosh Trivedi
日本語で読む → - 論文動画予測AI
AcrossVAM1.0: テキスト支援ロボット動画予測のための粒子世界モデリング
ロボットの将来フレーム予測を、物体中心の動きと高周波の外観に分解し、軽量なTransformerと粒子表現で実現するモデルを提案した。
原題: AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction / Yafei Zhang, Nan Wu
日本語で読む → - 論文自動運転/セキュリティロボティクス
自動運転車に対する敵対的キャリブレーション攻撃
自動運転車のカメラとLiDARのオンラインキャリブレーションを標的とした初の物理攻撃手法を提案し、単一の敵対的ポスターで誤検知を誘発しつつキャリブレーションを誤らせることで、物体検出や走行制御に深刻な影響を与えることを示した。
原題: Adversarial Calibration Attack on Autonomous Vehicles / Liangkai Liu, Qingzhao Zhang, Kang G. Shin
日本語で読む → - 論文群制御制御
有界合理性下での人間機械協調のためのグラフォン設計:確率ブロックモデルの最適性
不均一な合理性を持つエージェントがstag-huntゲームで協調するためのネットワーク構造を、平均場近似と変分法を用いて最適化する手法を提案。
原題: Graphon Design for Human-Machine Coordination under Bounded Rationality: Optimality of Stochastic Block Models / Zhewei Wang, Vu Anh Phi, Marcos M. Vasconcelos
日本語で読む → - 論文クロスビュー検出画像認識
A-PAIR: 空対地クロスビュー人物参照検出のためのベンチマークとID一貫性グラウンディングフレームワーク
空対地のクロスビューで人物を言語で参照して検出する新しいタスクを定義し、ベンチマークとID一貫性を保つグラウンディング手法を提案した。
原題: A-PAIR: A Benchmark and Identity-Consistent Grounding Framework for Air-Ground Cross-View Referring Person Detection / Zhoupeng Guo, Xinjie Yao, Yunqi Zhu 他
日本語で読む → - 論文世界モデル評価ロボティクス
RoboPhys-3D: 3D再構成による包括的な具現化世界モデル評価
ロボット操作タスクのビデオ世界モデルを3D再構成に基づいて評価するベンチマークを提案し、生成ビデオの3Dシーン整合性とタスク実行可能性を測定する。
原題: RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction / Tianyi Wang, Jiazhou Chen, Yiming Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
CAVE-NAV: VLMを用いた水中洞窟環境における自律3次元ナビゲーション
水中洞窟での自律ナビゲーションのために、視覚言語モデルと思考連鎖推論を用いて環境の手がかりから進行可能な方向を推定し、衝突回避を実現するフレームワークを提案した。
原題: CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments / Zhenqi Wu, Yuanjie Lu, Yisheng Zhang 他
日本語で読む → - 論文変形物体操作ロボティクス
ChainSplat: ねじ理論に着想を得た、多視点RGBビデオから変形可能な線状物体の動力学を学習する物理モデル
多視点RGBビデオのみから、ケーブルやロープなどの変形可能な線状物体の3D形状・外観・運動学・動力学を同時に学習するフレームワークを提案。物体を回転関節で連結された剛体リンクの開連鎖としてモデル化し、ガウススプラッティングと統合することで高精度な予測と制御を実現した。
原題: ChainSplat: A Physics-Inspired Screw-Theoretic Model for Learning Deformable Linear Object Dynamics from Multi-View RGB Videos / Seungyeon Kim, Noémie Jaquier
日本語で読む → - 論文VLA画像認識
Iron: 意図整合と回顧的双方向学習による汎用仮想エージェントの性能向上フレームワーク
GUIエージェントの訓練において、低レベル行動と高レベル意図の細粒度な整合を実現するステップワイズ循環整合報酬と、失敗軌跡を再利用する回顧的再現メカニズムを導入し、データ効率と性能を向上させた。
原題: Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents / Jiahe Ying, Wendong Bu, Kaihang Pan 他
日本語で読む → - 論文検証済み探索自然言語
オフィス規模の検証済み探索における演算子パッケージ、提案者強度、構築ファミリーのプラトー
FunSearch型の検証済み探索ループをオフィス規模で制御実験し、提案側の演算子パッケージ(ノート、障害物、反発)の効果を2^3要因計画で評価した。
原題: Operator Packages, Proposer Strength, and Construction-Family Plateaus in Office-Scale Verified Search / Roberto I. Ono Filho
日本語で読む → - 論文剛体運動補間ロボティクス
剛体運動のDual Park-Ravani補間:加速度場の連続性とホロノミック・エルミート修復
Park-Ravani補間を直交双対テンソル群に拡張し、剛体姿勢と速度・加速度の連続性を保証する手法を提案。さらに、非ホロノミックな欠陥を双対対数座標でのエルミート補間により修復する。
原題: Dual Park-Ravani Interpolation of Rigid Motions: Acceleration-Field Continuity and Holonomic Hermite Repair / Daniel Condurache
日本語で読む → - 論文惑星探査/認識画像認識
MANTLE: モジュラーアップリンク原理を用いた適応型惑星表面認識のためのフレームワーク
火星探査ローバーのための地形分類とボルダーセグメンテーションを同時に行うマルチタスクネットワークを提案。共有バックボーンを固定し、タスク特化ヘッドを地球で訓練してアップリンクするモジュラー設計が特徴。
原題: MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle / Pranav Durai, Gary Doran
日本語で読む → - 論文計画/最適化ロボティクス
CLIPPER: 反復型空間カバレッジ計画のための再生可能なショートリスト最適化
都市規模のマイクロモビリティ計画において、制約を満たしつつ高速に再計画できるCLIPPERを提案。候補プールと正確な利得計算を組み合わせ、フルグリーディとほぼ同等のカバレッジを維持しながら計算時間を大幅に削減する。
原題: CLIPPER: Replayable Shortlisted Optimization for Repeated Spatial Coverage Planning / Julian Teusch, Jörg Philipp Müller, Monika Sester
日本語で読む → - 論文遠隔操作ロボティクス
バーチャルリアリティを用いた温室園芸のための遠隔ヒューマンロボットインタラクション
温室環境での葉の検査と土壌水分評価のために、VR遠隔操作を用いたロボットシステムの有効性を評価した研究。植物の葉の病気検出精度や灌水必要性の判定成功率を測定し、植物の樹冠形態が土壌水分評価の信頼性に強く影響することを見出した。
原題: Remote Human and Robot Interaction for Greenhouse Gardening Using Virtual Reality / Daniel Udekwe, Hasan Seyyedhasani
日本語で読む → - 論文VLA/操作ロボティクス
TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作
視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。
原題: TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation / Jiarui Yang, Yehao Lu, Yuning Su 他
日本語で読む → - 論文群制御ロボティクス
バケツリレー方式:異種ロボットチームのための効率的で堅牢な局所負荷分散
異種ロボット群が1次元空間で協調輸送する際、局所的な衝突感知のみで負荷分散を実現するバケツリレー方式を提案し、トークンによる安定化で収束を保証した。
原題: Pass the Bucket: Efficient, Robust, Local Load Balancing for Teams of Heterogeneous Robots / Tobias Wallner, Dominik Krupke, Arne Schmidt 他
日本語で読む → - 論文ビジョン言語モデル機械学習
Chart2SVG: ラスターチャート画像からの編集可能なSVG生成
ラスターチャート画像を、構造化され意味的に豊かなSVGに変換するマルチモーダル大規模言語モデルを提案。チャート固有のセマンティックトークンと専用データセットを用いて、視覚的精度と構造的一貫性を両立した編集可能なSVGを生成する。
原題: Chart2SVG: Editable SVG Generation from Raster Chart Images / Jinning Cui, Lu Chen, Haoyan Shi 他
日本語で読む →