論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/27 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御cs.MA
密集倉庫におけるオンライン複数エージェントのピックアップ・デリバリーのための固定避難所予約
密集した倉庫で、各エージェントが自分の開始セルを固定の避難所として予約し、他のエージェントがそれを障害物として扱うことで、タスク完了を保証する手法を提案した。
原題: Fixed-Haven Reservation for Online Multi-Agent Pickup and Delivery in Dense Warehouses / Taisei Hirayama, Kohei Yoshida, Hiroki Sakaji 他
日本語で読む → - 論文LLMエージェントAI
LLMエージェントのマルチターン一貫性評価:生存分析と失敗理由の分類体系
20ステップのマルチエージェント実験で8モデル・約8.5万軌跡を分析し、報酬を先延ばしにするか即時獲得するかの一貫性を生存分析で評価。失敗理由を7分類し、時間・文脈による変化や熟考の矛盾傾向を明らかにした。
原題: Evaluation of Multi-Turn Consistency in LLM Agents: Survival Analysis and Failure-Rationale Taxonomy / Igor Bogdanov, Olga Manakina, Chung-Horng Lung
日本語で読む → - 論文VLA画像認識
PointRL: 検証可能なアノテーション証拠から点レベルの視覚言語グラウンディングを学習する
点座標を出力とする視覚言語モデルのグラウンディング性能を、既存のアノテーションを検証器として利用する強化学習フレームワークPointRLで向上させた。
原題: PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence / Jingyang Su, Pu Cao, Xiuze Jin 他
日本語で読む → - 論文視覚推論画像認識
VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
原題: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning / Junxiang Xu, Ruisi Wang, Fanyi Pu 他
日本語で読む → - 論文飛行制御ロボティクス
安全かつ最適な飛行を目指して: 完全駆動マルチロータのための生存可能カーネルMPC
完全駆動マルチロータの安全な姿勢軌道生成を、生存可能性理論とデータ駆動手法を組み合わせたMPCフレームワークで実現し、障害物回避を動的バウンディングボックスで保証する手法を提案した。シミュレーションで実時間性能と安全性を検証した。
原題: Towards safe and optimal flight: Viability Kernel MPC for Fully Actuated Multirotor / Massimiliano Bertoni, Alberto Piccina, Gianni Lunardi 他
日本語で読む → - 論文ディープフェイク防御cs.CR
汚染ピクセルでディープフェイク動画を暴く
公開された顔動画に視認しにくい構造化ノイズを埋め込み、ブラックボックスの改ざんツールで加工された際に透かしが顕在化する能動的防御手法を提案した。
原題: Can Tainted Pixels Expose Deepfake Videos? / Juan Hu, Shaojing Fan, Sanjay Saha 他
日本語で読む → - 論文3次元再構成ロボティクス
自律実験室ロボットのためのニューラル3次元再構成のクロスプラットフォームベンチマーク
実験室ロボットが使うニューラル3次元再構成手法(NeRF、3Dガウシアンスプラッティング、SAM3D)を、シングルボードコンピュータからサーバー級ノードまで様々なGPU環境で評価し、リアルタイム性能と品質のトレードオフを明らかにした。
原題: Cross-Platform Benchmark of Neural 3D Reconstruction for Autonomous Laboratory Robots / Yongho Kim, Mengjiao Han, Victor Mateevitsi 他
日本語で読む → - 論文連続体ロボット/物理情報ニューラルネットワークロボティクス
拘束を考慮した物理情報ニューラルネットワークによる協調操作型連続体ロボットの静的形状推定
腱駆動の連続体ロボットと操作対象物が閉ループを形成する問題に対し、物理情報ニューラルネットワーク(PINN)を用いて静的平衡と幾何学的閉ループ拘束を満たす形状推定を実現した。データ駆動型ニューラルネットワークと比較し、少ないデータやノイズ下での精度向上と高速な推論を実証した。
原題: Constraint-Aware Physics-Informed Neural Networks for Static Shape Estimation of Co-Manipulative Continuum Robots / Rana Danesh, Pari Qarehdaghi, Farrokh Janabi-Sharifi
日本語で読む → - 論文VLAロボティクス
Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
原題: Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization / Jiaming Zhou, Qihang Zhang, Gangwei Xu 他
日本語で読む → - 論文マニピュレーションロボティクス
リー群制約付きMeanFlowによる高速生成的把持
リー群上のMeanFlowを用いて、少数のネットワーク評価で高品質な把持を生成する手法を提案し、ACRONYMデータセットで既存手法と同等の性能を達成しつつ最大39倍の高速化を実現した。
原題: Fast Generative Grasping via Lie Group-Constrained MeanFlow / S. Talha Bukhari, Yi Wei, Ruiqi Ni 他
日本語で読む → - 論文自動運転ロボティクス
コミット前のゲーティング:意図の分岐を予測して自動運転における事後意思決定の失敗を防ぐ
言語ガイドによる意図モジュールが意図と軌道の乖離スコアを計算し、計画操作を実行前にゲートすることで、自動運転の意思決定失敗を防ぐ手法を提案・評価した。
原題: Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving / Cong Xu, Ravi Sankar
日本語で読む → - 論文VLA画像認識
StreamPI: 視覚・言語・行動モデルのためのストリーミング型マルチモーダル時間モデリング
単一フレームのVLAモデルに追加パラメータなしで時間的推論能力を付与するフレームワークを提案し、実ロボットタスクで有効性を実証した。
原題: StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models / Zhe Liu, Jinghua Hou, Yuxiang Lu 他
日本語で読む → - 論文群制御ロボティクス
VirTooS: ROS 2とUnityを用いた自律移動ロボット群管理のための仮想化ツールキット
ROS 2とUnityを組み合わせた、複数の自律移動ロボットの群管理タスクを実現するための仮想化ツールキットを提案。現実と仮想のロボットが混在する環境でタスク割り当て実験を可能にする。
原題: VirTooS: A ROS 2 - Unity Virtualization Toolkit for Fleet Management of Autonomous Mobile Robots / Andrea Drudi, Lorenzo Pichierri, Andrea Testa 他
日本語で読む → - 論文ロボット操作ロボティクス
R^3: 強化学習による自然言語推論を用いたロボットの訓練
この論文は、ロボット操作タスクにおいて、視覚言語モデル(VLM)を自然言語で推論するように訓練し、その推論結果を低レベル操作ポリシーのガイドとして利用する手法を提案している。
原題: $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning / Lehong Wu, Yuxiao Qu, Zheyuan Hu 他
日本語で読む → - 論文セキュリティ/UAVロボティクス
ファントム・ナビゲーター:リアルタイム追跡とGPSスプーフィングによるステルスかつ精密な無人航空機のリダイレクト
GPSスプーフィングとリアルタイム追跡を組み合わせ、UAVを指定地点へ秘密裏に正確に誘導する攻撃手法を提案・実装した。
原題: Phantom Navigator: Stealthy and Precise Unmanned Aerial Vehicle Redirection with Real-Time Tracking and GPS Spoofing / Haocheng Meng, Shaocheng Luo, Songqiao Xie 他
日本語で読む → - 論文ベンチマーク評価ロボティクス
物理AIベンチマーク冗長性の統計的監査
物理AIモデルのベンチマーク評価における冗長性を統計的に分析し、冗長なベンチマークを削減してもランキングの情報を保持できることを示した論文。
原題: A Statistical Audit of Physical AI Benchmark Redundancy / Zaruhi Navasardyan, Hrant Davtyan
日本語で読む → - 論文車両インタラクションAI
ゲームを賢く選ぶ:実世界の車両インタラクションにおけるゲーム理論構造の計測
実世界の車両軌跡データから、同時的・逐次的・非対称なインタラクション構造を計測するフレームワークを提案し、6つのデータセットで評価した。
原題: Choose Your Game Wisely: Measuring Game-Theoretic Structures in Real-World Vehicle Interactions / Yueyuan Li, Rongcheng Nie, Weijie Xi 他
日本語で読む → - 論文マニピュレーションロボティクス
VISTA: 視覚から推定する空間接触注意による高密度接触操作
接触を伴う精密操作のため、視覚のみからグリッパの変形を推定し、触覚センサなしで接触情報を獲得する模倣学習フレームワークを提案した。
原題: VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation / Jiayi Chen, Wenlong Dong, Yan Huang 他
日本語で読む → - 論文ナビゲーションロボティクス
AGRO-Nav: 自律的なグラフベース果樹園ナビゲーション
果樹園の木の列からトポロジカルグラフを自動構築し、Dijkstra探索とTheta*経路で滑らかな経路を生成するナビゲーション手法を提案。実地試験でA*やTheta*より高精度かつ高速に走行できることを示した。
原題: AGRO-Nav: Autonomous Graph-based Orchard Navigation / Ho Young Yun, Jaemin Yu, Duksu Kim
日本語で読む → - 論文マニピュレーションロボティクス
PRISM: 投影統合型サンプリングベースMPCとベイズコスト調整による双腕マニピュレーション
GPU物理シミュレータをオンライン世界モデルとして用い、QPガイド付きサンプリングと投影により運動学的制約を満たす双腕操作のMPCフレームワークを提案。ベイズ最適化でコスト重みを自動調整し、複雑な双腕タスクで成功率を向上。
原題: PRISM: Projection-Integrated Sampling-Based MPC with Bayesian Cost Tuning for Bimanual Manipulation / Alinjar Dan, Iryna Hurova, Karl Kruusamäe 他
日本語で読む → - 論文ナビゲーションロボティクス
EgoNav: 学習されたウェイポイントと幾何学認識型ローカル制御を橋渡しする堅牢な屋内ナビゲーション
画像ゴールナビゲーションのための階層型システムで、学習済みウェイポイント予測を幾何学的安全性と方向整合性で補正し、適応型ローカルプランナーで実行する。シミュレーションと実機ヒューマノイドで成功率と経路効率を向上させた。
原題: EgoNav: Bridging Learned Waypoints and Geometry-Aware Local Control for Robust Indoor Navigation / Jing Wang, Shiqi Zhao, Hairong Qu 他
日本語で読む → - 論文ナビゲーションロボティクス
社会的ナビゲーションのためのアドバンテージ駆動型明示メモリ
ロボットのナビゲーション方策に、重要なイベントにつながる過去のステップを明示的に記憶する非パラメトリックメモリを導入し、シミュレーションから実環境への適応や稀な衝突などの失敗への対応を改善した。
原題: Advantage-Driven Explicit Memory for Social Navigation / Yeonsoo Park, Mattia Racca, Guillaume Bono 他
日本語で読む → - 論文VLAロボティクス
RA-VLA: テスト時適応のための検索拡張VLA
新しいタスク分布に弱いVLAモデルの問題を解決するため、行動に合わせた文脈検索と実行パイプラインを統合した検索拡張VLAフレームワークを提案し、LIBEROベンチマークと実環境で高い成功率と効率を実証した。
原題: RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation / Sanghwan Jang, Minjin Jeon, Minsoo Kim 他
日本語で読む → - 論文ワールドモデル/能動学習ロボティクス
ConfAL-WM: 信頼度ガイドによる行動条件付きワールドモデルの能動学習
行動条件付きワールドモデルの誤差が集中する局所領域を、軽量な信頼度プローブで検出し、能動学習で効率的にデータ選択・重み付けして事後学習するフレームワークを提案した。
原題: ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models / Xiang Liu, Sen Cui, Changshui Zhang
日本語で読む → - 論文多体動力学ロボティクス
溶接トーチ用アンビリカルの動的モデリングとロボット動力学への影響
溶接トーチのケーブルを多体動力学でモデル化し、ロボットへの反力を効率的に計算する手法を提案した論文。
原題: Dynamic Modeling of a Welding Torch Umbilical and Its Impact on Robot Dynamics / Nicolas Gautier, Yves Guillermit, Mathieu Porez 他
日本語で読む → - 論文行動予測画像認識
ポーズアンカー型オプティカルフローによるヒューマンロボット協調における低遅延行動予測
人間の関節周辺の局所的な動きを捉えるポーズアンカー型オプティカルフロー表現(PoseOFF)を提案し、行動予測の精度を向上させた。
原題: Pose-Anchored Optical Flow for Low-Latency Human Action Anticipation in Human-Robot Teaming / Lewis de Zoete Grundy, Chris McCarthy, Christopher Fluke
日本語で読む → - 論文タクソノミー/建設ロボットロボティクス
建設作業ロボットのための作業活動タクソノミー
建設現場の作業を体系化するタクソノミーTARCATを提案し、41の動作プリミティブを定義してロボットのスキル構築に活用する。
原題: A Taxonomy of Construction Task Activities for Robot Workers / Sadman Sakib, Zhangyi None Peng, Yujie Pang 他
日本語で読む → - 論文探索ロボティクス
RAEM: 四足ロボットによる多階層環境の堅牢な自律探索
多階層環境での四足ロボット探索のための堅牢なフレームワークを提案。局所・大域のハイブリッド traversability 表現と階段中心合わせ戦略により、計算効率と探索安定性を向上。
原題: RAEM: Robust Autonomous Exploration for Multi-Floor Environments with a Quadruped Robot / Zikang Yuan, Yuan Ren, Yian Wang 他
日本語で読む → - 論文報酬学習機械学習
ペアワイズを超えて:選好に基づく報酬学習のためのリストワイズ視覚言語監督
視覚言語モデル(VLM)による画像ベースの選好を、ペアワイズではなくリストワイズのランキングとして扱い、Plackett-Luceモデルを用いて報酬関数を学習する新しいフレームワークを提案。Meta-World操作タスクで有効性を実証した。
原題: Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning / Srivalli Katkuri, Maxwell Kawada, Juan Wachs
日本語で読む → - 論文動画生成画像認識
4DStreamCtrl: オンライン4D制御によるインタラクティブ動画生成
カメラと物体の動きを3D点トラックで統一し、リアルタイムで長い動画を生成できるモデルを提案した。
原題: 4DStreamCtrl: Interactive Video Generation with Online 4D Control / Shiqian Li, Chenguo Lin, Zhiguang Liu 他
日本語で読む →