論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/3 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文障害検出ロボティクス
FailureSpot: VLAモデルのためのラベル効率的なタイムスタンプレベル障害検出
VLAポリシーの実行中に発生する障害を、タイムスタンプ単位で正確に検出する手法を提案。未ラベルのアクションチャンクから弱教師信号を生成し、能動学習で重要な軌道のみに注釈を付けて検出器を微調整することで、ラベルコストを抑えつつ検出精度を向上させた。
原題: FailureSpot: Label-Efficient Timestamp-Level Failure Detection for Vision-Language-Action Models / Jie Ma, Zongxi Liu, Yi Zhu
日本語で読む → - 論文ナビゲーションロボティクス
連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考
VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。
原題: Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment / Shuhao Ye, Sitong Mao, Yuxiang Cui 他
日本語で読む → - 論文自動運転画像認識
離散的な心から連続的な行動へ:エンドツーエンド自動運転のための潜在整合プランニング
Vision-Language Modelの離散的な推論と自動運転の連続的な物理制約を橋渡しするため、潜在整合プランニングを備えたVLAフレームワークLaPlaを提案。量子化誤差を排除し、物理的に妥当な軌道を生成する。
原題: Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving / Ruoyu Yao, Yusen Xie, Qingzhao Liu 他
日本語で読む → - 論文継続学習ロボティクス
展開後物理AIのための継続的現場適応モデル(CFAM)
展開後も自律的に学習を継続できるモデルCFAMを提案し、5種類のロボットでデータ効率と適応性能を検証した。
原題: Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI / Amarjot Singh, Tanmay R. Pancholi, Jainam Kothari 他
日本語で読む → - 論文HMI/認知モデルロボティクス
人間と機械の相互作用のための統合的認知・人間工学アーキテクチャ:認知モデルと人間工学の融合
認知アーキテクチャ(SOAR、ACT-R、LIDA、COCOM)と人間工学の原則を統合し、動的環境での人間と機械の相互作用を改善するためのモデルを提案した。産業用ロボット応用で実証し、意思決定やスキル獲得のメカニズムを明らかにした。
原題: Toward an~Integrated Cognitive--Ergonomic Architecture for~Human--Machine Interaction: Combining Cognitive Models with~Human Factors Ergonomics / Antoine Lenat, Olivier Cheminat, Damien Chablat 他
日本語で読む → - 論文サーベイロボティクス
統合ロボット学習に向けて:表現、視覚言語行動、世界モデルの橋渡し
ロボット学習における表現学習、VLAモデル、世界モデルの3つのパラダイムを統一的に整理し、それらの相互作用と課題を分析したサーベイ論文。
原題: Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models / Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang 他
日本語で読む → - 論文データセット解析画像認識
画像サブセット間の差異を自然言語で記述することによる自動運転データセットの理解
自動運転データセットの2つの画像群の違いを自然言語で説明する「集合差分キャプショニング」を提案し、物体検出由来のパッチに着目して評価用ベンチマークAD-Diff Benchを構築した。
原題: Understanding Autonomous Driving Datasets by Describing Differences between Image Subsets in Natural Language / Julian Truetsch, Felix Hauser, Christoph Stiller 他
日本語で読む → - 論文HRI/ジェスチャ認識ロボティクス
SocioGesture: 人とロボットのインタラクションのためのリアルタイム適応型社会的ジェスチャ認識
ロボットが人との対話中に、招待や拒否などの社会的合図をノイズの多いオンボードセンサーからリアルタイムに認識するシステムを提案。軽量な骨格表現とデュアルストリームモデルで低遅延認識を実現し、オクルージョン耐性を高めつつ、不確実な区間を保存して適応的に語彙を拡張する。
原題: SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction / Wenjin Fu, Li-Fan Wu, Jerin Peter 他
日本語で読む → - 論文HRIロボティクス
ヒューマノイドロボットとの関与分析のための動的マルチモーダルHRIデータセット構築
ユーザーの関与を分析するためのマルチモーダルデータセットを構築する実験設計を提案し、生理信号・行動データ・自己報告を統合する。
原題: Establishing a Dynamic Multimodal HRI Dataset for Engagement Analysis with a Humanoid Robot / Buwan Kim, Wonse Jo
日本語で読む → - 論文操作学習ロボティクス
MINERVA: 操作ポリシーはどれだけ小さくできるか、LIBEROを解くために
LIBEROベンチマークを解くのに必要な最小のモデル容量を探るため、わずか0.54MパラメータのコンパクトなポリシーMINERVAを提案し、95.1%の成功率を達成。大規模VLAモデルと同等性能を桁違いに少ないパラメータで実現した。
原題: MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO? / Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa
日本語で読む → - 論文3D表現/ビデオ事前学習画像認識
3Dノイズの再考:最適化不要の形態学的摂動による3D認識ビデオ事前学習
3Dガウススプラッティングの各ガウスをピクセルとみなし、スケール・回転・枝刈りの摂動を加える最適化不要の正則化手法を提案し、疎な視点での3D表現のアーティファクトを軽減する。
原題: Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations / Onat Şahin, Mohammad Altillawi, George Eskandar 他
日本語で読む → - 論文評価ロボティクス
R2S-Eval: 視覚言語モデルによる実機からシミュレーションへのキャリブレーションを用いたロボット評価
ロボット操作ポリシーの評価を、実機からシミュレーションへのキャリブレーションと視覚言語モデルによる選好評価を組み合わせて行うパイプラインを提案し、実機評価の不安定性やコストを低減する。
原題: R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models / Yidi Wang, Feixiang Ruan, Ruoqu Chen 他
日本語で読む → - 論文ナビゲーションロボティクス
共有鳥瞰図による空陸協調型視覚言語ナビゲーション
UAVとUGVが協調する空陸協調型VLNの初の訓練不要ベースラインを提案し、共有鳥瞰図を用いて協調動作を実現、成功率77%を達成した。
原題: Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps / Shuning Zhang, Liang Li, Yunheng Wang 他
日本語で読む → - 論文群制御cs.GT
ゲーム理論に基づくドローン群防衛:応用微分ゲーム理論のケーススタディ
高価値資産を防衛するドローン群の目標割り当てと中間誘導問題に微分ゲーム理論を適用し、侵入群を合理的エージェントとして扱うナッシュ均衡戦略が、単独最適化ベースラインよりも迎撃成功率を向上させることをモンテカルロシミュレーションとベイズ分析で示した論文。
原題: Game-Theoretic Drone Swarm Defense: A Case Study in Applied Differential Game Theory / Ross E. Allen
日本語で読む → - 論文移動ロボット/精度評価ロボティクス
精密NDE計測のための移動ロボットプラットフォームの精度と再現性に関する比較研究
レーザートラッカーを用いた共通プロトコルで5種類の移動ロボットの静的・動的精度を評価し、航空宇宙NDEの許容誤差に対する各プラットフォームの補正センサ要件を明らかにした。
原題: A comparative study on the accuracy & repeatability of mobile robotic platforms for the delivery of precision NDE measurement / SeyedMohammadAmin Nabi Pour, S. Gareth Pierce, Randika Vithanage 他
日本語で読む → - 論文水中ロボティクス/BEV予測ロボティクス
AquaBEV: 3Dソナー監視による単眼水中BEV占有予測
水中ロボットの安全航行のため、単眼RGB画像からBEV占有マップを予測するモデルを提案。訓練時に3Dソナーを幾何学的監視として用い、キャリブレーション不要の極座標表現と因果デコードで精度を向上させた。
原題: AquaBEV: Monocular Underwater BEV Occupancy with 3D Sonar Supervision / Trung Tien Dong, Shengji Jin, Chen Chen 他
日本語で読む → - 論文VLA/強化学習ロボティクス
VLA-Precision: 非対称共同ブートストラップによる視覚言語行動モデルの効率的な実世界オンライン強化学習
実世界のオンライン強化学習を用いて、精密な操作タスクにおける視覚言語行動モデルの性能を向上させるフレームワークを提案した。
原題: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models / Chenyu Su, Zhaolong Shen, Yuan Qian 他
日本語で読む → - 論文動作計画ロボティクス
δ類似性なしで漸近的準最適性を達成する
サンプリングベースの動作計画アルゴリズムが漸近的準最適性を証明する際に暗に仮定しているδ類似軌道の保持が一般には成り立たないことを示し、その問題(crowding out)を考慮すればδ類似性なしでも漸近的準最適性を達成できることを示した論文。
原題: Achieving Asymptotic Near-Optimality Without $δ$-Similarity / Michael Moncton, Eric Frew
日本語で読む → - 論文自動運転機械学習
低コストでオープンなミニチュアAckermann車両を用いたエンドツーエンド自動運転プラットフォーム
低コストのミニチュアAckermann車両とデジタルツインを組み合わせた、エンドツーエンド自動運転研究用のオープンプラットフォームを提案し、行動クローニングのベースラインを実装・評価した。
原題: A Low-Cost, Open Platform for End-to-End Autonomous Driving on a Miniature Ackermann Vehicle / Gustavo Claudio Karl Couto, Eric Aislan Antonelo, Gabriel George Zipperer
日本語で読む → - 論文グリッパー設計ロボティクス
ARTiS: 分解作業における工具操作を強化する適応型ロボットグリッパー
分解作業で工具をしっかり握って使えるよう、柔らかい掌と指先、剛性機構を組み合わせた適応型グリッパーARTiSを提案・評価した論文。
原題: ARTiS: An Adaptive Robotic Gripper for Enhanced Tool Manipulation in Disassembly Applications / Roman Mykhailyshyn, Domae Yukiyasu, Harada Kensuke
日本語で読む → - 論文人型ロボット/共設計ロボティクス
BRIDGE: 形態と制御の共設計による物理AIのためのオープンソース人型ロボットプラットフォーム
人間の動作データを活用できる人型ロボットの設計を、形態と全身制御をデータ駆動で共最適化するフレームワークを提案し、その設計を実現したオープンソースの小型人型ロボット「Bridge」を公開した。
原題: BRIDGE: An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI / Jianren Wang, Letian Qian, Zikai Wang 他
日本語で読む → - 論文知識表現・推論AI
意味論的ベイズ世界モデル
知識グラフの確定的な事実表現と、確率的に推論する基盤モデルやエージェントとの不整合を指摘し、知識グラフ上の信念を共有・更新する「意味論的ベイズ世界モデル」を提案する論文。
原題: Semantic Bayesian World Models / Tommaso Soru
日本語で読む → - 論文自動運転画像認識
SV-WAM: 効率的な全方位ビュー世界行動モデルによるエンドツーエンド自動運転
全方位カメラ入力を用いた世界行動モデルを提案し、将来ビデオ予測を訓練時の補助信号として活用することで、推論時の計算負荷を抑えつつ安全な運転計画を実現した。
原題: SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving / Jinyang Wang, Shiwei Li, Junjian Wang 他
日本語で読む → - 論文両腕操作/VLA/データセットロボティクス
1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング
家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。
原題: Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections / Jiafeng Xu, Qi Li, Yan Shen 他
日本語で読む → - 論文セグメンテーション画像認識
DropClick: 農業ロボットデータのための半自動ワンクリックセグメンテーション
農業ロボットのセグメンテーションデータセットのアノテーションを簡略化するため、単一クリックで疑似ラベルを生成する半自動ツールDropClickを提案し、少ないクリック数で高い性能を達成した。
原題: DropClick: Semi-Automated One-Click Segmentation for Agricultural Robotic Data / Patrick Zimmer, Michael Halstead, Chris McCool
日本語で読む → - 論文対話システムAI
IRWOZ 2.0: 産業用ロボット対話のための大規模言語モデル駆動対話データセット
産業用ロボットとの対話システムの性能を向上させるため、大規模言語モデルを用いてIRWOZデータセットを改良し、ノイズを低減して精度を大幅に改善した。
原題: IRWOZ 2.0: A Large Language Model-driven Dialogue Dataset for Industrial Robot Conversations / Chen Li, Dimitrios Chrysostomou
日本語で読む → - 論文群制御ロボティクス
スキルベースの人間・ロボット・クレーン協調タスクのプログラミングと実行
CADモデルに基づく簡単なプログラミングと実行システムを提案し、パラメータ化されたスキルとモニタを備えた動的実行制御構造を実現。人間がクレーンとマニピュレータを指示して重い物体を挿入する協調タスクを例示。
原題: Programming and execution of skill-based human-robot-crane collaborative tasks / Taneli Lohi, Markku Suomalainen, Roope Mellanen 他
日本語で読む → - 論文自動運転/エッジコンピューティングロボティクス
スケーラブルなエッジ支援型融合とコネクテッド自動運転車の経路予測
エッジサーバが複数の自動運転車と路側機の情報を統合し、遮蔽を考慮して寄与度の高い車両を選びつつ、年齢制約内で将来軌道を予測するシステムを提案した。
原題: Scalable Edge-assisted Fusion and Path Prediction for Connected Autonomous Vehicles / Tyler Landle, Jackson Isenberg, Abhijit Chatterjee 他
日本語で読む → - 論文計画/ワールドモデル機械学習
潜在エネルギー行動計画とワールドモデル
潜在ワールドモデルを用いたモデル予測制御において、行動系列全体を最適化変数として扱い、終端状態のエネルギー最小化と目標記述子の一致を組み合わせる新しい計画手法LEAPを提案。4つの制御ドメインで成功率を77.5%から94.8%に向上させた。
原題: Latent Energy Action Planning with World Models / Phu Pham, Aniket Bera
日本語で読む → - 論文経路計画ロボティクス
コーナーケース:農業における自動運転のためのヘッドランド被覆経路計画
農地のヘッドランド(枕地)を効率的に被覆する経路計画手法を提案し、特に鋭角や鈍角のコーナーでの後退操作を可能にするポリゴン変形により、被覆率を向上させた。
原題: Corner Cases: Headland Coverage Path Planning for Autonomous Driving in Arable Farming / Riikka Soitinaho, Timo Oksanen
日本語で読む →