論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文物体検出画像認識
形状を考慮した回転バウンディングボックス(OBB)から水平バウンディングボックス(HBB)への変換
航空・衛星画像における船舶検出のため、回転バウンディングボックス(OBB)を水平バウンディングボックス(HBB)に変換する際に、船体の形状や充填度を考慮してより密着したHBBを生成する新しい手法を提案した。
原題: Shape-Aware Oriented Bounding Box (OBB) to Horizontal Bounding Box (HBB) Conversion / Badha Rathna Sabhapathy, Gotam Dahiya, Vishesh Vatsal
日本語で読む → - 論文手の動き表現/トークン化ロボティクス
DigitCode: 解剖学的単位による手の動きのシンボリックトークン化
手の動きを連続値ではなく解剖学的単位(骨、指、手全体)に基づく離散シンボルで表現する手法を提案し、量子化誤差を大幅に削減。指単位のトークンが生成された手の修正やロボットへのリターゲティングに有効であることを示した。
原題: DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units / Haoyu Gu, Haotian Lu, Jingrun Du 他
日本語で読む → - 論文VLA画像認識
ルートからステップへ:視覚言語ナビゲーションにおける意味的進捗と局所実行の分離
視覚言語ナビゲーションにおいて、ルート全体の指示と局所的な行動生成を分離するフレームワークRoute2Stepを提案し、進捗追跡の誤りと実行の誤りを区別して学習する。
原題: From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation / Xiangyun Huang, Xiangchen Wang, Runfeng Lin 他
日本語で読む → - 論文マニピュレーションロボティクス
フラットな方策を超えて:ロボット操作における身体化エージェントのための階層的事後学習
VLAモデルの事後学習を階層化し、高レベルのタスク計画と低レベルの行動実行を分離するフレームワークHiRoCを提案。強化学習と分布整合により長期的な操作性能を向上させる。
原題: Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation / He Kong, Zengjue Chen, Qi Wang 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける位置依存の盲点の発見と緩和
視覚言語行動モデルが作業空間内の特定領域で失敗しやすい「位置盲点」を発見し、その領域のデモデータで微調整することで性能を改善する手法を提案した。
原題: Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models / Dongdong An, Pengjie Zhao, Yihao Huang 他
日本語で読む → - 論文VLAロボティクス
VANE: 将来の視覚表現予測による視覚-言語-行動モデルの信頼性の高いテスト時訓練
VLAポリシーのテスト時訓練を信頼性高く行うため、現在の文脈に基づいて適応を条件付け、実行した行動の将来の視覚的結果から学習し、将来の証拠に基づいて更新を選択的かつ可逆的に行うフレームワークを提案した。
原題: VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction / Hongjin Ji, Guoyang Xia, Luoyang Sun 他
日本語で読む → - 論文視覚的注意/ロボット学習ロボティクス
行動から注意を学ぶ:ポリシー学習のための創発的視覚ボトルネック
行動教師信号のみから注目領域(ROI)を学習するSeekerを提案し、RGBクロップやマスク拡張、点群フィルタリングの空間インターフェースとして利用。実機で成功率を大幅に向上させた。
原題: Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning / Zheyu Zhuang, Ruiyu Wang, Nick Heppert 他
日本語で読む → - 論文操作/意味再構築ロボティクス
RoboSeg: 単一のアイ・イン・ハンドカメラによるロボット操作のためのオンライン部品レベル意味再構築
ロボット操作のための部品レベルの意味再構築システムを提案。VLMによる機能部品の発見とRGB-D再構築、SAM3によるマスク統合を組み合わせ、タスクに応じた把持生成を実現する。
原題: RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera / Zhaochen Lan, Mengxiang Lin
日本語で読む → - 論文群制御ロボティクス
不確実な自然を飛び越えて(FORTUNE):低空協調のための知的で人間中心の3D経路計画
都市環境での低空UAV協調センシングのため、不確実な地上関心点需要と社会的・環境的コストを考慮した3D経路計画とタスク割り当てを、階層的オフライン・オンラインフレームワークで解く手法を提案した。
原題: Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration / Minghui Liwang, Wenhan Jia, Xinlei Yi 他
日本語で読む → - 論文ドローン設計ロボティクス
ホバーフライ:マイクロ航空機を多モードホバークラフトに変えるローターシュラウドの実証研究
小型ドローンの飛行時間を延ばすため、クレイジーフライ2.1にカスタムシュラウドを装着し、高効率ホバークラフトと自由飛行ドローンの両方として動作する多モードロボットを設計・実験評価した。
原題: Hoverflie: An empirical investigation of rotor shrouds to transform micro air vehicles into multi-modal hovercraft / Mrinmoy Modak, Daniel S. Drew
日本語で読む → - 論文VLA/推論高速化ロボティクス
WA-SpecDec: 世界認識型投機的デコーディングによる視覚言語行動モデルの高速化
視覚言語行動モデルの推論を高速化するため、世界モデル由来の物理シーン認識を投機的デコードに組み込み、接触近傍での誤りを減らしつつ成功率を維持する手法を提案した。
原題: WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models / Zikang Wen, Yuning Zhang, Dong Yuan
日本語で読む → - 論文制御ロボティクス
CUDA MPC: GPUネイティブなモデル予測制御ソルバー
モデル予測制御のオンライン最適化をGPU上で完結させるフレームワークを提案し、長い予測ホライズンでもリアルタイム制御を実現した。
原題: CUDA MPC: A GPU-Native Solver for Model Predictive Control / Babak Akbari, Melissa Greeff
日本語で読む → - 論文VLAロボティクス
ゲートはキャッシュではない:ゲートの由来が訓練不要のVLAトークンスキップの閉ループ信頼性を決める
VLAモデルのトークンスキップ高速化において、前ステップの加速された順伝播からゲートを取るとスキップが累積して性能が崩壊することを示し、ロボット実行中に密な順伝播を1回行う「アクチュエーションスラックリフレッシュ」を提案して性能を回復させた。
原題: The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping / Qi Luo, Shuaijun Liu, Hao Zhao 他
日本語で読む → - 論文自動運転ロボティクス
PRISM: 特権的確率的潜在監督によるエンドツーエンド自動運転の運動計画
エンドツーエンド自動運転モデルの中間潜在表現を、将来のグラウンドトゥルース経路で確率的に監督するフレームワークを提案し、計画精度と衝突率を改善した。
原題: PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning / Volodymyr Havrylov, Faris Janjoš, Andreas Look 他
日本語で読む → - 論文VLAロボティクス
OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
原題: OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation / Tianyi Zhang, Ziyang Gong, Zhenjie Yang 他
日本語で読む → - 論文移動操作/VLAロボティクス
DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
原題: DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation / Zheng Yang, Wenjie Zhang, Xiangyu Chen 他
日本語で読む → - 論文VLA画像認識
ワールドトークン:訓練時ワールドモデリングによる身体化ポリシーの強化
視覚言語行動モデルに、訓練時に未来ビデオのノイズ除去を条件付けるワールドアダプタを導入し、推論時にはビデオモデルを除去して効率的な行動生成を実現する新しいアーキテクチャを提案した。
原題: World Tokens: Enhancing Embodied Policies with Training-Time World Modeling / Qu Tang, Benhui Zhuang, Bo Yuan 他
日本語で読む → - 論文マニピュレーションロボティクス
集中訓練と批評家分解による実世界オンライン強化学習の効率化:ロボット操作への応用
実世界でのオンライン強化学習を効率化するため、集中訓練と分散実行(CTDE)とハイブリッド報酬アーキテクチャ(HRA)を組み合わせ、複数のエージェントが共有する多頭批評家を導入した。タスク報酬と把握報酬を分離し、サンプル効率と性能を大幅に向上させた。
原題: Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition / Changhao Li, Yifang Zhang, Heng Zhang 他
日本語で読む → - 論文VLAロボティクス
Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留する
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
原題: Vid2WAM: Distilling Video Diffusion Priors into World Action Models / Chenhao Qiu, Ruixiang Wang, Runyi Zhao 他
日本語で読む → - 論文ナビゲーションロボティクス
ガウス型人間コスト関数を用いた社会的ナビゲーションのためのMPPIプランニング
歩行者の将来位置を予測し、移動方向に沿った異方性ガウス斥力場としてコスト化するMPPIプランナーを提案。混雑環境での衝突率を大幅に低減しつつリアルタイム性能を維持した。
原題: MPPI Planning with Gaussian-Based Human Cost Function for Social Navigation / Chinmay Mundane
日本語で読む → - 論文自動運転/強化学習機械学習
Dreamer-SAC: 潜在世界モデルにおけるオフポリシー学習によるサンプル効率的な自動運転
自動運転向けに、世界モデルとソフトアクタークリティックを組み合わせ、潜在空間でオフポリシー学習するフレームワークを提案。短いロールアウトとnステップ目標推定により、少ない実環境インタラクションで高い性能を達成した。
原題: Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving / Jiazhuo Li, Linjiang Cao, Qi Liu 他
日本語で読む → - 論文HRI/LLMロボティクス
知能の限界効用:短期・自由対話型ヒューマンロボットインタラクションにおけるLLM規模とユーザー知覚の非線形関係
19人の参加者が4B、8B、30BパラメータのLLMを搭載したロボットと短時間の自由対話を行い、知覚される知能や自然さに有意差がないことを示し、モデル規模の拡大が必ずしもユーザー体験向上につながらないことを明らかにした。
原題: Diminishing Returns of Intelligence: The Non-Linear Relationship Between LLM Scale and User Perception in Short-Duration Open-Ended Social Human-Robot Interactions / Amanda Rasille Røn Volf, Morten Roed Frederiksen
日本語で読む → - 論文サービスロボット/世界モデルロボティクス
PBD-AG: 不確実性を考慮した検査を備えた持続的ベースライン-デルタ能動グラフによる長時間稼働サービスロボットのための世界モデル
長時間稼働するサービスロボット向けに、安定した構造物と変化する物体イベントを分離した持続的な世界モデルを構築するフレームワークを提案。ロボットが自律的に環境を探索し、物体の状態を確率的に管理し、検査視点を選択することで、長期的な認識の信頼性を向上させる。
原題: PBD-AG: Persistent Baseline-Delta Active Graphs with Uncertainty-Aware Inspection for Long-Horizon Service Robots / Shuo Bao, Wei Dong, Shuyue Zhang 他
日本語で読む → - 論文UAVナビゲーションロボティクス
FlowPilot: 俊敏なUAVナビゲーションのためのリアルタイム世界行動モデリング
深度画像から将来のシーンと軌道を同時に生成するコンパクトな世界行動モデルを提案し、シミュレーションと実機で高速・高機動な飛行を実現した。
原題: FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation / Runqing Wang, Ding Yu, Pengyuan Min 他
日本語で読む → - 論文物体検出画像認識
データセット構成が組み込みリアルタイムUAV山火事検出に与える影響:コンパクトYOLOモデルを用いた検証
UAVによる山火事検出において、実画像とAI生成画像の混合やデータ拡張が性能に与える影響を、コンパクトなYOLOモデルで評価した。実データのみの非拡張データセットが最良の性能を示し、合成データや拡張の効果は限定的だった。
原題: Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models / Eduardo de los Santos, Andre S. Kelbouscas, Ricardo B. Grando 他
日本語で読む → - 論文触覚・力覚学習ロボティクス
物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
原題: Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning / Shilin Shan, Chuhao Zhou, Ruize Wang 他
日本語で読む → - 論文VLA/移動操作ロボティクス
意味的3Dガウススプラッティングによるオープンボキャブラリ移動操作のための身体化マルチモーダル基盤付け
家庭環境でのオープンボキャブラリ物体操作を実現するため、能動的マルチビュー意味的3Dガウススプラッティングと拡散型VLAポリシーを統合した身体化マルチモーダル基盤付けフレームワークを提案し、実ロボット評価で高い成功率を示した。
原題: Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting / Huosen Ou, Dongni Song, Yuncong Wang 他
日本語で読む → - 論文多物体追跡/UAVロボティクス
JitTrack: 敏捷なUAVの視点揺れに対するオンボード多物体追跡
UAVの機体運動による視点揺れに頑健なオンボード多物体追跡フレームワークを提案し、実機での追跡性能を検証した。
原題: JitTrack: Onboard Multi-Object Tracking Against Viewpoint Jitter for Agile UAVs / Yachun Shan, Feitian Zhang
日本語で読む → - 論文群制御ロボティクス
展開は運命ではない:未見のソフトウェア・ハードウェア・計算ペイロードによる現場でのロボット再構成
ロボットのサブシステム間の密結合によるモノリシック設計を解消し、実行時に未見のモジュールをプラグアンドプレイで統合・分散共有できる再構成フレームワークを提案。災害対応シナリオで実証した。
原題: Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads / Steven Swanbeck, Jonathan Salfity, Jeffery Gunawan 他
日本語で読む → - 論文移動操作/強化学習機械学習
LUCID: 想像上のダイナミクスによる潜在スキル統合制御による長期的ヒューマノイド移動操作
長期的なヒューマノイドの移動操作タスクを解決するため、学習したダイナミクスモデルの想像上のロールアウトを通じて再利用可能なスキルを計画する階層的モデルベース強化学習フレームワークを提案した。
原題: LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation / Cheng Guo, Mingzhe Ni, Angelo Cangelosi 他
日本語で読む →