論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文エッジAI/ハードウェアアクセラレータロボティクス
Gleanmer: リアルタイム3Dガウス占有マッピング用6mW SoC
エッジ向けの高精細3D占有マップ構築を低消費電力で実現するため、ガウス分布を用いたマップ表現に特化したアクセラレータを備えたSoCを設計・実装した。アルゴリズムとハードウェアの協調最適化により、マップ構築・クエリのエネルギーを最大63%・81%削減し、16nm CMOSで6mW以下でリアルタイム動作を達成した。
原題: Gleanmer: A 6 mW SoC for Real-Time 3D Gaussian Occupancy Mapping / Zih-Sing Fu, Peter Zhi Xuan Li, Sertac Karaman 他
日本語で読む → - 論文ナビゲーションロボティクス
AERR-Nav: ゼロショット物体ナビゲーションのための適応的探索・回復・回想戦略
未知の多階建て環境でのゼロショット物体ナビゲーションを改善するため、ロボットの状態を動的に切り替える適応的戦略と、高速・低速思考モードを備えた探索状態を提案した。
原題: AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation / Jingzhi Huang, Junkai Huang, Haoyang Yang 他
日本語で読む → - 論文車両ダイナミクスモデリングロボティクス
物理情報を組み込んだ二重分岐エンコーダによる深層混合クープマン車両ダイナミクスモデル:分散電動駆動トラック向け
分散電動駆動トラックの複雑な非線形ダイナミクスを、クープマン作用素理論と二重分岐エンコーダを用いて線形埋め込み空間で高精度にモデル化する手法を提案した。
原題: Physics-informed Deep Mixture-of-Koopmans Vehicle Dynamics Model with Dual-branch Encoder for Distributed Electric-drive Trucks / Jinyu Miao, Pu Zhang, Rujun Yan 他
日本語で読む → - 論文モデル予測制御制御
時空間ガウス過程近似を用いたモデル予測制御のリアルタイムオンライン学習
モデル予測制御の精度向上のため、未知の残差ダイナミクスを時空間ガウス過程で近似し、計算量を一定に保ちながらリアルタイムでオンライン学習を可能にする手法を提案。シミュレーションと自動ミニチュアレースの実機実験で性能を実証した。
原題: Real-Time Online Learning for Model Predictive Control using a Spatio-Temporal Gaussian Process Approximation / Lars Bartels, Amon Lahr, Andrea Carron 他
日本語で読む → - 論文人型制御ロボティクス
Heracles: 精密追従と生成的合成を橋渡しする汎用人型制御
人型ロボットの汎用制御において、厳密な参照追従と生成的な適応を統合する拡散モデルベースの中間層を提案し、外乱に対する頑健性と自然な回復動作を実現した。
原題: Heracles: Bridging Precise Tracking and Generative Synthesis for General Humanoid Control / Zelin Tao, Zeran Su, Peiran Liu 他
日本語で読む → - 論文シミュレーションロボティクス
Kamino: GPUベースの大規模並列マルチボディシミュレーション - 複雑なトポロジーへの対応
GPU上で複雑な機械的結合(閉ループなど)を持つ多体系を高速に並列シミュレーションする物理ソルバーを提案し、強化学習による歩行ポリシー学習を実証した。
原題: Kamino: GPU-based Massively Parallel Simulation of Multi-Body Systems with Challenging Topologies / Vassilios Tsounis, Guirec Maloisel, Christian Schumacher 他
日本語で読む → - 論文シミュレーションロボティクス
CARLA-Air: CARLA世界でのドローン飛行--空陸具現知能のための統合基盤
CARLAとAirSimを単一のUnreal Engineプロセス内で統合し、都市運転とマルチローター飛行を物理的に一貫した環境で同時にシミュレートするオープンソース基盤を提案した。
原題: CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence / Tianle Zeng, Yanci Wen, Hong Zhang
日本語で読む → - 論文VLA機械学習
推論効率から身体効率へ:Vision-Language-Actionモデルの効率指標の再検討
VLAモデルの効率をパラメータ数やFLOPsではなく、タスク完了時間や軌道の滑らかさなど実機での身体的行動で評価すべきだと示し、従来の効率化手法が実機性能を必ずしも向上させないことを実験的に明らかにした。
原題: From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models / Zhuofan Li, Hongkun Yang, Zhenyang Chen 他
日本語で読む → - 論文sim2realロボティクス
適応的力差量子化による低解像度観測を用いた堅牢な布地解しのシミュレーションから実世界への転移
布地解しタスクにおいて、力の正確な値ではなく粗い変化パターンに着目し、力入力を離散化した時間差分と状態依存の量子化閾値で表現する手法を提案。シミュレーションと実世界の両方で成功率と堅牢性が向上することを示した。
原題: Robust Sim-to-Real Cloth Untangling through Reduced-Resolution Observations via Adaptive Force-Difference Quantization / Yoshihisa Tsurumine, Yuki Kadokawa, Kohei Hayashi 他
日本語で読む → - 論文VLA画像認識
VLA-Thinker: 画像思考による視覚言語行動モデルの性能向上
視覚入力を動的に再参照できる思考フレームワークを導入し、2段階学習でロボット操作性能を大幅に向上させた。
原題: VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning / Chaoyang Wang, Wenrui Bao, Sicheng Gao 他
日本語で読む → - 論文HRIロボティクス
RFM-HRI:医療ロボットの失敗・ユーザー反応・回復選好を記録したマルチモーダルデータセット(物品取り出しタスク向け)
医療現場の物品取り出しタスクでロボットに意図的に失敗を起こし、ユーザーの言語・非言語反応と回復選好を収録したマルチモーダルデータセットを構築・分析した論文。
原題: RFM-HRI : A Multimodal Dataset of Medical Robot Failure, User Reaction and Recovery Preferences for Item Retrieval Tasks / Yashika Batra, Giuliano Pioldi, Promise Ekpo 他
日本語で読む → - 論文制御制御
汎用最適制御器としてのトランスフォーマー
異なる次元のMIMO線形時不変システム群に対して、単一のトランスフォーマーポリシーがLQR準最適な状態フィードバック則を学習できることを示した論文。
原題: Transformers As Generalizable Optimal Controllers / Turki Bin Mohaya, Maitham F. AL-Sunni, John M. Dolan 他
日本語で読む → - 論文群制御ロボティクス
シーン適応型具現化知能に基づくマルチAUVアドホックネットワークによるマルチターゲット追跡
動的で帯域制約のある水中環境で、AUVを具現化エージェントとして統合し、シーン適応型MARLアルゴリズムによりマルチターゲット追跡を実現する新しいアーキテクチャを提案した。
原題: Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence / Kai Tian, Jialun Wang, Chuan Lin 他
日本語で読む → - 論文場所認識画像認識
4DRaL: 知識蒸留による4DレーダーとLiDARを橋渡しする場所認識
4Dレーダーの場所認識性能を向上させるため、高性能なLiDARベースのモデルを教師として知識蒸留を用いるフレームワーク4DRaLを提案した。
原題: 4DRaL: Bridging 4D Radar with LiDAR for Place Recognition using Knowledge Distillation / Ningyuan Huang, Zhiheng Li, Zheng Fang
日本語で読む → - 論文ビジョンシステム画像認識
惑星探査ローバーのための深層学習支援ビジョンシステム
惑星探査ローバー向けに、リアルタイム認識とオフライン地形再構成を組み合わせたビジョンシステムを提案し、月面画像での距離推定精度を評価した。
原題: Deep Learning Aided Vision System for Planetary Rovers / Lomash Relia, Jai G Singla, Amitabh 他
日本語で読む → - 論文ヒューマンロボットインタラクションロボティクス
医療通訳ロボットのジェスチャー生成のためのオープンソースLLMを用いた視覚言語システム
医療通訳ロボット向けに、同意や指示などの発話行為を検出し対応するジェスチャーを生成する、プライバシー保護型の視覚言語フレームワークを提案。オープンソースのLLMと数発プロンプティングを用い、新規データセットとユーザー評価で有効性を示した。
原題: Vision-Language System using Open-Source LLMs for Gestures in Medical Interpreter Robots / Thanh-Tung Ngo, Emma Murphy, Robert J. Ross
日本語で読む → - 論文データセット/ベンチマークロボティクス
LARD 2.0: 自律着陸システムのための拡張データセットとベンチマーキング
自律着陸システムの物体検出モデル訓練用データセットLARDを拡張し、多様な画像ソースの追加や現実的なシナリオへの改良、複数滑走路環境でのベンチマークフレームワークを提供した論文。
原題: LARD 2.0: Enhanced Datasets and Benchmarking for Autonomous Landing Systems / Yassine Bougacha, Geoffrey Delhomme, Mélanie Ducoffe 他
日本語で読む → - 論文ヒューマノイド/移動操作ロボティクス
Cybo-Waiter: ヒューマノイド全身移動操作のための物理エージェントフレームワーク
VLMプランを検証可能なタスクプログラムに変換し、3D幾何学的監視でループを閉じるヒューマノイドエージェントフレームワークを提案。移動と操作を統合し、長期的なタスク実行の堅牢性を向上させる。
原題: Cybo-Waiter: A Physical Agentic Framework for Humanoid Whole-Body Locomotion-Manipulation / Peng Ren, Haoyang Ge, Chuan Qi 他
日本語で読む → - 論文ナビゲーション/マルチエージェント画像認識
ピア観察は役立つのか?視覚言語ナビゲーションのための視覚共有コラボレーション
複数のロボットが同じ環境をナビゲートする際、互いの観察情報を共有することで視覚言語ナビゲーションの性能が向上するかを検証するフレームワークCo-VLNを提案し、R2Rベンチマークで効果を実証した。
原題: Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation / Qunchao Jin, Yiliao Song, Qi Wu
日本語で読む → - 論文場所分類画像認識
パノラマLiDARスキャンからの幾何・光度特徴学習による屋外場所分類
3D LiDARから得た全方位の深度・反射率画像をCNNに入力し、屋外の場所(海岸、森林、駐車場など)を分類する手法を提案した論文。
原題: Learning Geometric and Photometric Features from Panoramic LiDAR Scans for Outdoor Place Categorization / Kazuto Nakashima, Hojung Jung, Yuki Oto 他
日本語で読む → - 論文VLM/3D位置推定/HRI画像認識
人間とロボットのインタラクションのためのVLMによる単眼3D物体位置推定
手首カメラの単眼RGB画像と自然言語入力から物体の3D位置を推定するため、QLoRAと回帰ヘッドでVLMを微調整した。テストセットで中央値MAE 13mmを達成し、ベースラインより5倍改善した。
原題: Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction / Ari Wahl, Dorian Gawlinski, David Przewozny 他
日本語で読む → - 論文3次元セマンティック補完ロボティクス
GaussianSSC: トライプレーン誘導による方向性ガウス場を用いた3次元セマンティック補完
ボクセルグリッドとガウス表現を融合し、トライプレーン誘導の方向性ガウス場でセマンティックシーン補完の精度を向上させる2段階手法を提案。
原題: GaussianSSC: Triplane-Guided Directional Gaussian Fields for 3D Semantic Completion / Ruiqi Xian, Jing Liang, He Yin 他
日本語で読む → - 論文生成モデル/設計最適化機械学習
拡散モデルは電動飛行機の夢を見るか?航空機設計のための離散・連続シミュレーションに基づく推論
電動垂直離着陸機(eVTOL)の概念設計を生成するため、離散的な機体構成と連続パラメータを階層的にサンプリングする2つの拡散モデルを提案し、設計生成を大幅に加速した。
原題: Do Diffusion Models Dream of Electric Planes? Discrete and Continuous Simulation-Based Inference for Aircraft Design / Aurelien Ghiglino, Daniel Elenius, Anirban Roy 他
日本語で読む → - 論文強化学習機械学習
PPOのためのActor-Critic事前学習
強化学習PPOにおいて、Actorを模倣学習で、Criticを事前学習済み方策のロールアウトから得たリターンで初期化する手法を提案し、15のロボット操作・歩行タスクでサンプル効率を大幅に改善した。
原題: Actor-Critic Pretraining for Proximal Policy Optimization / Andreas Kernbach, Amr Elsheikh, Nicolas Grupp 他
日本語で読む → - 論文ワールドモデル機械学習
基盤ワールドモデル:静的環境を超えて学習・検証・適応するエージェントに向けて
強化学習・プログラム合成・抽象化を統合した「基盤ワールドモデル」のビジョンを提示し、報酬モデル学習・適応的形式検証・オンライン抽象化校正・テスト時合成の4要素からなる研究課題を提案する。
原題: Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments / Florent Delgrange
日本語で読む → - 論文解釈可能性機械学習
MetaOthello:トランスフォーマーにおける複数世界モデルの制御された研究
オセロのルールやトークン化を変えた複数変種を混ぜて学習させ、単一のトランスフォーマーが複数の世界モデルを共有表現空間でどう組織するかを調べた。
原題: MetaOthello: A Controlled Study of Multiple World Models in Transformers / Aviral Chawla, Galen Hall, Juniper Lovato
日本語で読む → - 論文進化計算機械学習
進化アルゴリズムのパラメータ制御のためのコード世界モデル
LLMが最適化器の動きを予測するPythonプログラムを合成し、そのシミュレータ上での貪欲計画により突然変異強度を適応的に選択する手法を提案。理論最適に近い性能や欺瞞的な問題での完全成功を達成。
原題: Code World Models for Parameter Control in Evolutionary Algorithms / Camilo Chacón Sartori, Guillem Rodríguez Corominas
日本語で読む → - 論文世界モデル機械学習
注意機構を超えて:球面カーネル演算子による真に適応的な世界モデル
従来の注意機構に代わり、データ多様体を球面に射影し超球多項式で直接積分再構成する球面カーネル演算子(SKO)を提案し、飽和現象を回避して内在次元に依存する近似誤差を実現した。
原題: Beyond Attention: True Adaptive World Models via Spherical Kernel Operator / Vladimer Khasia
日本語で読む → - 論文世界モデル機械学習
ベクトル記号アーキテクチャによる幾何学的事前分布を用いた汎化可能な世界モデル
ベクトル記号アーキテクチャ(VSA)の幾何学的構造を事前分布として取り入れ、状態と行動を複素ベクトル空間に埋め込み、要素ごとの複素乗算で遷移をモデル化することで、未見の状態行動ペアや長期ロールアウトに汎化する世界モデルを実現した。
原題: Geometric Priors for Generalizable World Models via Vector Symbolic Architecture / William Youngwoo Chung, Calvin Yeung, Hansen Jin Lillemark 他
日本語で読む → - 論文VLAAI
OOWM: オブジェクト指向プログラムによる世界モデリングで身体性推論と計画を構造化
LLMの身体性タスク推論を、UMLのクラス図とアクティビティ図を用いたオブジェクト指向の世界モデルとして明示的に構造化し、SFTとGRPOで訓練する枠組みを提案。
原題: OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling / Hongyu Chen, Liang Lin, Guangrun Wang
日本語で読む →