論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/7 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文歩行ロボティクス
LLM生成仕様から学習する四足歩行
大規模言語モデルを用いて自然言語の歩行目標からパラメトリック時相論理仕様を自動生成し、それを報酬関数に変換して四足歩行ポリシーを強化学習で訓練する手法を提案した。
原題: From LLM-Generated Specifications to Learned Quadruped Locomotion / Merve Atasever, Keyan Azbijari, Cagan Bakirci 他
日本語で読む → - 論文触覚/手術支援ロボティクス
シーングラフ駆動の触覚フィードバックによるロボット眼科手術の安全性向上:物理シミュレーションi OCTを用いて
ロボット眼科手術において、物理シミュレーションされたiOCT映像からシーングラフを構築し、その意味情報に基づいて触覚フィードバックを生成するシステムを提案。ユーザー実験で針の位置合わせ誤差を14%削減し、安全性を高める操作戦略の誘導を確認した。
原題: Scene Graph-Driven Haptic Feedback for Safety Enhancement in Robotic Ophthalmic Surgery via Physically Simulated iOCT / Danial Arbabi, Korab Hoxha, Angelo Henriques 他
日本語で読む → - 論文ベンチマーク画像認識
NutriBench-Kitchen:栄養管理のための身体化AIベンチマーク
調理動画における栄養関連状態の追跡と知識に基づく計画を評価するベンチマークを提案し、既存の視覚言語モデルが人間性能に及ばないことを示した。
原題: NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management / Yulin Wei, Xiangchen Wang, Jianhui Pan 他
日本語で読む → - 論文マニピュレーションロボティクス
EquiGQNet: 共有等変点群符号化による高速な把握品質評価
6自由度の把握候補を高速かつ正確に評価するため、SO(3)等変な「一度符号化してから回転」方式と中間レベル行動融合を組み合わせた把握品質評価器EquiGQNetを提案した。シミュレーションと実機で従来法と同等以上の性能を保ちつつ、計画時間を6.9倍高速化した。
原題: EquiGQNet: Fast Grasp Quality Evaluation via Shared Equivariant Point Cloud Encoding / Sungwon Seo, Jaeseog Won, Jiyou Shin 他
日本語で読む → - 論文状態推定ロボティクス
MAC-I²:ロバストな視覚慣性融合のための学習によるメトリクス対応共分散
視覚とIMUの融合において、事前定義された不確かさではなく、学習により各モダリティのノイズを反映した共分散を推定し、初期化とキャリブレーションのロバスト性を向上させる手法を提案した。
原題: MAC-I$^2$: Learned Metrics-Aware Covariance for Robust Visual-Inertial Fusion in Initialization and Calibration / Xiang Fei, Yuheng Qiu, Can Xu 他
日本語で読む → - 論文群制御ロボティクス
D3ARC: 非同期協調マルチロボットシステムのための時間制約付き分散災害検出
山火事などの災害を迅速に検出するため、複数のロボットが非同期に協調する分散型階層フレームワークD3ARCを提案し、シミュレーションで最大94%のミッション成功率を達成した。
原題: D3ARC: Time-Critical Distributed Disaster Detection for Asynchronous Cooperative Multi-Robot Systems / Nikolaos Koursioumpas, Lina Magoula, Nancy Alonistioti 他
日本語で読む → - 論文宇宙ロボティクス/シミュレーションロボティクス
mjorbit: 宇宙ロボティクスのためのシミュレーションフレームワーク
宇宙ロボットの多体接触シミュレーションを効率的に行うためのフレームワークを提案し、軌道伝播とロボットシミュレーションの結合方法を検討した。
原題: mjorbit: A Simulation Framework for Space Robotics / John Z. Zhang, Joris Verhagen, Fausto Vega 他
日本語で読む → - 論文自動駐車/軌道生成ロボティクス
ドリフトパーキング:ドリフト場による軌道モデリングを用いたエンドツーエンド自動駐車
駐車軌道生成を、専門家軌道への一対一の引き寄せと反発を組み合わせたドリフト場としてモデル化し、終点誤差を構造的に低減するワンステップ生成手法を提案した。
原題: DriftParking: Trajectory Modeling via Drifting Field for End-to-End Automated Parking / Ziyan Wang, Dong Li, Weibo Wang 他
日本語で読む → - 論文3Dマッピングロボティクス
SHIFT: 表面認識型高速TSDF統合
3Dマッピングの計算コストを削減するため、平面領域を圧縮し勾配を凍結する新しいTSDF統合フレームワークを提案。RGB-DとLiDARデータで最大4倍の高速化とメモリ削減を実現。
原題: SHIFT: Surface-aware High-speed Integration For TSDFs / Ayaan Choudhury, Lokender Tiwari
日本語で読む → - 論文マニピュレーションロボティクス
VLA-Corrector: 段階認識可能な観測状態理解に基づくプロンプト駆動型閉ループ回復フレームワーク
固定されたVLAポリシーをパラメータ更新なしで閉ループ補正するため、観測履歴から操作の進行段階と失敗パターンを推定する検証器を導入し、異常時に段階条件付き回復プロンプトを生成する手法を提案した。
原題: VLA-Corrector: Stage-Aware Observable State Understanding for Prompt-Based Closed-Loop Recovery of Vision-Language-Action Policies / Chang Song, Bin Qian, Yan Feng 他
日本語で読む → - 論文ナビゲーション/安全制御ロボティクス
OcclusionCBF: 隠れた動的障害物に対する安全なナビゲーションのためのバックアップ制御バリア関数
ロボットが遮蔽物の背後に隠れた動的障害物と衝突しないよう、到達可能な占有予測に基づくバックアップ制御バリア関数を拡張した安全フィルタを提案し、シミュレーションと実機で有効性を示した。
原題: OcclusionCBF: Backup Control Barrier Functions for Safe Navigation Among Hidden Dynamic Obstacles / Taekyung Kim, Hun Kuk Park, Renya Wada 他
日本語で読む → - 論文組立/強化学習ロボティクス
知識誘導型階層ポリシー学習による高精度円筒組立
0.1mmの厳しい公差を持つ円筒部品の高精度組立を実現するため、階層型強化学習フレームワークを提案。下層は行動クローニングとTD3を統合し、上層はヒューリスティックルールで調整する。シミュレーションで学習後、実世界に転移し、高い成功率と安定性を示した。
原題: Knowledge-Guided Hierarchical Policy Learning for High-Precision Cylindrical Assembly under Tight Tolerances / Binbin Lian, Xinyu Liu, Tao Sun
日本語で読む → - 論文継続学習/セキュリティ機械学習
バックドア攻撃下での継続学習における浄化と選択的復元によるロバストな動的拡張
各タスクに混入したバックドア攻撃サンプルに対処するため、浄化・選択的復元・ロバストな専門家選択を統合した動的拡張フレームワークを提案した。
原題: Robust Dynamic Expansion for Continual Learning under Backdoor Attacks via Purification and Selective Recovery / Keyu Lin, Fei Ye, Qihe Liu 他
日本語で読む → - 論文自動運転/シナリオ生成ロボティクス
衝突スナップショット誘導による時間反転型安全臨界シナリオ生成
自動運転の安全評価用に、衝突状態から時間を逆再生して新規車両の軌道を生成するフレームワークCOSTERを提案し、既存手法より妥当性・多様性・データ効率で優れることを示した。
原題: Collision Snapshot Guided Time-Reversed Safety-Critical Scenario Generation / Taehyung Kim, Jongeun Choi
日本語で読む → - 論文VLA画像認識
MLLMは人間のように多義図形を報告するか?
マルチモーダル大規模言語モデル(MLLM)が、アヒルとウサギの多義図形のような二重安定画像に対して、人間と同様に一度に一つの解釈を報告するか、また視覚的手がかりや言語的バイアスで報告が変わるかを調べ、その内部計算機構を解析した。
原題: (How) Do MLLMs Report Bistable Images Like Humans? / Ryota Takatsuki, Tomoki Doi, Amane Watahiki 他
日本語で読む → - 論文能動マッピングロボティクス
能動マッピングのための占有ワールドモデルの診断と動的フィルタリング
能動マッピングにおける占有ネットワークの誤りが計画に与える影響を診断し、オンライン観測に基づいて誤った占有予測を動的に抑制するフィルタリング手法を提案した。
原題: Diagnosing and Dynamically Filtering Occupancy World Models for Active Mapping / Jiahui Zhang, Gongbo Liang, Yu Zhang
日本語で読む → - 論文空中ロボット/探査/拡散ポリシーロボティクス
CAVEAT: 地図なし空中探査のためのリカレント多モーダル拡散プランニング
この論文は、UAVの探査経路生成を、グローバルマップを保持せずに、LiDAR・視覚・姿勢の多モーダル観測と固定次元のリカレント内部状態から行う拡散ポリシーCAVEATを提案している。シミュレーションと実機実験で有効性を示した。
原題: CAVEAT: Recurrent Multimodal Diffusion Planning for Mapless Aerial Exploration / Steven Visch, Nicolò Botteghi, Antonio Franchi 他
日本語で読む → - 論文シーン理解画像認識
移動ロボットのための物理・地理空間に基づくシーン解釈
事前学習済みのVLMの出力に、OpenStreetMapの建物・道路情報とセンサから得た位置・時間・距離情報をLLMで統合し、物理・地理空間に基づく自然言語のシーン記述を生成する手法を提案した。大学構内での実験で建物接地F1=0.83、路面接地F1=0.64を達成した。
原題: Physico-Geospatial Grounded Scene Interpretation for Mobile Robotics / Nicolas Schuler, Janik Kurtz, Lea Dewald 他
日本語で読む → - 論文人型ロボット制御ロボティクス
文脈条件付き相互作用事前分布による物理ベース人型ロボットの統合的操作
本論文は、歩行と物体操作を統合する物理ベースの人型ロボット制御フレームワークCHIPを提案し、異種の動作データから再利用可能なスキルを学習する。
原題: Unifying Physics-Based Humanoid Interaction with a Context-Conditioned Interaction Prior / Jianan Li, Xiao Chen, Tien-Tsin Wong
日本語で読む → - 論文ナビゲーションロボティクス
OVMAN: オープンボキャブラリの動作認識ナビゲーションのためのタスクとベンチマーク
家の変化を利用して、移動した椅子や以前あった花瓶の場所など、変化に基づく目標へのナビゲーションを評価する新しいタスクとベンチマークを提案。
原題: OVMAN: A Task and Benchmark for Open-Vocabulary Motion-Aware Navigation / Dibyendu Ghosh
日本語で読む → - 論文制御工学制御
動的システムエミュレーション:マルチコプターによる固定翼機の飛行力学再現
2軸ジンバルを備えたマルチコプターが固定翼機の飛行力学を模擬する制御フレームワークを提案し、動的フィードバック線形化による状態-入力マッピングで高忠実なエミュレーションを実現した。
原題: Dynamic System Emulation: Fixed Wing Dynamics on a Multicopter / Abdelhakim Amer, Andriy Sarabakha
日本語で読む → - 論文継続学習画像認識
アプリケーションストリーム上の継続的GUIエージェント学習のための選択的知識制御
GUIエージェントの継続学習において、ニューロン単位の勾配操作により過去の知識を保護しつつ新しいアプリケーションに適応する軽量な選択的知識保持手法を提案した。
原題: Selective Knowledge Control for Continual GUI Agent Learning over Application Streams / Zirui Shang, Xin Shu, Yang Liu 他
日本語で読む → - 論文自動運転/ベンチマークロボティクス
LANTERN: 時間的に接地された警告を用いたVLM協調運転のクローズドループベンチマーク
協調運転における警告の効果を単独で評価するためのクローズドループベンチマークを提案し、VLMモデルの性能向上を実証した。
原題: LANTERN: A Closed-Loop Benchmark for VLM-Based Cooperative Driving with Temporally Grounded Warnings / Yongshuo Liu, Xu Gao, Morui Zhu 他
日本語で読む → - 論文音響/ワールドモデルcs.SD
BinauralVAE: ワールドモデルのための空間音響再構成
視覚に依存しがちな既存のワールドモデルに対し、空間音響に着目し、ロボットのナビゲーション行動と音響結果の因果関係を学習するためのパイプラインを提案。様々なVAEアーキテクチャを評価し、バイノーラル信号の潜在表現を獲得する。
原題: BinauralVAE: Spatial Audio Reconstruction For World Models / Luis Vitor Zerkowski, Luiz Velho
日本語で読む → - 論文制御ロボティクス
幾何学的分布制御:部分的な構造知識を用いた学習進捗
既知の幾何学や制約を活用しつつ、未知のタスク進捗方向を学習する制御手法を提案。実時間制御の中間領域(モデルベースと強化学習の間)を対象とし、進捗重み付きデータから局所的な価値勾配を学習する。
原題: Geometric Distributional Control: Learning Progress with Partial Structural Knowledge / Tong Wu
日本語で読む → - 論文医用画像/セグメンテーション/連合学習画像認識
連合学習環境下におけるX線透視画像でのカテーテル・ガイドワイヤセグメンテーションの新規手法
X線透視画像におけるカテーテルとガイドワイヤのセグメンテーションを、構造認識型の連合学習フレームワークを用いて改善した論文。
原題: Novel Methods for Catheter and Guidewire Segmentation in X-ray Fluoroscopy under a Federated Learning Setting / Chayun Kongtongvattana
日本語で読む → - 論文世界モデルロボティクス
ロボット世界モデルにおける習慣・物理・ノイズの分離
ロボットの遠隔操作デモに含まれる操作者の習慣・共有物理・観測ノイズを構造的因果モデルで分離し、共有物理部分を凍結して薄いインターフェースのみを更新する適応則を提案した論文。
原題: Identifying Habit, Physics, and Nuisance in Robot World Models / Jinting Hang, Zhenhui Cai
日本語で読む → - 論文VLAロボティクス
身体性を持つSLMにおける幾何条件付け:0.8Bハイブリッドモデルでの訓練制御とロバスト性診断
0.8Bのハイブリッド言語モデルを操作タスクに適応させ、幾何学的入力の条件付けが性能に与える影響を評価した。訓練時の幾何学的整合性による明確な優位性は見られず、座標不変性と物理的配置の汎化のギャップを示した。
原題: Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model / Hao Li, Haofei Sun, Lin He
日本語で読む → - 論文水中ロボット/姿勢制御ロボティクス
水中四脚ロボットの設計と姿勢制御
防水モータハウジングを備えた再現可能な水中四脚ロボットを設計し、SO(3)上の誤差定式化に基づく閉ループ姿勢制御をシミュレーションと水槽実験で検証した。
原題: Design and Attitude Control of an Underwater Quadruped Robot / Davide Molinaroli, Mohit Singh, Kostas Alexis
日本語で読む → - 論文ナビゲーション画像認識
一つのMLLM、一回の呼び出し:空間認識ウェイポイントによる効率的なゼロショット視覚言語ナビゲーション
連続環境での視覚言語ナビゲーション(VLN-CE)において、各意思決定ステップで単一の大規模モデルを一度だけ呼び出す効率的なゼロショットナビゲーションフレームワークO2C-Navを提案。訓練不要のウェイポイント生成器と抽象表現を用いてRGB画像上に候補ウェイポイントを可視化し、MLLMが選択した目標をFMMプランナーで衝突回避経路に変換する。
原題: One MLLM, One Call: Efficient Zero-Shot Vision-and-Language Navigation via Spatial-Aware Waypoints / Shiqi Pan, Qi Zheng, Hanqin Sun 他
日本語で読む →