論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/25 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文画像生成画像認識
X-MULTI: VLMを用いた画像生成因子の分離と因子認識画像合成
テキストから画像を生成する際に、カメラレンズやセンサー種類などの撮影因子を独立に制御する手法を提案。事前学習済み視覚言語モデルで新規組み合わせを監督し、評価指標の欠陥も修正した。
原題: X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis / Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch 他
日本語で読む → - 論文動作計画ロボティクス
NeurRAFT: アンカーレベルのフローマッチングとクリアランス認識選好チューニングによるロボット動作計画
本論文は、アンカーウェイポイントとフローマッチングを用いた生成型ニューラル動作プランナーを提案し、選好最適化により衝突回避性能を向上させる。
原題: NeurRAFT: Robot Motion Planning via Anchor-Level Flow Matching with Clearance-Aware Preference Tuning / Sibo Tian, Chang Liu, Minghui Zheng 他
日本語で読む → - 論文医療ロボティクスロボティクス
密集制約環境下でのロボットによる歯牙形成のカバレッジ計画
歯科修復のための自動全冠形成を実現するロボットシステムを提案し、解剖学的認識に基づく工具経路計画とクリアランス重視のエンドエフェクタ姿勢割り当てにより、平均0.117mmの精度で歯牙を削合する。
原題: Coverage Planning for Robotic Tooth Preparation in Densely Constrained Environments / Yunwen Li, Chen Chen, Xiangjie Yan 他
日本語で読む → - 論文VLAロボティクス
階層的スキル検索による視覚言語行動モデルのデータ効率的適応
長期的な操作タスクを階層的に分解し、サブタスクの言語検索と行動特徴の再ランキングを組み合わせて関連デモを検索することで、少数のデモでもVLAモデルを効率的に適応させる手法を提案した。
原題: Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models / Haoran Hao, Shahram Najam Syed, Jeff Schneider 他
日本語で読む → - 論文触覚/滑り検出ロボティクス
均一照明視触覚センサと時空間トランスフォーマによる堅牢な滑り検出と物体分類
均一RGB照明を備えた視触覚センサと、滑り方向を含む高精度な滑り検出・物体分類を行う時空間トランスフォーマネットワークを提案した。
原題: Robust Slip Detection and Material Classification via Spatiotemporal Transformers on a Uniformly-Illuminated Visuo-Tactile Sensor / Ziyang Ma, Yuhao Sun, Zichen Ai 他
日本語で読む → - 論文通信ロボティクス
ROS2 Connect: WAN環境向けの新しいROS2通信ソリューション
ROS2の通信をWebSocketベースでWAN環境でも透過的かつ安全に利用できるようにするフレームワークを提案し、既存手法より低遅延で安定した通信を実証した。
原題: ROS2 Connect: A new ROS2 over WAN Solution / Daniel Schott, Lakshminarasimhan Srinivasan, Christian Herrmann 他
日本語で読む → - 論文触覚ロボティクス
ロボット操作用の耐久性のある視覚ベース触覚指先センサ
摩耗や繰り返し荷重に弱い既存の視覚ベース触覚センサに対し、保護フィルムと交換可能なカートリッジを備えた耐久性の高い指先センサを開発し、加速試験で従来比2桁以上の耐久性向上を実証した。
原題: A Durable Vision-Based Tactile Fingertip for Robotic Manipulation / F. Richard Cottrell, Megha H. Tippur, Edward H. Adelson
日本語で読む → - 論文VLAロボティクス
GaussVLA:幾何認識型空間推論を備えた視覚言語行動モデル
視覚言語行動モデルに3Dガウス表現と深度認識型思考連鎖を導入し、空間操作性能を向上させた。
原題: GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model / Md Selim Sarowar, Md Tanvir Islam, Sungho Kim 他
日本語で読む → - 論文義手/制御ロボティクス
音声制御による腱駆動型バイオニックハンドの開発
腱駆動方式とサーボモータを用いた義手を開発し、ArduinoとBluetoothによる音声コマンドで指の動作を制御するシステムを実装・評価した。
原題: Development of a Voice-Controlled Tendon-Driven Bionic Hand / Urja Kohli, Shagata Chanda, Kritika Gandhi 他
日本語で読む → - 論文駐車計画/強化学習ロボティクス
NeuralParker: 不規則な駐車環境のための強化学習プランナー
配送車両などが不規則な環境で任意の姿勢に駐車するための強化学習ベースのハイブリッドプランナーを提案。環境全体の障害物と境界を目標相対表現で符号化し、長距離の経路計画を可能にした。
原題: NeuralParker: A Reinforcement Learning Planner for Irregular Parking Environments / Zihan Wang, Bai Huang, Yang Guan 他
日本語で読む → - 論文強化学習機械学習
WarpSAC: 探索と活用の再考によるスケーラブルなオフ方策強化学習の頂点を目指して
データ量に応じて安定化手法を適応させるオフ方策RLアルゴリズムWarpSACを提案し、CPU/GPU並列環境で既存手法を大幅に上回る性能を達成した。
原題: WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation / Zihao Wu, Hongyao Tang, Yi Ma 他
日本語で読む → - 論文実行時学習ロボティクス
未知環境における地上ロボットのための認知基盤型オンデバイス実行時学習
地上ロボットが未知環境で安全に実行時学習を行うためのフレームワークCogRunを提案。エッジAI上で完結し、強化学習とインスタンスベース学習を統合して安全性を確保する。
原題: Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments / Yihao Cai, Yanbing Mao, Christian Lebiere
日本語で読む → - 論文世界モデル機械学習
XP-JEPA: 予測可能な潜在ダイナミクスのための交差予測物理基盤
視覚と物理状態を別々に符号化し、共有予測器で両方を進めることで、物理遷移に基づく潜在ダイナミクスを学習する手法を提案。訓練後に物理ブランチを捨て、視覚のみで制御可能。
原題: XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics / Kehan Wen, Ziming Li, Siyuan Luo 他
日本語で読む → - 論文模倣学習ロボティクス
物理的相互作用の特定による接触リッチなロボット操作のワンショット模倣学習
ロボットと環境の物理的相互作用(接触の発生と解除)を明示的にモデル化し、単一のデモンストレーションから複雑な接触操作を再現する模倣学習手法を提案した。実ロボット実験で、未知の環境変化に対する頑健性や適応性を実証した。
原題: One-Shot Learning from Demonstration of Contact-Rich Robotic Manipulation by Identifying Physical Interactions / A. H. G. Overbeek, H. van der Kooij, M. Vlutters
日本語で読む → - 論文シーン再構成画像認識
NeoWorld-Pro: 単眼画像から対話型シーンをプログラミングし具現化シミュレーションを実現
単眼RGB画像を、物理特性や関節構造を持つ対話型3Dシーンとして再構成するフレームワークを提案。MLLMによるコード生成と物理エンジンでの検証を組み合わせ、安定した積み重ねや細かい操作などの複雑なタスクを可能にした。
原題: NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation / Yumeng He, Yichen Song, Xiaotian Yang 他
日本語で読む → - 論文歩行ロボティクス
CARO: 接触非依存の残差観測によるゼロショット堅牢な四脚歩行
四脚ロボットの歩行制御において、接触情報やトルクセンサーを使わずに、固定ベースの力学モデルから得られる残差観測を利用して、外乱や動的変化に対する堅牢性を向上させる手法を提案した。
原題: CARO: Contact-Agnostic Residual Observation for Zero-Shot Robust Quadruped Locomotion / Zihan Yang, Shixuan Han, Kexin Guo 他
日本語で読む → - 論文自動運転/センサ融合画像認識
非対称センサ劣化に対する頑健なエンドツーエンド運転のための分散誘導型空間注意融合
カメラとLiDARの非対称な劣化(全体または局所的な故障)に頑健なエンドツーエンド運転のため、密度の高い信頼性推定を空間ゲートとして用いるVG-SAFを提案。物理的故障を模擬したデータ拡張と、信頼性マップによる注意機構でプランナーへの悪影響を抑制する。
原題: Variance-Guided Spatial Attention Fusion for Robust End-to-End Driving under Asymmetric Sensor Degradation / Weizhi Tao, Zengwang Jin, Xiao Wang 他
日本語で読む → - 論文VLAAI
GameWAM: ビデオゲームのためのワールドアクションモデル
ビデオゲーム向けに、将来の視覚観測と実行可能なキーボード・マウス操作を同時生成する世界行動モデル(WAM)を提案し、ネイティブな閉ループゲームプレイとGUI制御を実現した。
原題: GameWAM: A World Action Model for Video Games / Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo 他
日本語で読む → - 論文センシング画像認識
CARE: 適応型LiDARセンシングにおける初回検出のためのカメラ残差リザーブ
適応型LiDARスキャンにおいて、過去のトラック予測で説明できないカメラ検出方向に予算を割り当てる訓練不要のルールを提案し、未発見物体の初回検出率を向上させた。
原題: CARE: Camera-Residual Reserves for First Sightings in Adaptive LiDAR Sensing / Jiachen Gong, Yun Li, Ehsan Javanmardi 他
日本語で読む → - 論文手のポーズ推定/センサロボティクス
高性能巧緻操作キャプチャのための光ファイバセンシンググローブ
多芯形状センシングファイバを用いた手全体のポーズ追跡グローブを開発し、オクルージョンや照明変化に強い高精度な手の動きキャプチャを実現した。
原題: Fiber Optic Sensing Glove for High Performance Dexterous Manipulation Capture / J. D. Peiffer, Taylor Niehues, Li Guan 他
日本語で読む → - 論文キャリブレーションロボティクス
連続時間フレームワークにおける傾斜面への地上制約LiDAR-IMUキャリブレーションの拡張
本論文は、地上車両のLiDAR-IMUキャリブレーションを非平坦環境に拡張し、傾斜面上の平面運動でも適用可能な新しい地上平面残差を提案する。実験では、傾斜面と平坦面の両方で再現性が向上することを示した。
原題: Extending Ground-Constraint LiDAR-IMU Calibration to Tilted Surfaces in a Continuous-Time Framework / Vassili Korotkine, Pierre Chamoun, Mohammed Ayman Shalaby 他
日本語で読む → - 論文製造工程計画ロボティクス
設計から計画へ:3D CADモデルと2D図面からの製造工程計画のための大規模言語モデルベースのマルチエージェントフレームワーク
3D CADモデルと2D図面から製造工程計画を生成する、LLMベースのマルチエージェントフレームワークを提案。専門エージェントが協調して特徴認識、図面解析、知識検索、工程順序付けなどを行い、エンドツーエンドの計画を実現する。
原題: Design-to-Plan: A Large Language Model-Based Multi-Agent Framework for Manufacturing Process Planning from 3D CAD Models and 2D Engineering Drawings / Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng 他
日本語で読む → - 論文シミュレーションロボティクス
NVIDIA Cosmos-H-Dreams: 手術ロボットのためのリアルタイム生成物理シミュレーション
手術ロボット向けに、生成モデルと蒸留技術を組み合わせたリアルタイムで操作可能な物理シミュレーションシステムを開発した。
原題: NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics / Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth 他
日本語で読む → - 論文シミュレーション/ベンチマークロボティクス
SIREN-Bench: 行動駆動型の緊急車両インタラクション生成と評価
緊急車両と一般車両のインタラクションを行動レベルで制御できるSUMO-CARLA共シミュレーションプラットフォームSIRENを提案し、ベンチマークとして3D物体検出、軌道予測、視覚言語リスク理解のタスクで評価した。
原題: SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions / Yicheng Zhu, Tianmu Zhao, Haoxin Leng 他
日本語で読む → - 論文ナビゲーションロボティクス
VIP: 変分に基づく反復学習計画法によるロボットナビゲーション
ロボットの動作計画を無限次元の関数空間で直接更新する新しいフレームワークを提案し、計算コストを抑えつつ単体・群ロボットの効率的な計画を実現した。
原題: VIP: Variation-based Iterative-learning Planning for Robotic Navigation / Shuli Lv, Pengda Mao, Chen Min 他
日本語で読む → - 論文水中ロボット/センサロボティクス
水中ロボットのための生体模倣型流体力学的知覚を実現するFBGひげセンサ
アザラシのひげを模倣したFBGひげセンサを開発し、水中ロボットが流れや渦を検知して分岐選択ができることを実証した。
原題: Fiber Bragg Grating Whiskers for Bioinspired Hydrodynamic Perception on Underwater Robots / Hao Li, Tianyu Tu, Siyue Yao 他
日本語で読む → - 論文VLAロボティクス
PonderPounce: 事前学習済みMLLMをロボット制御のエピソードコンテキストエンジンとして活用
PonderPounceは、マルチモーダル大規模言語モデル(MLLM)のネイティブな因果コンテキストをロボットの記憶として再利用し、エピソード観察やデモンストレーションを蓄積してサブゴール生成を行うSystem2と、現在の観察から直接アクションを出力するSystem1のVLAを非同期に連携させる新しいアーキテクチャを提案する。専用の記憶モジュールやブリッジ事前学習なしでエンドツーエンドに訓練され、低遅延で高周波のアクション生成を実現する。
原題: PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control / Suhwan Choi, Jaeyoon Jung, Sungkyung Kim 他
日本語で読む → - 論文イベントカメラ/モーション推定画像認識
配向距離場によるイベントベースのモーション推定
イベントカメラの動き推定を、反復最適化の代わりに事前計算した距離場の平均化で行う手法を提案し、低遅延かつ高精度を実現。さらに、ぼけ除去と瞳孔追跡への応用も示した。
原題: Event-Based Motion Estimation via Oriented Distance Fields / Lei Sun, Yuqin Ma, Weilun Li 他
日本語で読む → - 論文可視化分析画像認識
VizAnchor: 二重アンカー推論による改ざん可視化からの操作意図の解読
データ可視化の改ざんを理解するためのフレームワークを提案。意味的・空間的アンカーで真実の情報と改ざん領域を特定し、複数のエージェントが操作内容と誤解を招く意図を推論する。
原題: VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning / Xiaotian Zhang, Huayuan Ye, Haiyang Zhang 他
日本語で読む → - 論文シミュレーションロボティクス
CRESSim-Neo: 手術ロボティクスとロボット学習のためのバッチ処理GPUシミュレーションエンジン
手術ロボティクスとロボット学習のための、剛体・変形組織・流体・紐などを扱えるバッチ処理GPUシミュレーションエンジンを開発した。PyTorchと直接連携でき、高速な並列シミュレーションを実現する。
原題: CRESSim-Neo: A Batched GPU Simulation Engine for Surgical Robotics and Robot Learning / Yafei Ou, Ahnaf Naheen, Tleukhan Mussin 他
日本語で読む →