論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/推論高速化ロボティクス
KERV: 身体化VLAモデルのための運動学的修正投機的復号
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
原題: KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models / Zihao Zheng, Zhihao Mao, Maoliang Li 他
日本語で読む → - 論文バイオハイブリッドロボティクスロボティクス
バイオハイブリッドロボットシステムのためのワイヤレス生体電子制御アーキテクチャ
組織工学によるバイオハイブリッドロボットのワイヤレス制御を、信号伝達・空間選択性・拡張性・界面安定性を統合した共設計問題として定式化し、3つの制御戦略を分析して設計指針を提案した論文。
原題: Wireless bioelectronic control architectures for biohybrid robotic systems / Hiroyuki Tetsuka, Minoru Hirano
日本語で読む → - 論文物体検出画像認識
自動煙感知器点検に向けて:産業施設における煙感知器の認識と将来のドローン統合の準備
産業施設の煙感知器を自動点検するため、YOLOv11、SSD、RT-DETRv2などの物体検出器を比較し、実データと半合成データを用いた学習戦略を検証した。最良のYOLOv11nはmAP@0.5で0.884を達成した。
原題: Towards automatic smoke detector inspection: Recognition of the smoke detectors in industrial facilities and preparation for future drone integration / Lukas Kratochvila, Jakub Stefansky, Simon Bilik 他
日本語で読む → - 論文VLAロボティクス
ROI駆動フォビエーション注意による視覚-言語-行動システムの統一エゴセントリック表現
エンドエフェクタの姿勢を前方運動学で外部カメラに投影し、手中心の関心領域(ROI)を切り出すことで、手首カメラなしに高解像度の局所情報と全体文脈を両立するデータ表現を提案した。
原題: ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems / Xinhai Sun, Xiang Shi, Menglin Zou 他
日本語で読む → - 論文VLA画像認識
DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデル
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
原題: DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models / Zhide Zhong, Junfeng Li, Junjie He 他
日本語で読む → - 論文手術支援/AR/ロボット超音波HCI
脊椎処置におけるコーンビームCT統合型拡張現実ガイドロボット超音波の実現可能性
脊椎処置の針刺入を支援するため、拡張現実とロボット超音波を統合し、CTモデルと超音波を重ね合わせて表示するシステムを開発し、ファントム実験で精度と効率の向上を実証した。
原題: Feasibility of Augmented Reality-Guided Robotic Ultrasound with Cone-Beam CT Integration for Spine Procedures / Tianyu Song, Felix Pabst, Feng Li 他
日本語で読む → - 論文物体検出画像認識
移動ロボットのためのワンショットバドミントンシャトル検出
移動ロボットの視点からバドミントンのシャトルをリアルタイム検出するためのデータセットと検出器を構築し、未知環境でも高い性能を確認した。
原題: One-Shot Badminton Shuttle Detection for Mobile Robots / Florentin Dipner, William Talbot, Turcan Tuna 他
日本語で読む → - 論文拡散ポリシー/操作ロボティクス
動的補正を備えた閉ループアクションチャンクによる学習不要の拡散ポリシー
拡散ベースのポリシーに動的環境情報を注入し、リアルタイムでアクションを補正する閉ループ拡散ポリシーフレームワークDCDPを提案。再学習なしで動的シナリオへの適応性を向上させる。
原題: Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy / Pengyuan Wu, Pingrui Zhang, Zhigang Wang 他
日本語で読む → - 論文水中ロボット/VLM/ナビゲーションロボティクス
CORAL: 水中モニタリングのための階層型VLMフレームワークにおける文脈推論と局所計画
水中環境でのオイスターリーフ監視を目的に、高次意味推論を担うVLMと低次衝突回避を担う動力学ベースプランナーを分離した階層型フレームワークCORALを提案し、探索範囲の向上と衝突削減を実現した。
原題: CORAL: COntextual Reasoning And Local Planning in A Hierarchical VLM Framework for Underwater Monitoring / Zhenqi Wu, Yuanjie Lu, Xuesu Xiao 他
日本語で読む → - 論文把持/シミュレーションロボティクス
D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
原題: D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping / Haozhe Lou, Mingtong Zhang, Haoran Geng 他
日本語で読む → - 論文形状センシングロボティクス
OFDRを用いた単一ファイバによる同心管ステアラブル掘削ロボットの形状センシング
FBGの代わりにOFDRを用いて、同心管ステアラブル掘削ロボットの形状を連続的に計測する手法を提案し、掘削中の形状推定精度を実証した。
原題: A Single-Fiber Optical Frequency Domain Reflectometry (OFDR)-Based Shape Sensing of Concentric Tube Steerable Drilling Robots / Yash Kulkarni, Mobina Tavangarifard, Daniyal Maroufi 他
日本語で読む → - 論文対話的プランニングAI
AsgardBench:最小限のフィードバック下での視覚に基づく対話的プランニングの評価
視覚に基づく高レベルの行動系列生成と対話的プランニングを評価するベンチマークを提案し、実行中の視覚観察に基づくプラン適応に焦点を当てる。
原題: AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback / Andrea Tupini, Lars Liden, Reuben Tan 他
日本語で読む → - 論文群制御ロボティクス
連結された四脚ロボットによる協調運搬タスクのためのマルチエージェント局所衝突回避学習
四脚ロボット2台が物体を連結して運搬する際、事前地図や経路計画なしにセンサ情報のみで障害物を回避しながら目標方向へ追従する強化学習ベースの階層的制御手法を提案した。
原題: Learning Multi-Agent Local Collision-Avoidance for Collaborative Carrying tasks with Coupled Quadrupedal Robots / Francesca Bray, Simone Tolomei, Andrei Cramariuc 他
日本語で読む → - 論文操作ロボティクス
事前学習済みビデオモデルから物理を学ぶ:ロボット操作のためのマルチモーダル連続・逐次世界相互作用モデル
ロボットデータ不足を補うため、事前学習済みビデオ生成モデルを物理シミュレータとして活用し、ビデオと行動を共通の物理トークンで表現することで、操作タスクを解く枠組みPhysGenを提案した。
原題: Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation / Zijian Song, Qichang Li, Sihan Qin 他
日本語で読む → - 論文動作キャプチャ画像認識
接地反力慣性ポーザー:スパースIMUとインソール圧力センサによる物理ベースの人間動作キャプチャ
IMUと足裏圧力センサを組み合わせ、物理シミュレータ上のデジタルツインを制御して物理的に妥当な全身動作を再構成する手法GRIPを提案した。
原題: Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors / Ryosuke Hori, Jyun-Ting Song, Zhengyi Luo 他
日本語で読む → - 論文3D物体検出画像認識
CoIn3D:構成不変なマルチカメラ3D物体検出の再考
マルチカメラ3D物体検出モデルが未知のカメラ構成にうまく一般化できない問題を解決するため、空間事前情報を明示的に組み込んだCoIn3Dフレームワークを提案した。
原題: CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection / Zhaonian Kuang, Rui Ding, Haotian Wang 他
日本語で読む → - 論文ナビゲーション画像認識
Context-Nav: 文脈駆動探索と視点対応3D空間推論によるインスタンスナビゲーション
テキスト指示に基づき、同じカテゴリの物体の中から正しいインスタンスへ到達するナビゲーション手法を提案。文脈全体を探索の事前情報として活用し、視点対応の3D空間検証で候補を確認する。
原題: Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation / Won Shik Jang, Ue-Hwan Kim
日本語で読む → - 論文VLAロボティクス
LILAC: 言語条件付きオブジェクト中心オプティカルフローによるオープンループ軌道生成
人間やWeb動画から学習可能なフローベースの軌道生成を用いて、言語指示に従った物体操作を実現する手法を提案。指示とフローを整合させる損失関数とクロスモーダルアダプタを導入し、既存手法より高品質なフロー生成と高いタスク成功率を達成した。
原題: LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation / Motonari Kambara, Koki Seno, Tomoya Kaichi 他
日本語で読む → - 論文VLA/ロバスト性/メモリロボティクス
RoboHarness:メモリ拡張型ポリシーハーネスによる視覚言語行動モデルの文脈内適応ロバスト性向上
凍結したVLAモデルを微調整なしでロバスト化するため、デュアルメモリRAGとマルチモーダルLLMによる帰属駆動オーケストレータ、MCP介入を備えたオンラインパイプラインと、オフラインのメモリ統合を提案し、平均成功率を56.6%向上させた。
原題: RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation / Zhuoran Li, Zhiyang Li, Kaijun Zhou 他
日本語で読む → - 論文SLAMロボティクス
FastLoop: GPU加速によるビジュアルSLAMの並列ループ閉じ込み
ビジュアルSLAMのループ閉じ込み処理をGPUで並列化し、精度を保ちながら高速化する手法を提案した。
原題: FastLoop: Parallel Loop Closing with GPU-Acceleration in Visual SLAM / Soudabeh Mohammadhashemi, Shishir Gopinath, Kimia Khabiri 他
日本語で読む → - 論文3D再構成画像認識
FreeArtGS: 自由移動シナリオにおける関節物体のガウシアンスプラッティング再構成
単眼RGB-Dビデオから自由に動く関節物体を再構成する新しい手法を提案。部品分割と関節推定を組み合わせ、エンドツーエンドで最適化する。
原題: FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario / Hang Dai, Hongwei Fan, Han Zhang 他
日本語で読む → - 論文触覚HCI
熱空気圧ピクセル:高速・局所・堅牢・低電圧な触覚フィードバック
電気パルスで内部空気を加熱膨張させ、薄型で高速・低電圧駆動の局所的な触覚提示を実現する熱空気圧ピクセルを提案し、その特性と知覚効果を評価した。
原題: Thermopneumatic Pixels: Fast, Localized, Robust, Low-Voltage Touch Feedback / Max Linnander, Yon Visell
日本語で読む → - 論文安全制御ロボティクス
その安全制御器は本当に安全か?CBFのトートロジーと隠れた仮定に関する批判的レビュー
制御バリア関数(CBF)の実用上の落とし穴を整理し、受動的に安全な系でのみ有効な例や、強化学習の報酬整形による見かけの安全性を指摘して、実装可能な安全保証の指針を示したチュートリアル。
原題: Is Your Safe Controller Actually Safe? A Critical Review of CBF Tautologies and Hidden Assumptions / Taekyung Kim
日本語で読む → - 論文四足ロボットロボティクス
MEVIUS2: 板金溶接とマルチモーダル知覚を備えた実用的なオープンソース四足ロボット
Boston DynamicsのSpotと同等のサイズで、板金溶接と金属加工により耐久性の高い構造を実現し、LiDARや高ダイナミックレンジカメラを搭載したオープンソース四足ロボットを開発した。
原題: MEVIUS2: Practical Open-Source Quadruped Robot with Sheet Metal Welding and Multimodal Perception / Kento Kawaharazuka, Keita Yoneda, Shintaro Inoue 他
日本語で読む → - 論文医療画像/ロボットスキャニング画像認識
曲面組織の6DロボットOCTスキャニング
ロボット搭載OCTプローブの完全な6次元ハンドアイキャリブレーション用マーカーを提案し、曲面組織の一貫したスキャンを可能にする。
原題: 6D Robotic OCT Scanning of Curved Tissue Surfaces / Suresh Guttikonda, Maximilian Neidhardt, Vidas Raudonis 他
日本語で読む → - 論文群制御ロボティクス
事前定義ルート上のマルチエージェントシステムにおける非厳密射影ADMMを用いた衝突回避速度スケジューリング
各エージェントが決められたルート上を移動する際の通過時刻を最適化し、衝突を回避する速度スケジュールを非厳密射影ADMMで計算する手法を提案した。
原題: Collision-Free Velocity Scheduling for Multi-Agent Systems on Predefined Routes via Inexact-Projection ADMM / Seungyeop Lee, Jong-Han Kim
日本語で読む → - 論文両腕操作ロボティクス
BiPreManip: 予期的協調によるアフォーダンスに基づく両腕準備的操作の学習
直接掴みにくい物体や機能的操作が難しい物体に対して、一方の腕が準備的操作を行い他方の腕の目標動作を可能にする両腕協調タスクを扱い、視覚アフォーダンスに基づくフレームワークを提案した。
原題: BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration / Yan Shen, Feng Jiang, Zichen He 他
日本語で読む → - 論文遠隔操作ロボティクス
剛性コパイロット:接触の多い遠隔操作のためのインピーダンスポリシー
接触の多い遠隔操作において、操作者がロボットの姿勢を指示し、視覚ベースのポリシーがオンラインでロボットのインピーダンスを調整する共有制御手法を提案。シミュレーションで方向依存の剛性行列を学習し、それを用いて軽量な視覚ポリシーを教師あり学習することで、実画像へのゼロショット転移を実現した。
原題: Stiffness Copilot: An Impedance Policy for Contact-Rich Teleoperation / Yeping Wang, Zhengtong Xu, Pornthep Preechayasomboon 他
日本語で読む → - 論文安全性保証ロボティクス
SafePilot: LLM対応サイバー物理システムの保証フレームワーク
LLMを統合したサイバー物理システムの安全性を保証するため、階層型ニューロシンボリックフレームワークSafePilotを提案。タスクの複雑さを評価し、分割統治と形式検証によりLLMの幻覚による不安全な動作を防ぐ。
原題: SafePilot: A Framework for Assuring LLM-enabled Cyber-Physical Systems / Weizhe Xu, Mengyu Liu, Fanxin Kong
日本語で読む → - 論文ナビゲーションロボティクス
CeRLP: クロスエンボディメントロボットの視覚ナビゲーションのためのローカルプランニングフレームワーク
異なるロボットやカメラ構成でも動作する視覚ナビゲーションのためのローカルプランニングフレームワークを提案し、深度推定のスケール補正と視覚情報のレーザースキャンへの抽象化により、ロボットの形状差を吸収する。
原題: CeRLP: A Cross-embodiment Robot Local Planning Framework for Visual Navigation / Haoyu Xi, Mingao Tan, Xinming Zhang 他
日本語で読む →