論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文医療ロボティクス/視覚サーボロボティクス
RCM制約付き視覚サーボの統合ベンチマーク:腹腔鏡ロボットにおけるモデリングと制御器の相互作用およびロバスト性解析
腹腔鏡下手術ロボットのRCM制約付き視覚サーボを評価するための、3つのRCMモデリング手法と6つのIBVS制御アーキテクチャを統合したオープンソースのシミュレーションフレームワークを提案し、モデリングと制御の相互作用による構造的感度を明らかにした。
原題: A Unified Benchmark for RCM-Constrained Visual Servoing: Modeling-Controller Interaction and Robustness Analysis in Laparoscopic Robots / Jing Zhang, Mengtang Li
日本語で読む → - 論文VLAロボティクス
Pelican-VLA 0.5: 行動前に注意を向けることで汎化を向上
視覚言語理解、未来フレーム生成、行動予測を統合したVLAモデルを提案し、注意レベルの汎化を達成。ボトルネックトークンの導入により、未見のシーンやロボットでも操作対象に注意が向くことを示した。
原題: Pelican-VLA 0.5: Attending Before Acting Benefits Generalization / Zeyuan Ding, Wenhai Liu, Yang Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
PixelLoop: ピクセルレベルループによるショートカット位相ナビゲーション
ピクセル空間でループ閉じを行い、密な位相的ショートカットを生成することで、任意点間ナビゲーションの成功率と経路効率を大幅に向上させる手法を提案した。
原題: PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops / Sarthak Chittawar, Vansh Garg, Aditya Vadali 他
日本語で読む → - 論文HRI/協調制御ロボティクス
一回の対話で修正可能な支援:実用的・教育的ベストレスポンス
非対称情報下での人間とロボットの協調を扱う支援ゲームにおいて、実用的・教育的推論により目標の不確実性を単一ステップで解消できるクラスを特定し、効率的な最適戦略計算を可能にした。
原題: Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response / Elle Lazarski, Jaime Fernández Fisac
日本語で読む → - 論文3次元再構成ロボティクス
VIDAR: 幾何基盤モデルによる視覚慣性密位置合わせと再構成
単眼基盤モデルの密な幾何予測に、視覚慣性オドメトリをメトリックアンカーとして組み合わせ、スケール安定な密再構成を実現するフレームワークを提案した。
原題: VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model / Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar 他
日本語で読む → - 論文手術ロボティクスロボティクス
部分観測下での自律手術組織牽引のための変形状態推定
手術中の組織牽引において、まばらな観測から変形メッシュ全体を推定する学習ベースの状態推定器を提案し、幾何学的正則化により精度を向上させた。
原題: Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability / Everest Yang, Skye Thompson, George D. Konidaris
日本語で読む → - 論文VLAロボティクス
Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリング
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
原題: Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories / Xiaomi Robotics Team, Jun Guo, Piaopiao Jin 他
日本語で読む → - 論文組込みAI/セグメンテーション画像認識
RGB-Dカメラを用いた組込みデバイス上のアフォーダンスセグメンテーションのパレート最適フロントの充填
ウェアラブルロボット向けに、RGB-Dカメラの深度情報を小型深層ネットワークに統合するためのハードウェア認識型ニューラルアーキテクチャ探索と専用ファインチューニング手法を提案し、実時間性能とエネルギー効率を両立するパレート最適解を生成する。
原題: Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras / Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani 他
日本語で読む → - 論文VLAロボティクス
RoboTTT: ロボットポリシーのためのコンテキストスケーリング
ロボットポリシーの視覚運動コンテキストを8Kタイムステップまで拡張し、推論遅延を増やさずに、人間のビデオからのワンショット模倣や長期的タスクの性能向上を実現する手法を提案。
原題: RoboTTT: Context Scaling for Robot Policies / Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng 他
日本語で読む → - 論文VLA/力覚/接触操作ロボティクス
力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
原題: Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection / Yi Wang, Wendi Chen, Zimo Wen 他
日本語で読む → - 論文VLA/操作ロボティクス
Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワーク
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
原題: Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation / Jiaqi Peng, Xiqian Yu, Delin Feng 他
日本語で読む → - 論文歩行ロボティクス
ADP: 物理的に接地された人型ロコモーションのための敵対的ダイナミクス事前分布
運動学的特徴ではなく、重心運動や接触力などの動力学特徴を敵対的学習で正則化することで、外乱に頑健な人型ロボットの歩行制御を実現した。
原題: ADP: Adversarial Dynamics Priors for Physically Grounded Humanoid Locomotion / Seokju Lee, Jeongtae Lee, Jeonghyeok Lim 他
日本語で読む → - 論文データセットロボティクス
SinD 2.0:信号交差点におけるSOTIF指向の安全検証のための意味的リスク注釈付きマルチシティUAVデータセット
本論文は、複数都市の信号交差点を対象としたドローン撮影による大規模データセットSinD 2.0を紹介し、安全検証に必要な意味的リスク注釈と高密度の危険事象を提供する。
原題: SinD 2.0: A Multi-City UAV Dataset with Semantic Risk Annotations for SOTIF-Oriented Safety Validation at Signalized Intersections / Yunwei Li, Shengjie Fu, Chunrong Chen 他
日本語で読む → - 論文データセットロボティクス
Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーン
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
原題: Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning / Zishuo Li, Bowen Yang, Changtao Miao 他
日本語で読む → - 論文嗅覚ロボティクス
COLIP-2: 嗅覚・視覚・言語の埋め込み表現
分子構造、ガスセンサー読み取り、匂い記述言語、画像を単一の共有表現空間に埋め込むマルチモーダルモデルを構築し、ロボットが検出した匂いをシーン内の物体に確率的に対応付けることを可能にした。
原題: COLIP-2: Olfaction-Vision-Language Embeddings / Kordel Kade France
日本語で読む → - 論文VLA/レビューロボティクス
視覚言語行動(VLA)モデルによる無人航空ロボティクスと双腕マニピュレーションのレビュー
視覚と言語と行動を統合したVLAモデルについて、双腕マニピュレーションと無人航空機への応用を7つの観点からレビューし、両分野間の技術移転可能性と14の研究課題を提示した論文。
原題: Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review / Inkyu Sa, Chanoh Park, Hea-Min Lee 他
日本語で読む → - 論文物体検出画像認識
実環境UAV向け能動物体検出:大規模データセット、ベンチマーク、および手法の提案
UAV地上能動物体検出のための大規模実世界データセットATRNet-LUDOを構築し、ベンチマークを確立。さらに、JEPAを用いた世界モデルで汎化性能を高めるAOD-JEPA手法を提案した。
原題: Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method / Tianpeng Liu, Xinhua Jiang, Li Liu 他
日本語で読む → - 論文ヒューマノイドロボティクス
自然な人間対話を実現する受付ロボット用多関節ヒューマノイドヘッド
受付業務向けに、21自由度の表情・首機構とシリコン皮膚を備え、顔認識と大規模言語モデルを統合したヒューマノイドヘッドを開発し、人間らしさと感情表現を評価した。
原題: Articulated Humanoid Head for a Robot Receptionist Capable of Natural Human Interaction / Tharusha Fonseka, Charuka Bandara, Moshintha Hewavitharana 他
日本語で読む → - 論文マニピュレーション画像認識
xperception:ロボット把持をより簡単にする
CADモデルと基盤モデルの特徴を活用し、追加学習なしで物体の6D姿勢を高精度に推定する技術を提案。産業用エッジデバイスでも動作し、乱雑な環境での把持を可能にする。
原題: xperception -- Making Robotic Grasping Easier / Matteo Bortolon, Andrea Caraffa, Alice Fasoli 他
日本語で読む → - 論文ナビゲーションロボティクス
VLN-AVP:ハイブリッド長期短期記憶を用いた自動バレーパーキングのためのゼロショット視覚言語ナビゲーション
事前地図に依存せず、視覚言語モデルとBEVモデルを組み合わせ、自然言語指示に従って駐車場をナビゲートするゼロショットフレームワークを提案。短期知覚記憶と長期トポロジー記憶を導入し、新規の地下駐車場ベンチマークで高い成功率を達成した。
原題: VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking / Yijian Li, Xiangru Mu, Changze Li 他
日本語で読む → - 論文VLA/ロボット操作ロボティクス
AC-VLA: 構成学習によるロバストな分布外行動実行
VLAモデルの分布外汎化を改善するため、LLMによるタスク分解と非対称マスキングを組み合わせた構成学習フレームワークAC-VLAを提案した。
原題: AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning / Xiaojiang Peng, Kai Peng, Jie Lu 他
日本語で読む → - 論文VLA/操作ロボティクス
VistaVLA: 幾何・意味認識型3Dガウス基底VLAによるロボット操作
3Dガウスプリミティブを用いて幾何と意味を統合した3D認知表現を構築し、VLAポリシー学習のためのコンパクトな文脈トークンとして接地する新しい2段階フレームワークを提案。
原題: VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation / Mohan Liu, Zhihao Gu, Xuanyu Chen 他
日本語で読む → - 論文ロボット表現/影生成ロボティクス
投影された視覚的抽象表現を通じたロボットのコミュニケーション学習
ロボットが自身の影を動的に表現するシステムを提案。柔らかい皮膚を持つ多指ハンドと学習された影の自己モデルを用いて、目標の影画像や動画に合わせて手の動きを最適化する。
原題: Robot Learning to Communicate through Projected Visual Abstractions / Danyang Yan, Boyuan Wang, Jiaxun Liu 他
日本語で読む → - 論文パラレルロボットロボティクス
Tripody: 高所建設作業のための過拘束3-SPR型パラレルロボット
天井建設作業向けに、車輪付き3自由度パラレルロボットを開発し、過拘束機構と弾性変形を利用して高剛性と高精度を実現した。
原題: Tripody: An Overconstrained 3-SPR-like Parallel Robot for High-Reach Construction Tasks / Julien Kindle, Jakub Raczy, Riccardo Balbi 他
日本語で読む → - 論文モーション計画ロボティクス
敵対者としてのワールドモデル:堅牢なモーション計画のためのマルチエージェント自己対戦ファインチューニング
密集交通における堅牢なモーション計画のために、プランナーのワールドモデルを敵対者として用いる自己対戦ファインチューニング手法AWMを提案し、nuPlanとInterPlanで有効性を示した。
原題: World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning / Tong Nie, Yuewen Mei, Junlin He 他
日本語で読む → - 論文ビデオワールドモデル画像認識
小売業における外在視点と内在視点の基盤ビデオワールドモデル適応の比較
小売店舗の同期した外在視点・内在視点ビデオを用いて、事前学習済みビデオ拡散モデルを小売シーンに適応させる際、どの視点のデータが最も効果的かを検証した。外在視点のみの適応が、組み合わせ適応と同等以上の性能を示した。
原題: RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail / Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar 他
日本語で読む → - 論文強化学習AI
インタラクティブなゲームプレイのためのコーチ可能なエージェント
強化学習エージェントに、実行時にスタイル(タスクの解き方の変更)を指示できるフレームワークを提案し、複数の複雑なドメインで有効性を示した論文。
原題: Coachable agents for interactive gameplay / Roberto Capobianco, Harm van Seijen, Nolan D. Bard 他
日本語で読む → - 論文画像分類画像認識
深層学習によるマルチラベル画像分類の再考:分類体系、課題、展望
深層学習を用いたマルチラベル画像分類(MLIC)の包括的なサーベイ論文であり、手法を6つのグループに分類し、課題と将来の研究方向をまとめている。
原題: Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook / Xuelin Zhu, Xiu-Shen Wei, Jiawei Ge 他
日本語で読む → - 論文3Dシーングラフ生成画像認識
DeWorldSG: ワールドモデル事前知識による深度認識3Dセマンティックシーングラフ生成
RGB-Dシーケンスから時間的に安定した3Dセマンティックシーングラフを生成するフレームワークを提案。物体を確率的3Dノードとして表現し、ワールドモデルの事前知識で関係性を補完することで精度を大幅に向上させた。
原題: DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors / Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha 他
日本語で読む → - 論文ワールドモデル機械学習
Valdi: 価値拡散ワールドモデル
拡散モデルを用いた不確実な未来予測と、オンラインMPCのための高速な潜在計画を両立するワールドモデルを提案。CarRacing環境での予備実験により、単一拡散ステップで決定論的MLPベースラインに匹敵する性能を示した。
原題: Valdi: Value Diffusion World Models / Christopher Lindenberg, Kashyap Chitta
日本語で読む →