論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文医療ロボティクスロボティクス
US-VLA: 腹部超音波検査のための視覚・言語・動作モデル
臨床的な意味目標を明示的に符号化し、リアルタイムの超音波フィードバックに基づいてプローブ操作を生成する超音波検査自動化のための視覚・言語・動作モデルを提案した。肝臓と腎臓の検査データセットを構築し、プローブ操作タスクでの有効性と汎化性を示した。
原題: US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina / Cheng Zhang, Xingzheng Wu, Guihao Yan 他
日本語で読む → - 論文リハビリテーションロボティクスロボティクス
ロボット支援上肢タスク特異的トレーニングのための可変的な理学療法士-患者間相互作用の学習
この論文は、タスク特異的トレーニング中の理学療法士と患者の相互作用を学習し、新しいタスクバリエーションで療法士のトルクを再現するフレームワークを提案しています。少数のデモンストレーションからタスクパラメータ化ガウス混合モデルを用いて個人化された相互作用を学習し、評価では従来手法と同等以上の性能を示しました。
原題: Learning Varying Physical Therapist-Patient Interactions for Robot-mediated Upper Limb Task-Specific Training / Jia Quan Loh, Vincent Crocher, Marlena Klaic 他
日本語で読む → - 論文ナビゲーションロボティクス
実世界動画からのスケーラブル学習による都市ナビゲーションのロングテール顕在化
ウェブ上の未編集な一人称視点動画からメトリック軌跡とナビゲーション意味情報を自動アノテーションし、視覚言語行動ポリシーを訓練して都市ナビゲーションのロングテールな稀なシナリオを体系的に明らかにする枠組みを提案した。
原題: Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos / Bingyi Xia, Han Bao, Zhewei Chen 他
日本語で読む → - 論文動作計画ロボティクス
FlexWorm: 吸着式多セグメント変形ロボットのためのプリミティブ拡張ハイブリッド接触・動作計画
多セグメントの吸着式ソフトロボットが複雑な3D表面を移動するための計画フレームワークを提案し、離散的な吸着切替と連続的な変形を扱い、学習ベースのプリミティブ検索で計画時間を短縮する。
原題: FlexWorm: Primitive-augmented Hybrid Contact-motion Planning for Suction-based Multi-segment Deformable Robots / Zili Tang, Tiecheng Guo, Qinyue Zhang 他
日本語で読む → - 論文シミュレーション/運動制御ロボティクス
ラムダ保持制御:予測的筋骨格シミュレーションにおける最小タスク報酬から創発する人間らしい運動
平衡点仮説に着想を得たλ保持制御器を提案し、筋駆動骨格モデルが最小限の報酬だけで人間らしいスプリント動作を1時間以内に学習できることを示した。
原題: Lambda-Hold Control: Human-Like Movement Emerges from a Minimal Task Reward in Predictive Musculoskeletal Simulation / Jun Hyuk Lee, Chihyeong Lee, Jooeun Ahn
日本語で読む → - 論文顔認識/解釈可能性画像認識
SCOUT: 顔認識テンプレートのオープンボキャブラリ編集のための意味概念発見
顔認識テンプレート内の意味概念を直接発見・操作するフレームワークを提案し、自然言語記述から潜在特徴の意味仮説を生成して安定性を検証することで、編集可能な意味方向を獲得する。
原題: SCOUT: Semantic Concept Discovery for Open-Vocabulary Editing of face Recognition Templates / Leon Todorov, Peter Rot, Peter Peer 他
日本語で読む → - 論文セキュリティロボティクス
基盤モデル搭載身体化エージェントのセキュリティ:攻撃面、攻撃、防御、評価
基盤モデルを使う身体化エージェントのセキュリティを、信頼境界を中心に整理したサーベイ論文。システムを5層・12の攻撃面に分け、58件の攻撃と61件の防御を分析し、研究の偏りを明らかにした。
原題: Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation / Jiawei Liu, Jiacheng Guo, Tian Zhang 他
日本語で読む → - 論文視点計画ロボティクス
円筒空洞のロボット点検のための観測制約付き関節空間視点最適化
円筒空洞の底部を観測するためのロボットカメラ視点を、可視性・運動学・衝突制約を満たしつつ関節空間で最適化する完全自律手法を提案した。
原題: Observation-Constrained Joint-Space Viewpoint Optimization for Robotic Inspection of Cylindrical Cavities / Yuezhong Wang, Rongshen Yin, Bichi Zhang 他
日本語で読む → - 論文ヒューマノイド/VLA/強化学習ロボティクス
HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
原題: HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL / Langzhe Gu, Chengkai Hou, Meng Li 他
日本語で読む → - 論文強化学習ロボティクス
時間論理に基づく普遍的なタスク表現による強化学習
LTL式からタスクの意味を抽出する新しい表現アーキテクチャを提案し、任意の強化学習アルゴリズムに統合可能な普遍的なタスク表現フレームワークLOTUSを導入した。双模倣距離による理論的保証で、学習効率と汎化性能を大幅に向上させる。
原題: Temporal Logic Guided Universal Task Representations for Reinforcement Learning / Hao Zhang, Zhangli Zhou, Zhen Kan
日本語で読む → - 論文群制御ロボティクス
グループ化オークション・コンセンサスアルゴリズムによるマルチロボットシステムの分散タスク割り当て
分散型マルチロボットタスク割り当てにおいて、空間的に近いタスクをグループ化して入札する新しいアルゴリズムGACAを提案し、従来のCBBAより最適性を大幅に向上させた。
原題: Grouping Auction-Consensus Algorithm for Decentralized Task Allocation in Multi-Robot Systems / Jose Rodriguez, Sven Koenig, Wenjie Dong 他
日本語で読む → - 論文マニピュレーションロボティクス
接触モードは層である:離散連続計画における幾何構造の利点
接触を伴う操作計画を、接触モードを配置空間の層として捉え、層上の測地線を辿る計画として解く手法を提案。シミュレーション上の2つのタスクで事前情報なしに高速に解を求めた。
原題: Contact Modes Are Strata: What Geometric Structure Buys in Discrete-Continuous Planning / Phone Thiha Kyaw, Jonathan Kelly
日本語で読む → - 論文群制御cs.MA
WONDER: マルチエージェントUAVカバレッジ最適化のための無線ワールドモデルに基づく交渉フレームワーク
災害後の無線カバレッジ復旧のため、UAV群の協調動作を最適化するフレームワークを提案。局所観測と群全体のカバレッジのギャップを、JEPAベースの無線ワールドモデルと多ラウンド交渉で埋める。
原題: WONDER: A Radio World Model-based Negotiation Framework for Multi-Agent UAV Coverage Optimization / Jiahao Huang, Rongpeng Li, Zhifeng Zhao 他
日本語で読む → - 論文マニピュレーションロボティクス
ReForce: 力覚を考慮した器用な操作のためのリターゲティング学習
人間のデモからロボットの操作へ変換する際、運動学的なリターゲティングに加えて力の情報を考慮し、接触を再現する手法を提案。シミュレーションと実機で力追従誤差を低減し、多指接触を強化した。
原題: ReForce: Learning Force-aware Retargeting for Dexterous Manipulation / Yuhang Wu, Lingqi Zeng, Changwei Jing 他
日本語で読む → - 論文模倣学習/遅延補償ロボティクス
RAPAC-DP: 遅延実行下での拡散ポリシーに対する応答整合型保留アクション補償
クラウド推論の遅延による制御性能低下を補うため、実行予定のアクション列を条件入力として活用する補償機構を拡散・フローベースのポリシーに組み込んだ。遅延が無視できる場合は元のポリシーと完全に一致し、遅延デモなしで訓練可能。
原題: RAPAC-DP: Response-Aligned Pending-Action Compensation for Diffusion Policies under Delayed Execution / Tao Wang, Wei Wang, Jianhui Wang 他
日本語で読む → - 論文ビデオ推論画像認識
視覚的思考の内面化:能動的なビデオ推論のための内部化視覚思考
ビデオ推論において、推論時に中間画像を生成するVisual CoTの代わりに、訓練時に未来フレームの潜在表現を予測するInternalized Visual Thinkingを提案し、推論時のオーバーヘッドを削減しつつ性能を維持・向上させた。
原題: Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning / Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar 他
日本語で読む → - 論文模倣学習ロボティクス
ロボティクスにおけるオープンループ実行の再考:リアクティブで高性能なポリシーへ
模倣学習で使われるオープンループ実行の利点を再検証し、長いコンテキストを持つポリシーではクローズドループの方が優れることを示した。
原題: Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies / Michael Zeng, Abhinav Agarwal, Ajay Bati 他
日本語で読む → - 論文LiDARレジストレーションロボティクス
誰のフレームで縮退するのか?LiDARレジストレーションにおける縮退検出の等変性条件
LiDARレジストレーションの縮退検出ラベルが座標系に依存することを示し、フレーム不変な一般化固有値基準を提案した論文。
原題: Degenerate in Whose Frame? An Equivariance Condition for Degeneracy Detection in LiDAR Registration / Yujie Zhang, Chunlei Zhao, Yuzong Lin 他
日本語で読む → - 論文VLA/エッジ推論/エネルギー効率AI
EcoVLA: リアルタイム制約下での視覚言語行動モデルのためのエネルギー効率的なデバイス・エッジ協調推論
VLAモデルの推論コストを削減するため、デバイスとエッジサーバー間で協調推論を行い、リアルタイム制約を満たしつつシステム全体のエネルギー効率を最大化する適応型フレームワークEcoVLAを提案した。
原題: EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints / Ao Zhou, Bo Dai, Le Yu 他
日本語で読む → - 論文ソーシャルロボット制御ロボティクス
MistyPilot: マルチエージェントLLMスキルオーケストレーションによるソーシャルロボット制御の実現
自然言語の指示からソーシャルロボットを制御するためのマルチエージェントLLMフレームワークを提案し、センサー連動の物理的動作と対話的な社会的動作を統合的に実行する。
原題: MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration / Xiao Wang, Lu Dong, Ifeoma Nwogu 他
日本語で読む → - 論文VLA画像認識
GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論
マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。
原題: GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning / Zesheng Yang, Lingling Zhang, Xinyu Zhang 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
ViTaR: 基盤VLA操作のための視触覚残差適応
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
原題: ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation / Yi Wang, Renjun Wu, Jinyan Liu 他
日本語で読む → - 論文物体検出画像認識
MITE-Net: 組み込みエッジSAR向けSWaP最適化4Kビデオ微小ターゲット認識
UAVなどのエッジデバイス向けに、SWaP制約下で4K映像から微小なターゲットをリアルタイムに認識するための軽量カスケードアーキテクチャMITE-Netを提案し、専用データセットとエッジデバイスでのベンチマークを提供した。
原題: MITE-Net: SWaP-Optimized 4K Video Tiny Target Perception for Embodied Edge SAR / Mingshuo Xu, Mu Hua, Jigen Peng 他
日本語で読む → - 論文操作プランニングロボティクス
データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
原題: Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning / Yuxing Long, Lei Kang, Ziyan Yu 他
日本語で読む → - 論文sim2realロボティクス
触覚シミュレーションを使わない触覚Sim2Real:ボトルネック潜在再構成による実現
触覚センサのシミュレーションを避け、シミュレータ内のオラクルセンサ(点群と指先力)で学習したポリシーを、実センサの潜在表現をオラクルに合わせることで実機に転移するフレームワークを提案。挿入や歯車噛み合わせで高成功率を達成。
原題: Tactile Sim2Real without Tactile Simulation via Bottlenecked Latent Reconstruction / Fan Yang, Youngsun Wi, Jinhao Yu 他
日本語で読む → - 論文器用操作/事前学習ロボティクス
シミュレーションでの視覚的器用さの事前学習
VRヘッドセットを使い、人間がシミュレーション内で物体を操作して収集したデータで、多指ロボットハンドの操作ポリシーを事前学習する手法を提案。実機での微調整により、ゼロから学習するよりも高い性能を達成した。
原題: Pre-training Visual Dexterity in Simulation / Sarthak Kamat, Adam Rashid, Satvik Sharma 他
日本語で読む → - 論文歩行ロボティクス
Tac4Loco: ヒューマノイド歩行のための時空間足底圧表現の学習
ヒューマノイドロボットの歩行制御において、足底圧力の空間的トポロジーを保持した表現を学習し、シミュレーションと実機のセンサ信号を共通の観測空間にマッピングすることで、不整地での適応的な歩行を実現するフレームワークを提案した。
原題: Tac4Loco: Learning Spatiotemporal Plantar Pressure Representations for Humanoid Locomotion / Ziyun Liu, Sikai Guo, Zheng Li 他
日本語で読む → - 論文マニピュレーションロボティクス
ディスクを回転させてより遠くへ:新しい再構成可能な腱駆動マニピュレータの設計とモデリング
腱駆動連続体マニピュレータの中間スペーサディスクを独立に回転させて腱経路を局所的に変更し、複雑な変形を実現する再構成可能な設計を提案し、静的モデルを構築して実験で検証した。
原題: Rotate Disks to Reach Farther: Design and Modeling of a Novel Reconfigurable Tendon Driven Manipulator / Sabyasachi Dash, Yangkun Liu, Will Hunter 他
日本語で読む → - 論文ポリシー学習ロボティクス
二つのアクションヘッドを一致させる:フローマッチングポリシーのための協調メカニズムと実行時崩壊証明
フローマッチングポリシーにおいて、関節空間とエンドエフェクタ空間の二つのデコード結果の残差を実行時信号として用いる際、マルチモーダルタスクでの誤警報を避けるための協調メカニズムを研究し、理論的な証明と実験的評価を行った。
原題: Making two action heads agree: coordination mechanisms and a runtime collapse certificate for flow-matching policies / Jinhui Sun, Wei Zhou, Bowen Yang 他
日本語で読む → - 論文UAVプランニングロボティクス
エンドツーエンドUAVプランナーへの改良
単一深度画像から軌道を直接生成するYOPOプランナーに対し、二分割MINCOパラメータ化、ホモトピーアンカー、バリアペナルティ、ランキング損失などの改良を加え、安全性と飛行経路の質を向上させた。
原題: Some Modifications to Our End-to-End UAV Planner / Junjie Lu, Bailing Tian
日本語で読む →