論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文物体検出画像認識
MITE-Net: 組み込みエッジSAR向けSWaP最適化4Kビデオ微小ターゲット認識
UAVなどのエッジデバイス向けに、SWaP制約下で4K映像から微小なターゲットをリアルタイムに認識するための軽量カスケードアーキテクチャMITE-Netを提案し、専用データセットとエッジデバイスでのベンチマークを提供した。
原題: MITE-Net: SWaP-Optimized 4K Video Tiny Target Perception for Embodied Edge SAR / Mingshuo Xu, Mu Hua, Jigen Peng 他
日本語で読む → - 論文器用操作/事前学習ロボティクス
シミュレーションでの視覚的器用さの事前学習
VRヘッドセットを使い、人間がシミュレーション内で物体を操作して収集したデータで、多指ロボットハンドの操作ポリシーを事前学習する手法を提案。実機での微調整により、ゼロから学習するよりも高い性能を達成した。
原題: Pre-training Visual Dexterity in Simulation / Sarthak Kamat, Adam Rashid, Satvik Sharma 他
日本語で読む → - 論文sim2realロボティクス
触覚シミュレーションを使わない触覚Sim2Real:ボトルネック潜在再構成による実現
触覚センサのシミュレーションを避け、シミュレータ内のオラクルセンサ(点群と指先力)で学習したポリシーを、実センサの潜在表現をオラクルに合わせることで実機に転移するフレームワークを提案。挿入や歯車噛み合わせで高成功率を達成。
原題: Tactile Sim2Real without Tactile Simulation via Bottlenecked Latent Reconstruction / Fan Yang, Youngsun Wi, Jinhao Yu 他
日本語で読む → - 論文LiDARレジストレーションロボティクス
誰のフレームで縮退するのか?LiDARレジストレーションにおける縮退検出の等変性条件
LiDARレジストレーションの縮退検出ラベルが座標系に依存することを示し、フレーム不変な一般化固有値基準を提案した論文。
原題: Degenerate in Whose Frame? An Equivariance Condition for Degeneracy Detection in LiDAR Registration / Yujie Zhang, Chunlei Zhao, Yuzong Lin 他
日本語で読む → - 論文操作プランニングロボティクス
データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
原題: Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning / Yuxing Long, Lei Kang, Ziyan Yu 他
日本語で読む → - 論文ビデオ理解画像認識
CrossView: 視覚言語モデルはカメラをまたいで推論できるか?
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。
原題: CrossView: Can Vision-Language Models Reason Across Cameras? / Sahil Shah, S P Sharan, Harsh Goel 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
投機的推論と検証による効率的なVLA推論のためのアルゴリズム・アーキテクチャ協調設計
ロボット環境の能動/非能動状態に応じて投機的予測と選択的検証を切り替えることで、VLAモデルの推論効率と行動長を改善する協調設計フレームワークを提案した。
原題: Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification / Chunyu Qi, Zhuoran Song, Jian Weng 他
日本語で読む → - 論文模倣学習ロボティクス
ロボティクスにおけるオープンループ実行の再考:リアクティブで高性能なポリシーへ
模倣学習で使われるオープンループ実行の利点を再検証し、長いコンテキストを持つポリシーではクローズドループの方が優れることを示した。
原題: Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies / Michael Zeng, Abhinav Agarwal, Ajay Bati 他
日本語で読む → - 論文マニピュレーションロボティクス
ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリング
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
原題: Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation / Yijie Xu, Haopeng Jin, Run Zhou 他
日本語で読む → - 論文介入学習/強化学習ロボティクス
GAINS: 強化学習における不整合な人間介入信号の活用
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
原題: GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning / Xinyi Zhang, Yinuo Zhao, Pei Ren 他
日本語で読む → - 論文ビデオ生成/編集画像認識
EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワーク
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
原題: EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing / Yuqian Zhou, Zhenghong Zhou, Zongze Wu 他
日本語で読む → - 論文再構成可能ロボットロボティクス
着脱式ワイヤ駆動:アクチュエータ共有による再構成可能ロボットアーキテクチャ
重く高価なアクチュエータを共通ベースに集約し、ワイヤ経路を物理的に切断・再接続できる「ワイヤ着脱ユニット」により、複数の形態(剛体アーム、連続体アーム、グリッパ)を単一のアクチュエータセットで駆動する再構成可能ロボットシステムを提案・実証した。
原題: Detachable Wire Drive : Reconfigurable Robot Architecture with Shared Actuators / Takahiro Hattori, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLA/セキュリティcs.CR
ビットフリップ攻撃による視覚言語行動モデルの脆弱性:行動デコードアーキテクチャが攻撃耐性を左右する
量子化された視覚言語行動(VLA)モデルに対する初のビットフリップ攻撃を提案し、少数のフリップで閉ループ成功率を0%にできることを示した。攻撃に必要なフリップ数は行動ヘッドの種類に依存し、直接回帰やトークンポリシーでは1〜5回、フローマッチングでは100〜300回必要である。
原題: Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability / Yudong Gao, Linghan Chen, Wenhan Wu 他
日本語で読む → - 論文マニピュレーションロボティクス
ReForce: 力覚を考慮した器用な操作のためのリターゲティング学習
人間のデモからロボットの操作へ変換する際、運動学的なリターゲティングに加えて力の情報を考慮し、接触を再現する手法を提案。シミュレーションと実機で力追従誤差を低減し、多指接触を強化した。
原題: ReForce: Learning Force-aware Retargeting for Dexterous Manipulation / Yuhang Wu, Lingqi Zeng, Changwei Jing 他
日本語で読む → - 論文活動認識機械学習
TransfHAR: オンデマンド活動認識のための自己教師あり手首表現学習
手首のIMUデータを用いた自己教師あり事前学習により、未学習の細かい活動を少数のデモから認識できるフレームワークを提案し、実時間スマートウォッチアプリとして実装・評価した。
原題: TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition / Aidan Bradshaw, Riku Arakawa, Xin Liu 他
日本語で読む → - 論文触覚ロボティクス
ロボットのための視覚ベース触覚知能:センシング、学習、身体化された操作
視覚ベース触覚センサ(VBTS)のハードウェア、学習手法、シミュレーション、データセットを統合したレビュー論文。接触による変形を画像化するVBTSのパイプライン全体を俯瞰し、今後の課題と方向性を示す。
原題: Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation / Peng Zhou, Jun Hu, Sihan Chen 他
日本語で読む → - 論文VLA画像認識
AlloEgo-VLM: 視覚言語モデルにおける全中心・自己中心参照枠の曖昧性解消
視覚言語モデルが空間関係を記述する際に参照枠(全中心的・自己中心的)の曖昧さを解消するためのデータセットとフレームワークを構築し、ロボットの物体探索タスクでの実用性を検証した。
原題: AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models / Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao 他
日本語で読む → - 論文UAVプランニングロボティクス
エンドツーエンドUAVプランナーへの改良
単一深度画像から軌道を直接生成するYOPOプランナーに対し、二分割MINCOパラメータ化、ホモトピーアンカー、バリアペナルティ、ランキング損失などの改良を加え、安全性と飛行経路の質を向上させた。
原題: Some Modifications to Our End-to-End UAV Planner / Junjie Lu, Bailing Tian
日本語で読む → - 論文ポリシー学習ロボティクス
二つのアクションヘッドを一致させる:フローマッチングポリシーのための協調メカニズムと実行時崩壊証明
フローマッチングポリシーにおいて、関節空間とエンドエフェクタ空間の二つのデコード結果の残差を実行時信号として用いる際、マルチモーダルタスクでの誤警報を避けるための協調メカニズムを研究し、理論的な証明と実験的評価を行った。
原題: Making two action heads agree: coordination mechanisms and a runtime collapse certificate for flow-matching policies / Jinhui Sun, Wei Zhou, Bowen Yang 他
日本語で読む → - 論文歩行ロボティクス
Tac4Loco: ヒューマノイド歩行のための時空間足底圧表現の学習
ヒューマノイドロボットの歩行制御において、足底圧力の空間的トポロジーを保持した表現を学習し、シミュレーションと実機のセンサ信号を共通の観測空間にマッピングすることで、不整地での適応的な歩行を実現するフレームワークを提案した。
原題: Tac4Loco: Learning Spatiotemporal Plantar Pressure Representations for Humanoid Locomotion / Ziyun Liu, Sikai Guo, Zheng Li 他
日本語で読む → - 論文群制御cs.MA
WONDER: マルチエージェントUAVカバレッジ最適化のための無線ワールドモデルに基づく交渉フレームワーク
災害後の無線カバレッジ復旧のため、UAV群の協調動作を最適化するフレームワークを提案。局所観測と群全体のカバレッジのギャップを、JEPAベースの無線ワールドモデルと多ラウンド交渉で埋める。
原題: WONDER: A Radio World Model-based Negotiation Framework for Multi-Agent UAV Coverage Optimization / Jiahao Huang, Rongpeng Li, Zhifeng Zhao 他
日本語で読む → - 論文VLA画像認識
GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論
マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。
原題: GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning / Zesheng Yang, Lingling Zhang, Xinyu Zhang 他
日本語で読む → - 論文模倣学習/遅延補償ロボティクス
RAPAC-DP: 遅延実行下での拡散ポリシーに対する応答整合型保留アクション補償
クラウド推論の遅延による制御性能低下を補うため、実行予定のアクション列を条件入力として活用する補償機構を拡散・フローベースのポリシーに組み込んだ。遅延が無視できる場合は元のポリシーと完全に一致し、遅延デモなしで訓練可能。
原題: RAPAC-DP: Response-Aligned Pending-Action Compensation for Diffusion Policies under Delayed Execution / Tao Wang, Wei Wang, Jianhui Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
接触モードは層である:離散連続計画における幾何構造の利点
接触を伴う操作計画を、接触モードを配置空間の層として捉え、層上の測地線を辿る計画として解く手法を提案。シミュレーション上の2つのタスクで事前情報なしに高速に解を求めた。
原題: Contact Modes Are Strata: What Geometric Structure Buys in Discrete-Continuous Planning / Phone Thiha Kyaw, Jonathan Kelly
日本語で読む → - 論文VLA/エッジ推論/エネルギー効率AI
EcoVLA: リアルタイム制約下での視覚言語行動モデルのためのエネルギー効率的なデバイス・エッジ協調推論
VLAモデルの推論コストを削減するため、デバイスとエッジサーバー間で協調推論を行い、リアルタイム制約を満たしつつシステム全体のエネルギー効率を最大化する適応型フレームワークEcoVLAを提案した。
原題: EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints / Ao Zhou, Bo Dai, Le Yu 他
日本語で読む → - 論文ビデオ推論画像認識
視覚的思考の内面化:能動的なビデオ推論のための内部化視覚思考
ビデオ推論において、推論時に中間画像を生成するVisual CoTの代わりに、訓練時に未来フレームの潜在表現を予測するInternalized Visual Thinkingを提案し、推論時のオーバーヘッドを削減しつつ性能を維持・向上させた。
原題: Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning / Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar 他
日本語で読む → - 論文ソーシャルロボット制御ロボティクス
MistyPilot: マルチエージェントLLMスキルオーケストレーションによるソーシャルロボット制御の実現
自然言語の指示からソーシャルロボットを制御するためのマルチエージェントLLMフレームワークを提案し、センサー連動の物理的動作と対話的な社会的動作を統合的に実行する。
原題: MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration / Xiao Wang, Lu Dong, Ifeoma Nwogu 他
日本語で読む → - 論文操作ロボティクス
PACE: 長期的身体操作のためのフェーズ進行認識クレジット
長期的な操作タスクにおいて、各ステップのフェーズと進行度を推定し、ステップ単位のクレジットを割り当てることで、VLAモデルのポストトレーニングを改善するフレームワークを提案した。
原題: PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation / Chengye Song, Jiawei Zhang, Rui Song 他
日本語で読む → - 論文VLA/記憶ロボティクス
賢く記憶する:ロボット記憶のための視覚履歴圧縮と双曲経験空間
長期的なロボットポリシーのために、視覚履歴を圧縮し、経験を双曲空間で階層的に保存・活用するプラグインモジュールを提案。pi0に適用し、LIBERO-Plusで成功率を向上させた。
原題: Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory / Dai Zhou, Jiexi Yan, Tong Li 他
日本語で読む → - 論文VLA画像認識
AWM-VLA: 効率的で説明可能な視覚-言語-行動ポリシーのための整合された世界モデリング
拡散トランスフォーマーポリシー内に未来の視覚-言語埋め込みと整合する未来トークンを組み込み、物体中心の予測も加えることで、長期的な結果を先読みしつつ説明可能なロボット操作を実現した。
原題: AWM-VLA: AlignedWorld Modeling for Efficient and Explainable Vision-Language-Action Policies / An Lanji, Dawei Liu, Jin Li 他
日本語で読む →