論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/24 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
HarnessPAI:物理AIのための進化するハーネス
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
原題: HarnessPAI: An Evolving Harness for Physical AI / Xin Wang, Wenhao Wu, Menghao Zhang 他
日本語で読む → - 論文VLAロボティクス
ActGaze: 反事実的視覚介入による行動に基づく注視学習で高精度マニピュレーションを実現
VLAモデルの視覚的注意をタスクに関連する領域に集中させるため、反事実的視覚介入によって行動予測に重要な領域を特定し、注視を学習させる手法を提案。実機実験で高精度マニピュレーションタスクにおいて既存手法を上回る性能を示した。
原題: ActGaze: Learning Action-Grounded Gaze through Counterfactual Visual Interventions for High-Precision Manipulation / Jinxuan Zhu, Jiaheng Wang, Chao Tang 他
日本語で読む → - 論文VLAロボティクス
World Action Agent:視覚的アクション空間でのロボット操作を可能にするVLM活用フレームワーク
VLMをマルチエージェント構成でロボット操作に活用し、接触ビュー・アクションリハーサル・ビュー内補正を組み合わせた視覚的アクション作業空間を提案。LIBERO-Proで75.6%の成功率を達成。
原題: World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal / Yehang Zhang, Haojian Huang, Yifan Chang 他
日本語で読む → - 論文VLAロボティクス
フローマッチングVLAにおけるタスク依存計算配分のための分離型アーリーイグジット
フローマッチングVLAに軽量なExit Transformerを追加し、バックボーン・行動エキスパート・デノイジングの深さをタスクごとに調整可能にした。
原題: Decoupled Early Exits for Task-Dependent Compute Allocation in Flow-Matching VLAs / Riccardo Andrea Izzo, Rimvydas Rubavicius, Gianluca Bardaro 他
日本語で読む → - 論文VLAロボティクス
自己適応型VLA:ロボット実運用のための堅牢な展開手法
ハードウェアのずれに自己適応するVLAモデルを提案し、展開時のキャリブレーションなしで精度が要求される双腕・巧緻マニピュレーションタスクの性能を80%以上回復させた。
原題: Self-Adaptive VLA for Robust Robot Deployment / Hongxin Zhang, Chunru Lin, Tsun-Hsuan Wang 他
日本語で読む → - 論文VLAロボティクス
RACaP: 進化可能なロボット学習のためのポリシーとしての推論・行動・コーディング
コード生成を進化フェーズに移し、展開時は凍結された型付きポリシーAPIをReActループで呼び出すエージェント型フレームワークを提案。長期的タスクで成功率と速度を大幅に改善し、小型モデルへの蒸留で実機展開を効率化した。
原題: RACaP: Agentic Reasoning, Acting, and Coding as Policies for Evolvable Robot Learning / Zexi Li, Yehang Zhang, Haojian Huang 他
日本語で読む → - 論文VLAロボティクス
AdaHVLA: 長期的視野の視覚-言語-行動実行のための適応型ハーネス
VLAモデルの長期タスク実行を支援するため、ロボット経験を通じてコードベースの協調ポリシーを適応的に改良するハーネスを提案し、シミュレーションと実世界で成功率を大幅に向上させた。
原題: AdaHVLA: Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution / Junyi Tang, Jie Peng, Zezhen Ding 他
日本語で読む → - 論文VLA画像認識
行動表現の方向・スケール分解:VLAモデルで何をトークン化すべきかの再考
VLAモデルの行動トークン化において、並進・回転の増分を方向とスケールに分解するDSD表現を提案し、シミュレーションと実機で成功率の向上を実証した。
原題: Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models / Yufei Duan, Hang Yin, Alberta Longhini 他
日本語で読む → - 論文VLAロボティクス
Robo-Harness K1: 知覚拡張によるロボット操作エージェントの活用
VLMに深度や空間計測などの知覚ツールを提供し、追加学習なしでロボット操作を実現するエージェントフレームワークを提案。少ない実演データでも高い汎化性能を示す。
原題: Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentation / Zexi Li, Yehang Zhang, Wenqian Li 他
日本語で読む → - 論文VLAロボティクス
Rolling-WAM: 転がる想像による世界行動モデル
ロボット操作のための世界行動モデルにおいて、映像と行動のノイズ除去を再計画サイクルごとに分割して行うことで、計算遅延を抑えつつ4.5倍の再計画高速化を実現した手法。
原題: Rolling-WAM: World Action Models with Rolling Imagination / Yinghua Zhou, Junjie Ye, Yiqi Zhao 他
日本語で読む → - 論文VLAロボティクス
RAPID: 実演からのロボットエージェントプログラミング
人間の一回の視覚的実演から、コード生成エージェントがロボットプログラムを自動生成・検証・改良し、物体中心の関係表現で汎化を実現する手法を提案。
原題: RAPID: Robot Agentic Programming from Demonstrations / Yuyao Liu, Jiayuan Mao, David Hsu 他
日本語で読む → - 論文VLAAI
PUBG Ally:音声対話型の具現化AIチームメイト
PUBG: BATTLEGROUNDSでプレイヤーと音声でやり取りしながら自律的に行動するAIチームメイトを構築し、約3.9万セッションの実プレイデータで訓練・評価した研究。
原題: PUBG Ally: A Conversational Embodied Agent as an AI Teammate / Beomsoo Kim, Byeongju Kim, Dohyun Kim 他
日本語で読む → - 論文VLA画像認識
検索して特定:大規模言語モデルとLiDAR幾何学を橋渡しする空間グラウンディング
LiDAR点群と言語モデルを組み合わせ、複雑な空間関係の質問に対して対象物の座標を高精度に特定する手法を提案。
原題: Retrieve-to-Localize: Bridging Large Language Models and LiDAR Geometry for Spatial Grounding / Byounggun Park, Giyong Moon, Jusung Kim 他
日本語で読む → - 論文VLAロボティクス
リーマン平均流による行動多様体上の高速視覚運動方策学習
ロボットの行動系列が滑らかな多様体上に定義されることに着目し、リーマン条件付きフローマッチングを基盤としたフローマップ整合性目的で、1回のネットワーク評価で多様体上の行動生成を可能にするRMFPを提案した。
原題: Faster Visuomotor Policy Learning on Action Manifolds via Riemannian MeanFlow / S. Talha Bukhari, Austin Garrett, Yi Wei 他
日本語で読む → - 論文VLAロボティクス
InfiNoVA: 視点不変なロボットポリシーのための無限新規視点拡張
マルチカメラの実演を時間変化する3Dガウス表現として再構成し、任意の視点から幾何学的に一貫した新規視点画像を生成するデータ拡張手法を提案。未見視点での操作タスク成功率を大幅に向上させた。
原題: InfiNoVA: Infinite Novel View Augmentation for Viewpoint Invariant Robot Policies / Sai Puneeth Reddy Gottam, Elmar Rueckert, Vedant Dave
日本語で読む → - 論文VLAロボティクス
視覚言語行動ポリシーのためのアドバンテージ誘導事後学習の分解
視覚言語行動ポリシーの事後学習において、アドバンテージ誘導強化学習の設計選択を分解し、段階的評価で有効なモジュール式レシピを特定した。
原題: Dissecting Advantage-Guided Post-Training for Vision-Language-Action Policies / Jiahang Cao, Hanye Zhao, Hang Lai 他
日本語で読む → - 論文VLAロボティクス
EmbodiedSWE:長期的器用ロボティクスのためのコーディングエージェント
コーディングエージェントが長期的・器用なロボットタスクを解き、その解を多様な軌道に拡張してVLAを訓練し、実機タスクまで完了できることを示した研究。
原題: EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics / Haoxiang You, Zeyu Shen, Yilang Liu 他
日本語で読む → - 論文VLAロボティクス
言語より潜在表現:運転向けアノテーション効率の良いVLA
言語注釈が少ない運転データでも、潜在アクションモデルと言語翻訳器を組み合わせてVLAを訓練し、5%未満の言語注釈で完全教師ありに匹敵する性能を達成した。
原題: Less Language, More Latents: Annotation-Efficient VLAs for Driving / Alexey Zakharov, Kemal Oksuz, Puneet K. Dokania
日本語で読む → - 論文VLAロボティクス
BEE: 視覚言語行動モデルを用いた介入適応型実世界強化学習
凍結したVLAモデルに対し、人間の修正を行動次元ごとの信頼度に応じた制約として扱うことで、実機でのオンライン強化学習を効率化する手法を提案。
原題: BEE: Intervention-Adaptive Real-World Reinforcement Learning with Vision-Language-Action Models / Weihui Zhao, Xiaohan Yan, Zunian Wan 他
日本語で読む → - 論文VLAロボティクス
不確実性ゲート付き探索ノイズがフローマッチングVLAポリシーのオンラインRL微調整におけるタスク崩壊を抑制する
フローマッチングVLAポリシーのオンライン強化学習微調整で生じる「タスク崩壊」を、タスク非依存の新規性・能力信号に基づく不確実性ゲート付き探索ノイズ制御により抑制できることを示した。
原題: Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy / Mehmet Turan Yardımcı, Yunus Emre Çoğurcu
日本語で読む → - 論文VLA画像認識
見た目は同じでも答えが変わる:堅牢な視覚言語推論のためのフリップ方向ステアリング
視覚言語モデルが画像の微妙な変化で答えを変えてしまう問題に対し、学習不要の推論時ステアリング手法FlipDirを提案し、元の予測を回復しつつ安定な予測を保持する。
原題: Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning / Yeonsung Jung, Joonhyun Jeong, Hoang Pham 他
日本語で読む → - 論文VLAロボティクス
見て、思い出して、行動する:並行身体ストリームにおける常時稼働ロボット
常時稼働ロボット向けに、ライブ知覚・身体状態・自身の過去行動を非同期に統合するストリーミングポリシーARMSを提案し、両腕同時作業でのタスク成功率を向上させた。
原題: Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams / Ding Yi, Peiwen Sun, Chenchu Rong 他
日本語で読む → - 論文VLA画像認識
潜在進化型ワールドアクションモデル
JEPAエンコーダの予測埋め込みを活用し、ビデオ拡散バックボーンに依存せずに行動生成と環境進化をモデル化するLeWAMを提案。さらにオフライン選好改善手法DemoDPOを導入した。
原題: Latent evolving World Action Model / Xueji Fang, Boqiang Duan, Hua Wu 他
日本語で読む → - 論文VLAロボティクス
MemBodied: 視覚-言語-行動モデルのための再帰的連想記憶
VLAモデルに固定サイズのエピソード記憶を導入し、過去の観測を保持せずに履歴依存のマニピュレーションタスクを高成功率で実現した。
原題: MemBodied: Recurrent Associative Memory for Vision-Language-Action Models / Tej Deep Pala, Navonil Majumder, Bryce Goh 他
日本語で読む → - 論文VLAロボティクス
ロボット方策学習のための行動整合型アクショントークン化
Soft-DTWで対応する動作チャンクを選び、量子化座標を再構成と同時に整合させることで、タスク間で共有される動作構造をトークナイザに学習させ、下流の自己回帰方策の性能を向上させた研究。
原題: Behavior-Aligned Action Tokenization for Robot Policy Learning / Junbo Dong, Ze Chen, Zhendong Xie 他
日本語で読む → - 論文VLAロボティクス
TANDEM: 必要時デモンストレーションを用いたタスク・動作計画による視覚言語行動モデルの効率的ファインチューニング
タスク・動作計画(TAMP)と必要な時だけ人間が遠隔操作する手法を組み合わせ、長期的なマニピュレーションタスクのデモンストレーションを効率的に収集し、視覚言語行動モデルのファインチューニングを可能にするシステムを提案。
原題: TANDEM: Task and Motion Planning with As-Needed Demonstrations for Efficient Vision-Language-Action Model Fine-tuning / Samrat Sahoo, Liang Ji, Tom Silver 他
日本語で読む → - 論文VLAロボティクス
未来予測を超えて:ロボット制御のための生成的適応としてのデノイジング
事前学習済み生成DiTを制御に適応させる際、未来の視覚予測は不要であり、現在の観測をデノイズする軌跡そのものが制御への有効なインターフェースとなることを示し、学習効率と性能を両立する手法NowWAMを提案した。
原題: Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control / Zanyi Wang, Yuheng Lei, Dengyang Jiang 他
日本語で読む → - 論文VLAロボティクス
DAVIS: ヒューマノイドサッカースキルのための深度のみのエンドツーエンド能動視覚フレームワーク
頭部搭載の深度画像と固有感覚履歴のみから、ヒューマノイドロボットがサッカーのシュートやドリブルを直接25自由度の関節PD目標として学習するエンドツーエンドフレームワークを提案。
原題: DAVIS: A Depth-Only End-to-End Active-Vision Framework for Humanoid Soccer Skills / Jiakang Jin, Yixiao Huo, Pengyuan Wang 他
日本語で読む → - 論文VLAロボティクス
CoRe-WAM: 対応整合型時間差分によるワールドアクションモデル
物体追跡の対応関係を用いて過去の視覚特徴を現在位置に移動させ、その差分を軽量アダプタでポリシーに組み込むことで、ロボットマニピュレーションの成功率を向上させた研究。
原題: CoRe-WAM: Correspondence-Aligned Temporal Residuals for World Action Models / Bin Zhou, Jialong Liu, Jianan Wang 他
日本語で読む → - 論文VLAロボティクス
行動を変える記憶は行動を導く記憶ではない:履歴条件付きロボット方策の反事実的監査
ロボットの記憶が意思決定を導いているかを、同一の現在で二つの履歴を交差させる反事実的監査(CMA)で評価し、記憶への感度と信頼性を分離して検証した。
原題: Memory That Changes Action Is Not Memory That Guides It: Counterfactual Auditing of History-Conditioned Robot Policies / Jiajie Zhang, Yankai Xiang, Changhao Chen
日本語で読む →