論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/操作ロボティクス
RLDX-1 技術報告書
多機能な汎用ロボットポリシーRLDX-1を提案し、マルチストリームアクショントランスフォーマーにより多様なモダリティを統合して、器用な操作タスクで既存のVLAモデルを上回る性能を示した。
原題: RLDX-1 Technical Report / Dongyoung Kim, Huiwon Jang, Myungkyu Koo 他
日本語で読む → - 論文VLAロボティクス
ピクセルからトークンへ:視覚言語行動モデルにおける潜在行動教師あり学習の体系的研究
視覚言語行動モデル(VLA)の学習における潜在行動の教師あり手法を体系的に比較し、画像ベースと行動ベースの潜在行動がそれぞれ長期的推論と複雑な運動制御に有効であることを示した。
原題: From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models / Yihan Lin, Haoyang Li, Yang Li 他
日本語で読む → - 論文VLAロボティクス
ECHO: 視覚言語行動モデルのための連続階層メモリ
長期的な操作タスクにおけるVLAモデルの性能を向上させるため、経験を階層的に整理する連続メモリフレームワークECHOを提案。双曲オートエンコーダでメモリを木構造に組織化し、効率的な検索と合成を実現。
原題: ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models / Yanbin Hu, Jin Cui, Jiayi Lu 他
日本語で読む → - 論文VLA/長期タスクロボティクス
ツール整合型視覚言語行動モデルによる長期的身体エージェントの実現
高レベルのVLMエージェントが計画を、専門化されたVLAツール群が局所操作を分担し、長期的タスクを効率的に実行する枠組みを提案した。
原題: Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models / Zixing Lei, Changxing Liu, Yichen Xiong 他
日本語で読む → - 論文VLAロボティクス
MolmoAct2: 実世界展開のための行動推論モデル
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
原題: MolmoAct2: Action Reasoning Models for Real-world Deployment / Haoquan Fang, Jiafei Duan, Donovan Clay 他
日本語で読む → - 論文自動運転/VLAロボティクス
SafeAlign-VLA: リスク認識型自動運転のための負例強化安全整合フレームワーク
自動運転向けVLAモデルに負例(危険シナリオ)を活用した安全整合フレームワークを提案し、カウンターファクチュアルな軌道生成とグループ相対方策最適化により衝突率を低減した。
原題: SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving / Kefei Tian, Yuansheng Lian, Kai Yang 他
日本語で読む → - 論文VLA/テスト時適応ロボティクス
検索して操縦:生成的VLAのテスト時適応のためのオンライン成功記憶
凍結されたVLAモデルが、展開中に成功した行動セグメントを記憶し、推論時に類似状態の成功経験を検索して行動生成を誘導することで、繰り返し環境での信頼性を向上させるテスト時適応フレームワークを提案した。
原題: Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs / Jianchao Zhao, Huoren Yang, Yusong Hu 他
日本語で読む → - 論文VLAロボティクス
ガイド・思考・行動:視覚言語行動モデルにおける対話型身体化推論
ユーザーが視覚的な手がかりでロボットのポリシーを誘導できる対話型VLAフレームワークを提案し、空間的推論と行動生成を統合してOOD環境での堅牢性を向上させた。
原題: Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models / Yiran Ling, Qing Lian, Jinghang Li 他
日本語で読む → - 論文VLA/強化学習ロボティクス
Feat2Go: 視覚特徴に基づく価値推定による身体化強化学習
事前学習済み視覚世界モデルから得た段階的進捗目標を価値モデルで予測し、終端報酬を整形することでVLAモデルの強化学習を改善するフレームワークを提案。
原題: Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning / Junyang Shu, Zhiwei Lin, Bingqing Wei 他
日本語で読む → - 論文ベンチマーク/VLA/記憶ロボティクス
RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマーク
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
原題: RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark / Huashuo Lei, Wenxuan Song, Huarui Zhang 他
日本語で読む → - 論文VLAロボティクス
DyGRO-VLA: 動的グループ化残差最適化による視覚言語行動モデルのクロスタスクスケーリング
視覚言語行動モデルの汎用性を高めるため、情報理論に基づくクロスタスク表現学習と動的残差最適化を組み合わせた二段階最適化フレームワークを提案した。
原題: DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization / Sixu Lin, Yunpeng Qing, Litao Liu 他
日本語で読む → - 論文VLA/RLファインチューニングロボティクス
何を無視し、何に反応するか:VLAモデルの視覚的に頑健なRLファインチューニング
VLAモデルのRLファインチューニングにおいて、視覚変化がタスクに無関係か挙動変更を要するかを区別する補助目的を追加し、視覚的頑健性を向上させるPAIR-VLAを提案した。
原題: What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models / Yuanfang Peng, Jingjing Fu, Chuheng Zhang 他
日本語で読む → - 論文VLA/データ選択ロボティクス
FrameSkip: VLAトレーニングにおける少数だが情報量の多いフレームからの学習
ロボットのデモ軌道から全フレームを均等に使う代わりに、動作変化や視覚-動作の整合性などに基づいて重要フレームを選び、その割合を増やして学習するフレーム選択手法を提案。データローダのみを変更し、VLAアーキテクチャはそのままに、3つのベンチマークで成功率を向上させた。
原題: FrameSkip: Learning from Fewer but More Informative Frames in VLA Training / Bin Yu, Shijie Lian, Xiaopeng Lin 他
日本語で読む → - 論文VLA/強化学習ファインチューニングロボティクス
EXPO-FT: 視覚言語行動モデルのサンプル効率的強化学習ファインチューニング
事前学習済みの視覚言語行動(VLA)モデルを強化学習で安定かつサンプル効率的にファインチューニングするシステムEXPO-FTを提案し、高精度・動的動作を要する複数の操作タスクで完全成功率を達成した。
原題: EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models / Perry Dong, Kuo-Han Hung, Tian Gao 他
日本語で読む → - 論文VLA/ベンチマーク画像認識
Embodied3DBench: 視覚言語モデルの低水準身体化空間知能のベンチマーク
視覚言語モデルの身体化3D環境における低水準空間知能を評価するベンチマークを提案し、13モデルの評価と大規模データセットによる改善を示した。
原題: Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models / Jiyao Zhang, Mingxu Zhang, Yitong Peng 他
日本語で読む → - 論文VLA/操作ロボティクス
AffordVLA: 暗黙的特徴アライメントによるアフォーダンス表現の視覚言語行動モデルへの注入
VLAモデルの視覚表現に操作中心のアフォーダンス知覚を暗黙的に注入するフレームワークを提案し、シミュレーションと実世界で高い性能を達成した。
原題: AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment / Weijie Kong, Zhian Su, Wei Yu 他
日本語で読む → - 論文セキュリティ/VLAロボティクス
ATAAT: 視覚-言語-行動モデルに対するバックドア攻撃を防ぐ適応型脅威認識敵対的チューニングフレームワーク
視覚-言語-行動(VLA)モデルの視覚経路へのバックドア攻撃を研究し、従来手法の失敗原因である「勾配干渉」を解決する適応型フレームワークを提案した。
原題: ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models / Kewei Chen, Yayu Long, Shuai Li 他
日本語で読む → - 論文VLA/ロボット操作ロボティクス
Sentinel-VLA: 動的推論とエラー回復のための能動的状態監視を備えたメタ認知VLAモデル
VLAモデルに能動的な状態監視モジュールを追加し、必要時のみ動的推論やエラー回復を行うメタ認知型モデルを提案。自己進化的継続学習と直交アダプタにより性能向上と破滅的忘却防止を実現し、実機で成功率を30%以上向上させた。
原題: Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery / Wenhao Li, Xiu Su, Dan Niu 他
日本語で読む → - 論文自動運転/VLA/ロバスト性cs.CR
ReasonBreak: 自動運転向け推論対応VLAモデルの脆弱性探査
自動運転用の推論機能付き視覚言語行動(VLA)モデルが、現実的な入力摂動に対して脆弱であることを示し、最大89%の推論攻撃成功率と72%の軌道操作成功率を報告した。
原題: ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving / Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit 他
日本語で読む → - 論文VLA/世界モデルロボティクス
GaussianDream: ロボット操作のためのフィードフォワード3Dガウス世界モデル
本論文は、ロボット操作のためのフィードフォワード型3Dガウス世界モデルを提案し、現在の3D空間構造と短期的な未来の進化を捉えることで、行動生成の精度を向上させる。
原題: GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation / Zijian Zhang, Yuqing Jiang, Qian Cheng 他
日本語で読む → - 論文VLA/操作ロボティクス
DreamAvoid: 臨界期テストタイムドリーミングによるVLAポリシーの失敗回避
VLAモデルが微細な操作中に失敗する問題に対し、実行が臨界期に入ったかを検出し、複数の候補行動を評価して最適な行動を選択する「テストタイムドリーミング」フレームワークを提案した。
原題: DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies / Xianzhe Fan, Yuxiang Lu, Shenyuan Gao 他
日本語で読む → - 論文VLA/意思決定ロボティクス
VLA-ATTC: 相対アクション批評モデルによるVLAモデルの適応的テスト時計算
VLAモデルに不確実性に基づく「認知クラッチ」を導入し、複雑な状況でのみ推論フェーズへ切り替える適応的テスト時計算フレームワークを提案。相対比較で最適アクションを選ぶ批評モデルにより、LIBERO-LONGでSOTAの失敗率を50%以上削減した。
原題: VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model / Wenhao Li, Xiu Su, Yichao Cao 他
日本語で読む → - 論文VLAロボティクス
原始サブスペースがVLAの少数ショット転移を仲介する
VLAポリシーを原始動作単位で訓練すると、少数のデモンストレーションで未学習タスクを実行できる転移可能なサブスキルライブラリが獲得され、フラットな軌道訓練と比べて3倍のサンプル効率向上が達成されることを示した。
原題: Primitive Subspaces Mediate Few-Shot Transfer in VLAs / Anya Singh, Cabrel Happi, Jai Relan 他
日本語で読む → - 論文VLA/言語アノテーションロボティクス
ロボットへの指示方法:高密度言語アノテーションがロボットポリシー学習を強化する
デモンストレーションの収集コストを増やさずに、VLMで生成した多面的な高密度言語アノテーションを活用してロボットポリシーの学習を改善する手法を提案した。
原題: How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning / Bosung Kim, Ruiyi Wang, David Acuna 他
日本語で読む → - 論文VLAロボティクス
CKT-WAM: ワールドアクションモデル間のパラメータ効率的な文脈知識転送
異なるワールドアクションモデル間で知識を転送する際、テキスト埋め込み空間のコンパクトな文脈を用いて、軽量なアダプタと圧縮機構で教師モデルの知識を生徒モデルに注入する手法を提案。LIBERO-Plusで1.17%の学習可能パラメータで86.1%の成功率を達成。
原題: CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models / Yuhua Jiang, Yijun Guo, Hongbing Yang 他
日本語で読む → - 論文VLAロボティクス
RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデル
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
原題: RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models / Weijia Liufu, Xiaoyu Guo, Ruiyi Chen 他
日本語で読む → - 論文VLAロボティクス
Agentic-VLA: 視覚言語行動モデルの効率的なオンライン適応
VLAモデルのオンライン適応を効率化するエージェント型トレーニングフレームワークを提案し、報酬合成、言語誘導探索、経験メモリにより、LIBEROベンチマークで大幅な性能向上と高速収束を達成した。
原題: Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models / Ruofan Jin, Zaixi Zhang
日本語で読む → - 論文VLAロボティクス
PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデル
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
原題: PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction / Shizhe Chen, Paul Pacaud, Cordelia Schmid
日本語で読む → - 論文VLA/強化学習/巧緻操作ロボティクス
BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデル
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
原題: BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models / Zhongxi Chen, Yifan Han, Yanming Shao 他
日本語で読む → - 論文VLAロボティクス
AttenA+: ロボット基盤モデルにおける行動の不平等性の是正
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
原題: AttenA+: Rectifying Action Inequality in Robotic Foundation Models / Daojie Peng, Fulong Ma, Jiahang Cao 他
日本語で読む →