論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
EvoScene-VLA: アクションデコーダ内でシーン信念を進化させ、チャンク化ロボット制御を実現
ロボットのアクションによって変化するシーン状態を、チャンク間で持続的に更新するVLAポリシーを提案し、シミュレーションと実機で成功率を向上させた。
原題: EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control / Chushan Zhang, Ruihan Lu, Jinguang Tong 他
日本語で読む → - 論文VLA/推論時計算ロボティクス
ドリフトはサンプリング誤差:長期的ロボット計画のためのSNRを考慮したパワー分布
VLAモデルにおける指示ドリフトをサンプリング誤差として捉え、推論時にパワー分布とSNRに基づく適応的MCMC探索を導入するCAPSを提案し、長期的タスクの成功率を向上させた。
原題: Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning / Kewei Chen, Yayu Long, Mingsheng Shang
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける視野外操作のための空間記憶
視覚言語行動モデルに、可動カメラの多視点観測から構築した空間記憶を組み込み、視野外の物体操作を可能にするフレームワークSOMAを提案した。
原題: Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action / Pengteng Li, Weiyu Guo, He Zhang 他
日本語で読む → - 論文VLAロボティクス
CKT-WAM: ワールドアクションモデル間のパラメータ効率的な文脈知識転送
異なるワールドアクションモデル間で知識を転送する際、テキスト埋め込み空間のコンパクトな文脈を用いて、軽量なアダプタと圧縮機構で教師モデルの知識を生徒モデルに注入する手法を提案。LIBERO-Plusで1.17%の学習可能パラメータで86.1%の成功率を達成。
原題: CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models / Yuhua Jiang, Yijun Guo, Hongbing Yang 他
日本語で読む → - 論文VLA画像認識
TriRelVLA: 汎化可能な身体化操作のための三者関係構造
視覚言語行動モデルの汎化性を高めるため、物体・手・タスクの三者関係を明示的に表現し、関係性に基づいて行動生成を行うフレームワークを提案した。
原題: TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation / Hanyu Zhou, Chuanhao Ma, Gim Hee Lee
日本語で読む → - 論文VLAロボティクス
Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
原題: Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments / Qiuyue Wang, Mingsheng Li, Jian Guan 他
日本語で読む → - 論文VLAロボティクス
ビデオモデルを汎用ロボットポリシーへ変換する
ビデオ生成モデルをそのまま使い、逆動力学モデル(IDM)を個別に学習してビデオ計画を行動に変換する手法を提案。シミュレーションと実世界で高い性能を示した。
原題: Turning Video Models into Generalist Robot Policies / Sizhe Lester Li, Evan Kim, Xingjian Bai 他
日本語で読む → - 論文VLAロボティクス
ジェスチャー対応視覚言語行動モデルGesVLA:埋め込み表現による操作精度の向上
テキスト指示だけでは曖昧な空間指示を解決するため、ジェスチャーを並列指示として取り入れ、潜在空間に直接エンコードする視覚言語行動モデルGesVLAを提案した。実世界のロボット操作タスクで、複雑な環境での目標把握精度と対話効率が向上することを示した。
原題: GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations / Wenxuan Guo, Ziyuan Li, Meng Zhang 他
日本語で読む → - 論文VLAロボティクス
Wall-OSS-0.5 技術報告書
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
原題: Wall-OSS-0.5 Technical Report / Ryan Yu, Pushi Zhang, Starrick Liu 他
日本語で読む → - 論文VLAロボティクス
DyGRO-VLA: 動的グループ化残差最適化による視覚言語行動モデルのクロスタスクスケーリング
視覚言語行動モデルの汎用性を高めるため、情報理論に基づくクロスタスク表現学習と動的残差最適化を組み合わせた二段階最適化フレームワークを提案した。
原題: DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization / Sixu Lin, Yunpeng Qing, Litao Liu 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
PhAIL: 実ロボットVLAベンチマークと分布評価手法
実ロボットでのVLAポリシー評価を、成功率だけでなく成功までの時間分布に基づく手法で行う新しいベンチマークと評価方法を提案した論文。
原題: PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology / Sergey Arkhangelskiy
日本語で読む → - 論文VLA機械学習
BOKBO:VLAポリシーのための較正された棄権層
VLAポリシーの推論時にK個の候補アクションをサンプリングする手法に対し、全てが不安全な場合に実行違反を防ぐための、有限サンプル保証付きの棄権層を提案した。
原題: BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies / Anya Singh, Cabrel Happi, Jai Relan 他
日本語で読む → - 論文VLA/汎化ロボティクス
VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
原題: VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models / Shengyu Si, Yuanzhuo Lu, Ruimeng Yang 他
日本語で読む → - 論文VLAロボティクス
ガイド・思考・行動:視覚言語行動モデルにおける対話型身体化推論
ユーザーが視覚的な手がかりでロボットのポリシーを誘導できる対話型VLAフレームワークを提案し、空間的推論と行動生成を統合してOOD環境での堅牢性を向上させた。
原題: Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models / Yiran Ling, Qing Lian, Jinghang Li 他
日本語で読む → - 論文VLAロボティクス
ProgVLA: 進捗を考慮したロボット操作スキル学習
計算・メモリ制約下で信頼性の高い操作を実現する、タスク進捗の明示表現を持つコンパクトなVLAモデルを提案。長いマルチモーダル系列を効率的に処理し、進捗ヘッドによるRL訓練で長期的タスク成功率を向上させる。
原題: ProgVLA: Progress-Aware Robot Manipulation Skill Learning / Seungsu Kim, Jinyoung Choi, Seungmin Baek 他
日本語で読む → - 論文VLAロボティクス
ピクセルからトークンへ:視覚言語行動モデルにおける潜在行動教師あり学習の体系的研究
視覚言語行動モデル(VLA)の学習における潜在行動の教師あり手法を体系的に比較し、画像ベースと行動ベースの潜在行動がそれぞれ長期的推論と複雑な運動制御に有効であることを示した。
原題: From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models / Yihan Lin, Haoyang Li, Yang Li 他
日本語で読む → - 論文自動運転/VLA/強化学習ロボティクス
MAPLE: 潜在マルチエージェントプレイによるエンドツーエンド自動運転
VLAモデルを閉ループで訓練するため、潜在空間でマルチエージェントのロールアウトを行い、強化学習で安全・進捗・多様性を最適化するフレームワークを提案。外部シミュレータ不要でスケーラブルな閉ループ訓練を実現し、Bench2DriveでSOTAを達成。
原題: MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving / Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng 他
日本語で読む → - 論文VLAロボティクス
多視点潜在事前分布による行動多様体学習を用いたロボット操作
単眼入力の奥行き曖昧性を解決するため、事前学習済み多視点拡散モデルで潜在的な新視点を合成し、3次元幾何学的ガイダンスで多視点特徴を整列するG3Tと、有効な行動多様体上で直接行動を予測するAMLを提案した。
原題: Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation / Junjin Xiao, Dongyang Li, Yandan Yang 他
日本語で読む → - 論文セキュリティ/VLAロボティクス
ATAAT: 視覚-言語-行動モデルに対するバックドア攻撃を防ぐ適応型脅威認識敵対的チューニングフレームワーク
視覚-言語-行動(VLA)モデルの視覚経路へのバックドア攻撃を研究し、従来手法の失敗原因である「勾配干渉」を解決する適応型フレームワークを提案した。
原題: ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models / Kewei Chen, Yayu Long, Shuai Li 他
日本語で読む → - 論文VLAロボティクス
適応を資産へ変える:オンライン視覚言語ナビゲーションのためのクロスドメインブリッジング
非定常な環境変化に直面する視覚言語ナビゲーションエージェントのオンライン適応において、適応を一時的な更新ではなく資産の蓄積と合成として捉える新しいTTAフレームワークIDEAを提案し、忘却や負の転移を防ぎつつ、学習不要の適応を実現する。
原題: Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation / Zixuan Hu, Xuantuo Huang, Yancheng Li 他
日本語で読む → - 論文VLA/ロボット制御ロボティクス
コントラスティブ・コンセプター活性ステアリング(COAST):隠れ状態を通じて視覚言語行動モデルを解放する
VLAモデルの潜在表現を成功部分空間へステアリングする手法COASTを提案し、シミュレーションと実機で成功率を大幅に向上させた。
原題: Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States / Miranda Muqing Miao, Subin Kim, Brandon Yang 他
日本語で読む → - 論文VLA/データ拡張画像認識
シミュレーションからリアリズムを見る:視覚言語行動データ拡張のための効率的なビデオ変換
シミュレーションで生成したVLA学習用ビデオを、タスクの意味と行動軌跡を保ちつつ現実的なビデオに変換する効率的なデータ拡張フレームワークを提案。拡散モデルの特徴再利用とコアセットサンプリングにより計算コストを抑え、実ロボットを含む複数ベンチマークで性能を向上させた。
原題: Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation / Chenyu Hui, Xiaodi Huang, Siyu Xu 他
日本語で読む → - 論文遠隔操作/VLAデータ収集ロボティクス
Phone2Act: スケーラブルなVLAデータ収集のための低コストでハードウェア非依存の遠隔操作システム
スマートフォンをARCoreで6自由度ロボットコントローラに変え、ROS 2ベースのモジュール構成で様々なロボットに対応する低コスト遠隔操作フレームワークを提案。収集データはLeRobot形式で出力され、実機で90%の成功率を達成。
原題: Phone2Act: A Low-Cost, Hardware-Agnostic Teleoperation System for Scalable VLA Data Collection / Om Mandhane, Bipin Yadav, Sangeetha Prasanna Ram 他
日本語で読む → - 論文VLAロボティクス
PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデル
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
原題: PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction / Shizhe Chen, Paul Pacaud, Cordelia Schmid
日本語で読む → - 論文VLA/長期タスクロボティクス
ツール整合型視覚言語行動モデルによる長期的身体エージェントの実現
高レベルのVLMエージェントが計画を、専門化されたVLAツール群が局所操作を分担し、長期的タスクを効率的に実行する枠組みを提案した。
原題: Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models / Zixing Lei, Changxing Liu, Yichen Xiong 他
日本語で読む → - 論文VLA/計画ロボティクス
オンデバイスロボット計画:推論の冗長性を排除した効率的な意思決定
ロボットの推論ワークロードに時間的冗長性があることに着目し、不要な推論を最小化するフレームワークREISを提案。シーンゲーティングとKVステアリングにより推論オーバーヘッドを削減しつつ性能を維持する。
原題: On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making / Joonhee Lee, Hyunseung Shin, Hyunmi Kim 他
日本語で読む → - 論文VLAロボティクス
VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
原題: VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models / Hao Wang, Xiaobao Wei, Jingyang He 他
日本語で読む → - 論文VLAロボティクス
NoiseGate: ワールドアクションモデルにおける情報ゲーティングとしての潜在変数毎タイムステップスケジュール学習
ロボットの行動生成と未来観測の予測を統合するワールドアクションモデルにおいて、各潜在フレームのノイズレベル(タイムステップ)を学習可能な情報ゲートとして扱い、行動生成に寄与する信頼性を動的に調整する手法NoiseGateを提案した。
原題: NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models / Wen Huang, Haoran Sun, Yongjian Guo 他
日本語で読む → - 論文自動運転/VLA/ロバスト性cs.CR
ReasonBreak: 自動運転向け推論対応VLAモデルの脆弱性探査
自動運転用の推論機能付き視覚言語行動(VLA)モデルが、現実的な入力摂動に対して脆弱であることを示し、最大89%の推論攻撃成功率と72%の軌道操作成功率を報告した。
原題: ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving / Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit 他
日本語で読む → - 論文VLAロボティクス
BlockVLA: ブロック拡散ファインチューニングによる自己回帰VLAの高速化
自己回帰型VLAモデルの推論遅延を減らすため、ブロック拡散パラダイムを導入し、ブロック内で並列生成しつつブロック間の因果性を保つことで、推論を高速化する手法を提案した。
原題: BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning / Ruiheng Wang, Shuanghao Bai, Haoran Zhang 他
日本語で読む →