論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリング
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
原題: LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion / Jiangran Lyu, Kai Liu, Xuheng Zhang 他
日本語で読む → - 論文VLAロボティクス
TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーション
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
原題: TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation / Qinwen Xu, Jiaming Liu, Rui Zhou 他
日本語で読む → - 論文VLAロボティクス
SCALE: 視覚言語行動モデルのための自己不確実性に基づく適応的知覚と行動
VLAモデルの推論時に自己不確実性を利用し、追加学習や検証器なしで視覚知覚と行動を同時に調整する単一パスの手法を提案。
原題: SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models / Hyeonbeom Choi, Daechul Ahn, Youhan Lee 他
日本語で読む → - 論文VLAロボティクス
RADAR: 実世界ダイナミクス・空間物理知能・自律評価による視覚言語行動モデルの汎化ベンチマーク
VLAモデルの実世界汎化を評価するため、物理ダイナミクス・空間推論タスク・3D指標による完全自律評価を統合したベンチマークRADARを提案し、既存モデルを監査した。
原題: RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation / Yuhao Chen, Zhihao Zhan, Xiaoxin Lin 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる意味・物理の二重補正を用いた人間-ロボット協調タスクの再計画
VLMの推論に事前の論理検証と事後の視覚検証を組み合わせ、人間の指示に基づく把持姿勢や道具選択を再計画する枠組みを提案し、ヒューマノイドでの実機実験で有効性を検証した。
原題: Replanning Human-Robot Collaborative Tasks with Vision-Language Models via Semantic and Physical Dual-Correction / Taichi Kato, Takuya Kiyokawa, Namiko Saito 他
日本語で読む → - 論文VLAロボティクス
ST-BiBench:双腕身体性タスクにおけるマルチストリーム・マルチモーダル協調のMLLMベンチマーク
双腕ロボットの身体性タスクを対象に、マルチモーダル大規模言語モデルの時空間的なマルチストリーム協調能力を評価する多層ベンチマークST-BiBenchを提案し、30以上のモデルを評価して高次推論と細粒度実行の乖離を明らかにした。
原題: ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs / Xin Wu, Zhixuan Liang, Yue Ma 他
日本語で読む → - 論文VLAAI
対照的世界モデル:身体エージェントパイプラインにおける行動実行可能性学習
大規模言語モデルを対照学習で微調整し、意味的に似ているが物理的に不可能な行動を識別する行動スコアラーを提案。ScienceWorldベンチマークでSFTより高精度を達成。
原題: CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines / Chayan Banerjee
日本語で読む → - 論文VLAロボティクス
操縦可能な視覚-言語-行動ポリシーによる身体性推論と階層制御
サブタスクや動作、ピクセル座標など多様な抽象度の合成コマンドでVLAを訓練し、VLMの知識を低レベル行動に反映させて汎化性能を高める手法を提案。
原題: Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control / William Chen, Jagdeep Singh Bhatia, Catherine Glossop 他
日本語で読む → - 論文VLA画像認識
Any3D-VLA:多様な点群によるVLAのロバスト性向上
シミュレータ・センサ・モデル推定の点群を統合して学習し、2D表現と融合することで、VLAモデルの性能とドメインギャップ耐性を高める手法を提案。
原題: Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds / Xianzhe Fan, Shengliang Deng, Xiaoyang Wu 他
日本語で読む → - 論文VLA画像認識
不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
原題: UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models / Jiabing Yang, Yixiang Chen, Yuan Xu 他
日本語で読む → - 論文VLAロボティクス
固有感覚で考える:VLAポリシーのための状態に基づく視覚トークン選択
固有感覚をVLM語彙のトークンに離散化し、指示と共に視覚パッチを選択する能動的クエリとして使うことで、VLAモデルの精度と推論速度を向上させる手法を提案。
原題: Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies / Fangyuan Wang, Peng Zhou, Jiaming Qi 他
日本語で読む → - 論文VLAセキュリティロボティクス
一度注入すれば生き残る:下流ファインチューニングを耐え抜くVLAモデルへのバックドア攻撃
VLAモデルのファインチューニングで消えにくいモジュールにバックドアを注入し、ユーザー側の追加学習後も攻撃が持続する手法INFUSEを提案した。
原題: Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning / Jianyi Zhou, Yujie Wei, Ruichen Zhen 他
日本語で読む → - 論文VLAロボティクス
適応的視覚トークンキャッシュによるVision-Language-Actionモデルの高速化学習
VLAモデルの推論を、再利用する視覚トークンを動的に選ぶ学習可能なポリシーとして最適化し、精度を保ちながら最大1.76倍の高速化を実現した。
原題: Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching / Yujie Wei, Jiahan Fan, Jiyu Guo 他
日本語で読む → - 論文VLAロボティクス
StemVLA:未来の3D空間幾何学知識と4D履歴表現を備えたオープンソース視覚言語行動モデル
未来の3D空間構造と過去の4D時空間表現を組み合わせて行動予測を行うVLAモデルを提案し、シミュレーションで有効性を示した。
原題: StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation / Jiasong Xiao, Yutao She, Kai Li 他
日本語で読む → - 論文VLAロボティクス
WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータ
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
原題: WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL / Zhennan Jiang, Shangqing Zhou, Yutong Jiang 他
日本語で読む → - 論文VLAロボティクス
LiLo-VLA: 物体中心ポリシー連携による長期的マニピュレーションの構成
物体中心のVLAポリシーをモジュール化して連結し、未学習の長期的マニピュレーション課題にゼロショットで汎化するフレームワークを提案。
原題: LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies / Yue Yang, Shuo Cheng, Yu Fang 他
日本語で読む → - 論文VLAロボティクス
潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
原題: Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models / Shuanghao Bai, Jing Lyu, Wanqi Zhou 他
日本語で読む → - 論文VLA機械学習
DADP: ドメイン適応拡散ポリシー
拡散ポリシーにドメイン表現を組み込み、未知の遷移力学にゼロショット適応する制御手法を提案。
原題: DADP: Domain Adaptive Diffusion Policy / Pengcheng Wang, Qinghang Liu, Haotian Lin 他
日本語で読む → - 論文VLAロボティクス
ActionCodec:優れたアクショントークナイザの設計原則
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
原題: ActionCodec: What Makes for Good Action Tokenizers / Zibin Dong, Yicheng Liu, Shiduo Zhang 他
日本語で読む → - 論文自動運転VLA画像認識
SToRM: マルチモーダルLLMのための教師ありトークン削減による効率的なエンドツーエンド自動運転
自動運転向けマルチモーダルLLMの視覚トークンを教師あり学習で削減し、全トークン使用時と同等の性能を保ちつつ計算効率を高めるフレームワークを提案。
原題: SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving / Seo Hyun Kim, Jin Bok Park, Do Yeon Koo 他
日本語で読む → - 論文VLAロボティクス
PhysMem: 身体性物理推論のためのテスト時メモリのスケーリング
VLMロボットプランナがテスト時に経験から物理法則を学び、仮説を検証してから適用するメモリフレームワークを提案。実世界の操作タスクで成功率が大幅に向上。
原題: PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning / Haoyang Li, Yang You, Hao Su 他
日本語で読む → - 論文VLAロボティクス
FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
原題: FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment / Han Zhao, Jingbo Wang, Wenxuan Song 他
日本語で読む → - 論文VLAロボティクス
グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーション
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
原題: Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation / Zaijing Li, Bing Hu, Rui Shao 他
日本語で読む → - 論文VLAロボティクス
FAVLA:接触の多いロボットマニピュレーションのための力適応型高速・低速VLAモデル
低速なVLMによる計画と高速なアクションエキスパートを分離し、力覚フィードバックを適応的に活用することで、接触の多いマニピュレーションの反応性と成功率を向上させるVLAモデルを提案。
原題: FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation / Yao Li, Peiyuan Tang, Wuyang Zhang 他
日本語で読む → - 論文VLAロボティクス
Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースライン
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
原題: Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline / Wenxuan Song, Jiayi Chen, Xiaoquan Sun 他
日本語で読む → - 論文VLAロボティクス
KEEP: 具現化プランニングのためのKVキャッシュ中心メモリ管理システム
LLMによる長期的な具現化プランニングで、メモリをKVキャッシュとして効率的に管理し、再計算を抑えつつ高速化と精度維持を両立するシステムKEEPを提案。
原題: KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning / Zebin Yang, Tong Xie, Baotong Lu 他
日本語で読む → - 論文VLAロボティクス
より遠く、より賢く見る:VLM政策最適化のための価値誘導マルチパス反射
VLMを用いたロボット操作において、状態評価と行動生成を分離し、ビーム探索で複数の将来経路を探索するテスト時計算フレームワークを提案。信頼度に基づく早期終了で推論遅延を削減し、多段階操作タスクでの性能を向上させた。
原題: Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization / Yanting Yang, Shenyuan Gao, Qingwen Bu 他
日本語で読む → - 論文VLAロボティクス
IG-RFT:長期的ロボット操作におけるVLAモデルのための対話誘導強化学習フレームワーク
流れベースのVLAモデルを対象に、対話状態に応じて探索を調整する強化学習とハイブリッド報酬を組み合わせ、長期タスクでの成功率を大幅に向上させた。
原題: IG-RFT: An Interaction-Guided RL Framework for VLA Models in Long-Horizon Robotic Manipulation / Zhian Su, Weijie Kong, Haonan Dong 他
日本語で読む → - 論文VLAロボティクス
アクションチャンキングフローポリシーのためのネイティブ継続学習
フローベースVLAポリシーのアクションチャンク境界の不連続を訓練時に滑らかにするLegatoを提案し、実機マニピュレーションでRTCを上回る性能を示した。
原題: Learning Native Continuation for Action Chunking Flow Policies / Yufeng Liu, Hang Yu, Juntu Zhao 他
日本語で読む → - 論文自動運転VLAロボティクス
AppleVLM:高度な知覚と計画を強化した視覚言語モデルによるエンドツーエンド自動運転
多視点時系列画像を融合する視覚エンコーダと、Bird's-Eye-View情報を符号化する計画モダリティを導入し、階層的Chain-of-Thoughtで微調整したVLMにより、エンドツーエンド自動運転の知覚・意思決定を強化した。
原題: AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models / Yuxuan Han, Kunyuan Wu, Qianyi Shao 他
日本語で読む →