論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚言語行動モデルのための触覚モダリティ融合
視覚言語行動モデルに触覚信号を軽量に統合するTacFiLMを提案し、接触を伴う挿入・引き出しタスクで成功率や力の安定性を改善した。
原題: Tactile Modality Fusion for Vision-Language-Action Models / Charlotte Morissette, Amin Abyaneh, Wei-Di Chang 他
日本語で読む → - 論文VLAロボティクス
HapticVLA: 推論時触覚センシング不要のVision-Language-Actionモデルによる接触リッチマニピュレーション
触覚をオフラインで学習し、推論時には触覚センサなしで接触を伴う器用な操作を実現するVLAモデルを提案。実世界実験で86.7%の成功率を達成。
原題: HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing / Konstantin Gubernatorov, Mikhail Sannikov, Ilya Mikhalchuk 他
日本語で読む → - 論文VLA/長期的タスクロボティクス
RoboClaw: 長期的ロボットタスクのためのスケーラブルなエージェント型フレームワーク
RoboClawは、データ収集・ポリシー学習・タスク実行を単一のVLM駆動コントローラで統合し、自己リセット機構により人間の介入を最小限に抑えつつ長期的タスクを自律的に実行するロボットフレームワークを提案する。
原題: RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks / Ruiying Li, Yunlang Zhou, YuYao Zhu 他
日本語で読む → - 論文VLAロボティクス
自律ドローンレース向けの堅牢な密結合フィルタ型単眼視覚慣性状態推定とグラフベース評価
ゲート角の画素再投影誤差をESKFに直接組み込むことで、少ない特徴点でも動作するドローンレース向け状態推定手法を提案し、GNSSのない環境での評価用に因子グラフ最適化フレームワークも導入した。
原題: Robust Tightly-Coupled Filter-Based Monocular Visual-Inertial State Estimation and Graph-Based Evaluation for Autonomous Drone Racing / Maulana Bisyir Azhari, Donghun Han, Sung Jun Park 他
日本語で読む → - 論文VLAロボティクス
AnyCamVLA: 視点ロバストな視覚言語行動モデルのためのゼロショットカメラ適応
カメラ視点の変化に弱いVLAモデルに対し、追加データや微調整なしで、テスト時の観測を訓練時のカメラ設定に合わせて仮想的に変換するゼロショット適応フレームワークを提案した。
原題: AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models / Hyeongjun Heo, Seungyeon Woo, Sang Min Kim 他
日本語で読む → - 論文VLA/データ生成ロボティクス
Seed2Scale: 小規模・大規模モデルの協調とマルチモーダル評価による身体化AIの自己進化型データエンジン
少数のシードデモから始め、小型モデルでデータ収集し大型モデルで評価する自己進化型データエンジンを提案し、データ不足とモデル崩壊を克服して成功率を大幅に向上させた。
原題: Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation / Cong Tai, Zhaoyu Zheng, Haixu Long 他
日本語で読む → - 論文VLAロボティクス
MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリ
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
原題: MEM: Multi-Scale Embodied Memory for Vision Language Action Models / Marcel Torne, Karl Pertsch, Homer Walke 他
日本語で読む → - 論文自動運転/VLA画像認識
DynVLA: 自動運転における行動推論のための世界ダイナミクス学習
自動運転向けVLAモデルDynVLAを提案し、行動生成前に世界のダイナミクスを予測する新しいCoTパラダイムを導入した。
原題: DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving / Shuyao Shang, Bing Zhan, Yunfei Yan 他
日本語で読む → - 論文器用操作/VLAロボティクス
UniHM: 視覚言語モデルによる統合器用手操作
自由形式の言語指示に基づいて物理的に実現可能な器用な手の操作を生成する統合フレームワークを提案。異なる手の形態を共通コードブックにマッピングし、人間の物体操作データのみで学習することで、実世界の遠隔操作データなしに汎用性の高い操作シーケンスを生成する。
原題: UniHM: Unified Dexterous Hand Manipulation with Vision Language Model / Zhenhao Zhang, Jiaxin Liu, Ye Shi 他
日本語で読む → - 論文VLAロボティクス
ロボットポリシー学習における視点汎化のための効率的なカメラポーズ拡張
3Dガウススプラッティングを用いて、少数の非校正画像から高品質な3Dシーンを再構成し、多様な合成視点を生成することで、視覚運動ポリシーの未知視点への汎化性能を向上させる手法を提案した。
原題: Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning / Sen Wang, Huaiyi Dong, Jingyi Tian 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
DepthCache: 深度ガイドによる学習不要の視覚トークン統合でVLAモデル推論を高速化
VLAモデルの推論遅延を減らすため、深度情報を構造的先行知識として使い、視覚トークンを領域ごとに異なる比率で統合する学習不要のフレームワークを提案。LIBEROベンチマークで最大1.28倍の高速化を達成し、成功率の低下は1%未満に抑えた。
原題: DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference / Yuquan Li, Lianjie Ma, Han Ding 他
日本語で読む → - 論文VLAロボティクス
KineVLA: 運動学を考慮した視覚言語行動モデルと二段階行動分解
言語指示に運動学的属性(方向、軌道、姿勢、相対変位など)を細かく組み込んだ新しいVLAタスクを提案し、目標の不変性と運動学的可変性を分離する二段階行動表現と推論トークンを持つKineVLAフレームワークを導入した。シミュレーションと実機で精度・制御性・汎化性が向上することを示した。
原題: KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition / Gaoge Han, Zhengqing Gao, Ziwen Li 他
日本語で読む → - 論文自動運転/VLAロボティクス
Uni-World VLA: 自動運転のための世界モデリングと計画の交互実行
自動運転向けに、将来フレーム予測と軌道計画を交互に行う統合VLAモデルを提案し、閉ループな意思決定を実現した。
原題: Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving / Qiqi Liu, Huan Xu, Jingyu Li 他
日本語で読む → - 論文VLAロボティクス
意味と計測:視覚言語ナビゲーションのためのマルチエージェント確率的グラウンディング
ロボットが自然言語の指示を3D空間内の物理的な行動に変換する際、VLMは意味理解は強いが距離などの計量的制約の推論が弱い問題を指摘し、言語クエリを分解して各要素をVLMでグラウンディングし確率的に統合するMAPGフレームワークを提案した。
原題: Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation / Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah 他
日本語で読む → - 論文VLAロボティクス
DyGeoVLN: 動的幾何基盤モデルを視覚言語ナビゲーションに統合する
静的シーンを仮定した従来手法の限界を克服するため、動的幾何基盤モデルをVLNフレームワークに統合し、3D空間表現と視覚意味推論を強化。さらに、冗長なトークンを削減する適応的解像度トークンプルーニング戦略を導入し、長期的な動的ナビゲーションの推論コストを削減する。
原題: DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation / Xiangchen Liu, Hanghan Zheng, Jeil Jeong 他
日本語で読む → - 論文VLA画像認識
世界の連鎖:潜在運動における世界モデル思考
視覚言語行動モデルに、潜在運動表現を用いた世界モデルの時間的推論を統合し、効率的なロボット学習を実現する新しいパラダイムを提案した。
原題: Chain of World: World Model Thinking in Latent Motion / Fuxiang Yang, Donglin Di, Lulu Tang 他
日本語で読む → - 論文VLAロボティクス
LILAC: 言語条件付きオブジェクト中心オプティカルフローによるオープンループ軌道生成
人間やWeb動画から学習可能なフローベースの軌道生成を用いて、言語指示に従った物体操作を実現する手法を提案。指示とフローを整合させる損失関数とクロスモーダルアダプタを導入し、既存手法より高品質なフロー生成と高いタスク成功率を達成した。
原題: LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation / Motonari Kambara, Koki Seno, Tomoya Kaichi 他
日本語で読む → - 論文VLAロボティクス
HiFlow: トークン化不要のスケール単位自己回帰ポリシー学習をフローマッチングで実現
ロボットの行動は低次元連続ベクトルであるため、離散トークン化を不要とし、時間プーリングで多スケールの連続行動目標を構築する自己回帰ポリシーHiFlowを提案。単一ステージでエンドツーエンドに学習し、既存手法を上回る性能を示した。
原題: HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching / Daichi Yashima, Koki Seno, Shuhei Kurita 他
日本語で読む → - 論文VLA機械学習
事前学習済みVLAモデルは継続学習において驚くほど忘却しにくい
大規模な視覚-言語-行動モデルは、小さなリプレイバッファでも継続学習時にほとんど忘却せず、事前学習が忘却耐性に大きく寄与することを示した研究。
原題: Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning / Huihan Liu, Changyeon Kim, Bo Liu 他
日本語で読む → - 論文VLAロボティクス
一段階フローポリシー:高速視覚運動ポリシーのための自己蒸留
生成フローモデルや拡散モデルの反復サンプリングによる推論遅延を解消するため、事前学習済み教師なしの自己蒸留フレームワークを提案し、一段階で高精度な行動生成を実現した。
原題: One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies / Shaolong Li, Lichao Sun, Yongchao Chen
日本語で読む → - 論文VLA/解釈可能性ロボティクス
視覚-言語-行動モデルにおける特徴の観測と制御
VLAモデルの内部表現を線形分類器で観測し、最適制御に基づく軽量な介入で出力を望む方向に操る手法を提案。微調整なしでロボットの行動をリアルタイムに調整できることを示した。
原題: Observing and Controlling Features in Vision-Language-Action Models / Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルのための実用的な世界モデルベース強化学習に向けて
VLAモデルの強化学習を実世界ではなく世界モデル内で行う枠組みVLA-MBPOを提案し、マルチビュー整合性と誤差蓄積を抑える設計で性能とサンプル効率を改善した。
原題: Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models / Zhilong Zhang, Haoxiang Ren, Yihao Sun 他
日本語で読む → - 論文VLAロボティクス
VTAM:視覚と言語を超え、触覚を統合したビデオ・触覚・行動モデル
映像から行動を予測するVAMに触覚を追加し、接触の多い繊細な操作を安定化させるマルチモーダル世界モデルを提案。ポテトチップスの把持などで大幅な性能向上を実現。
原題: VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs / Haoran Yuan, Weigang Yi, Zhenyu Zhang 他
日本語で読む → - 論文VLAロボティクス
AnoleVLA: 深い状態空間モデルを用いたモバイル操作のための軽量視覚言語行動モデル
言語指示に基づくロボット操作のための軽量な視覚言語行動モデルを提案し、深い状態空間モデルを用いて効率的に動作させ、実機で高い成功率と高速な推論を達成した。
原題: AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation / Yusuke Takagi, Motonari Kambara, Daichi Yashima 他
日本語で読む → - 論文VLAロボティクス
ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデル
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。
原題: ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries / Hang Li, Fengyi Shen, Dong Chen 他
日本語で読む → - 論文VLA/強化学習ロボティクス
SmoothVLA: 内在的滑らかさ最適化による物理的制約へのVLAモデル整合
ロボット操作のためのVLAモデルに対し、軌道の滑らかさを内在報酬として組み込んだ強化学習フレームワークを提案し、タスク性能と物理的実現性を両立させた。
原題: SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization / Jiashun Li, Xiaoyu Shi, Hong Xie 他
日本語で読む → - 論文VLA画像認識
アクション草案と検証:視覚言語行動モデルのための自己検証フレームワーク
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。
原題: Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model / Chen Zhao, Zhuoran Wang, Haoyang Li 他
日本語で読む → - 論文ロボット学習/VLA画像認識
S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデル
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
原題: S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight / Haodong Yan, Zhide Zhong, Jiaguan Zhu 他
日本語で読む → - 論文VLA/ロバスト性/メモリロボティクス
RoboHarness:メモリ拡張型ポリシーハーネスによる視覚言語行動モデルの文脈内適応ロバスト性向上
凍結したVLAモデルを微調整なしでロバスト化するため、デュアルメモリRAGとマルチモーダルLLMによる帰属駆動オーケストレータ、MCP介入を備えたオンラインパイプラインと、オフラインのメモリ統合を提案し、平均成功率を56.6%向上させた。
原題: RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation / Zhuoran Li, Zhiyang Li, Kaijun Zhou 他
日本語で読む → - 論文VLAロボティクス
FutureVLA: 視覚言語行動モデルのための統合視覚運動予測
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
原題: FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model / Xiaoxu Xu, Hao Li, Jinhui Ye 他
日本語で読む →