論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文社会的ナビゲーション/VLAロボティクス
見たものに基づいて行動する:視覚言語行動モデルにおける安全な社会的ナビゲーションの実現
事前学習済みの視覚言語行動(VLA)モデルが歩行者と障害物の区別や衝突予測信号を内部表現に持つことを利用し、注釈不要の2段階ポストトレーニング手法SALSAを提案。反事実的なシーンと将来リスクの教師信号で行動生成と潜在表現を整合させ、近接衝突を86.4%削減した。
原題: Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models / Qingzi Wang, Xiyang Wu, Guangyao Shi 他
日本語で読む → - 論文VLAロボティクス
MIRTH: 相互情報推論と時間的ハブによる視覚-言語-行動エージェント
VLAモデルの時間的視野狭窄や推論ギャップ、推論効率の問題を解決するため、二重スケールの時間メモリハブ、相互情報目的の潜在推論トークン、並列行動デコードを導入した統一フレームワークMIRTHを提案。LIBEROベンチマークと実機でSOTAを達成。
原題: MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents / Hao Sun, Yu Song, Shiyu Teng 他
日本語で読む → - 論文VLA/ロボットアーム/オープンソースロボティクス
OpenEAI-Platform: オープンソースの具現化人工知能ハードウェア・ソフトウェア統合プラットフォーム
低コストの6+1自由度ロボットアームと再現可能なVLAモデルを統合した完全オープンソースのプラットフォームを提案し、実世界の操作タスクで商用アームや大規模事前学習モデルと同等以上の性能を示した。
原題: OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform / Jinyuan Zhang, Luoyi Fan, Leiyu Wang 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
原題: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation / Fengnian Zhang, Tao Huang, Siyu Xu 他
日本語で読む → - 論文VLA/エッジ展開ロボティクス
RhinoVLA技術報告:エッジSoC向け展開最適化VLAモデル
エッジSoC上でのリアルタイム展開を目指し、トークン効率的なVLAモデルと専用SoCを共同設計し、10Hzの実時間制御を達成した。
原題: RhinoVLA Technical Report / Huixi Technology, :, Chen Zhang 他
日本語で読む → - 論文VLA/強化学習/折りたたみロボティクス
折りたたみ学習:LeHomeチャレンジ2026優勝ソリューション(オンライン1位、オフライン2位)
両腕ロボットによる衣類折りたたみ競技会で、VLAポリシーに強化学習ループを組み合わせ、オンライン1位・実機2位を獲得したシステムを提案。
原題: Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline) / Ilia Larchenko
日本語で読む → - 論文VLA/安全性評価ロボティクス
SafeVLA-Bench: 視覚言語行動モデルにおける成功と安全性のギャップを評価するベンチマーク
既存のVLAベンチマークの成功判定では見逃される、過度な接触や周囲の物体の妨害などの安全違反を検出するための、事後評価フレームワークを提案した。
原題: SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models / Jialiang Fan, Weizhe Xu, Oleg Sokolsky 他
日本語で読む → - 論文VLA画像認識
WAM4D: 空間レジスタトークンによる高速4Dワールドアクションモデル
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
原題: WAM4D: Fast 4D World Action Model via Spatial Register Tokens / Ying Li, Xiaobao Wei, Jiajun Cao 他
日本語で読む → - 論文VLAロボティクス
ロボット制御のための文脈内世界モデリング
ロボットポリシーが短い自己生成インタラクション履歴からシステム変数を推論し、新しいカメラ視点やロボット形態にパラメータ更新なしで適応するフレームワークを提案した。
原題: In-Context World Modeling for Robotic Control / Siyin Wang, Junhao Shi, Senyu Fei 他
日本語で読む → - 論文VLAロボティクス
ReSiReg: 言語条件付きロボットタスクにおける空間的に一貫したセマンティクスの実現
視覚言語モデルの埋め込みはノイズが多く空間的に一貫性がない問題を解決するため、空間的に一貫した中間表現を用いて特徴を再構成する手法ReSiRegを提案した。
原題: ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks / Simon Schwaiger, David Seyser, Alessandro Scherl 他
日本語で読む → - 論文VLA/継続学習ロボティクス
RECALL: 視覚言語行動モデルにおける能動的生涯学習のための回復経験収集
この論文は、視覚言語行動モデルを能動的かつ継続的に学習させる手法を提案し、不確実性に基づくデータ収集が受動的な模倣学習よりも効率的であることを示す一方、回復データのみでの微調整が破滅的忘却を引き起こすことを明らかにし、継続学習技術の評価を行っています。
原題: RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models / Ulas Berk Karli, Tesca Fitzgerald
日本語で読む → - 論文VLA/手話認識/ロボット操作AI
SignVLA: 注意機構付きLSTMと視覚-言語-行動モデルによるリアルタイム手話ガイド型ロボット操作
手話をリアルタイムで認識し、ロボット操作の指示に変換するVLAフレームワークを提案。聴覚障害者などへのアクセシビリティ向上を目指す。
原題: SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models / Ningwei Bai, Xinyu Tan, Harry Gardner 他
日本語で読む → - 論文VLAロボティクス
MemoryVAM: ロボット操作のためのビデオ行動モデルへの記憶統合
ビデオワールドモデルポリシーにエピソード記憶機構を導入し、長期的な操作タスクで過去の情報を活用できるようにした。LIBERO-Memで成功率を5%から42.5%に向上させた。
原題: MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation / Yuxin Jiang, Chang Yu, Yunuo Chen 他
日本語で読む → - 論文VLAロボティクス
Vesta: 汎用身体化推論モデル
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
原題: Vesta: A Generalist Embodied Reasoning Model / Johan Bjorck, Zhiqi Li, Yunze Man 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける宣言的知識と手続き的知識の分離
ロボットの模倣学習において、物体の概念(宣言的知識)と操作方法(手続き的知識)を分離できないことが汎化の妨げとなっている。本論文では、情報の流れを再構成した新しいVLAモデルw²VLAを提案し、モジュール化により知識を分離してゼロショット転移を可能にする。
原題: Decoupling the Declarative from the Procedural in Vision-Language-Action Models / Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu 他
日本語で読む → - 論文VLA/シミュレーションロボティクス
生き残るものを監視せよ:合成ロボット動画からの幾何学誘導VLA適応
合成ロボット動画から幾何学情報(2Dエンドエフェクタ経路点)を抽出し、VLAモデルの視覚バックボーンを補助タスクで調整する手法を提案。制御は実デモのみで学習し、幾何学情報で表現の崩壊を防ぐ。
原題: Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos / Danze Chen, Yanzhe Chen, Qiming Huang 他
日本語で読む → - 論文VLAロボティクス
HoloAgent-0: 3D空間メモリを備えた統合具現化エージェントフレームワーク
言語指示を実行可能なスキルグラフに変換し、3D空間メモリとロボットスキルを統合して実ロボットで閉ループ実行を実現する統一エージェントフレームワークを提案した。
原題: HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory / Xiaolin Zhou, Liu Liu, Tingyang Xiao 他
日本語で読む → - 論文VLA画像認識
ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
原題: ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? / Yuyang Zhang, Wenyao Zhang, Zekun Qi 他
日本語で読む → - 論文VLA/意思決定ロボティクス
RouterVLA: 成長するVLAプールのための予算配分と専門家オンボーディング
ロボットチームが複数の視覚言語行動ポリシーを持つ際に、新しい条件に対してどの専門家を配置し、どの候補をプールに追加するかを決定する手法を提案した。
原題: RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools / Xingyu Ren, Chugang Yi, Youran Sun
日本語で読む → - 論文VLAロボティクス
自己回帰ポリシーによるリアルタイム実行
自己回帰型の視覚言語行動モデルをリアルタイムで実行する手法を提案し、トークン化の調整と制約付きデコードにより遅延を保証して性能を向上させることを示した。
原題: Real-Time Execution with Autoregressive Policies / Sangkyu Lee, Seohyeon Park, Tackgeun You 他
日本語で読む → - 論文VLAロボティクス
SeeTraceAct: クロス身体性デモ動画からの可視性を考慮した潜在プランニング
デモ動画1本で未知タスクを実行するVLAモデルを提案し、小さな対象領域の正確な位置決めを可能にする可視性を考慮した未来のエンドエフェクタ軌跡予測を導入。新ベンチマークと実機で性能を実証した。
原題: SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos / Jaehyeon Son, Junhyun Kim, Kyle Kam 他
日本語で読む → - 論文VLA/世界モデルロボティクス
τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデル
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
原題: $\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation / Pengfei Zhou, Shengcong Chen, Di Chen 他
日本語で読む → - 論文VLAロボティクス
平坦性が視覚言語行動モデルの指示追従を維持する
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
原題: Flatness Preserves Instruction Following in Vision-Language-Action Models / Haochen Zhang, Yonatan Bisk
日本語で読む → - 論文VLA/強化学習ロボティクス
本能を信じよ:視覚言語行動モデルのための信頼度駆動型テスト時強化学習
視覚言語行動モデル(VLA)が内部の評価能力を持ち、高信頼度の軌道が成功しやすいことを利用し、外部報酬なしで自己改善するテスト時強化学習フレームワークT^2VLAを提案した。
原題: Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models / Siyao Chen, Jiakang Yuan, Jiaxin Wang 他
日本語で読む → - 論文VLA/ロバスト性ロボティクス
関節レベルの物理的故障下における視覚言語行動モデルの脆弱性の解明
実ロボットにVLAモデルを展開する際、関節の物理的故障(摩擦増加など)が性能を著しく低下させることを示し、故障を推定して補正する軽量な残差校正フレームワークJ-PARCを提案した。
原題: Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults / Minsoo Jo, Taeju Kwon, Junha Chun 他
日本語で読む → - 論文VLAロボティクス
OneVLA: 身体性タスクのための統一フレームワーク
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
原題: OneVLA: A Unified Framework for Embodied Tasks / Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang 他
日本語で読む → - 論文両腕操作/VLAロボティクス
選択的に見て適応的に動く:両腕ロボット操作のための二重レベル構造分解
両腕ロボット操作において、視覚情報の重要度と腕の協調パターンが状況に応じて変化する問題に対し、視覚ルータと行動MoEによる二重レベルの構造分解を導入したVLAフレームワークを提案し、シミュレーションと実機で性能を向上させた。
原題: See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation / Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim
日本語で読む → - 論文VLA/安全性解析画像認識
自動運転の危険検出における視覚言語モデルのタスク整合安定性解析
CLIPベースの視覚言語モデルについて、画像劣化時の埋め込みドリフトと危険スコアの変動の関係を調べ、劣化の種類によっては埋め込み変化が小さくても危険検出が不安定になることを示した。
原題: Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection / Everett Richards
日本語で読む → - 論文VLA画像認識
動作焦点の潜在アクションによる人間のエゴビデオからのクロスエンボディVLA訓練
ラベルなしの人間のエゴビデオから動作の潜在アクションを抽出し、ロボットのVLAモデルを訓練する手法を提案。シミュレーションと実環境で、わずか50トラジェクトリの適応で大規模データセットで訓練した最先端モデルと同等の性能を達成。
原題: Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos / Runze Xu, Yiluo Zhang, Jian Wang 他
日本語で読む → - 論文VLAロボティクス
異種ロボット学習のための統合運動-行動モデリング
3D物体運動軌跡を共通インターフェースとして用い、視覚運動制御と力学モデリングを統合するモデルを提案。マスク生成目的と対照学習により、多様なデータソースからのマルチタスク事前学習と、複数の推論モードでの適応を実現する。
原題: Unified Motion-Action Modeling for Heterogeneous Robot Learning / Yunhao Cao, Shitong Liu, Chao Feng 他
日本語で読む →