論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
GR-Dexter 技術報告書
両手デクスタラスハンドロボットで言語条件付き長期操作を実現するVLAフレームワークを提案し、ハードウェア・データ収集・学習手法を統合した。
原題: GR-Dexter Technical Report / Ruoshi Wen, Guangzeng Chen, Zhongren Cui 他
日本語で読む → - 論文自動運転VLA画像認識
潜在連鎖推論によるエンドツーエンド運転の世界モデリング
運転行動の推論を自然言語ではなく、行動と整合した潜在空間で行うLCDriveを提案し、推論速度・軌道品質・強化学習の効果を向上させた。
原題: Latent Chain-of-Thought World Modeling for End-to-End Driving / Shuhan Tan, Kashyap Chitta, Yuxiao Chen 他
日本語で読む → - 論文VLAロボティクス
ISS Policy:暗黙的なシーン監督を備えたスケーラブルな拡散ポリシー
点群入力から連続行動を予測する3D視覚運動拡散ポリシーに、シーンの幾何学的変化と整合する出力を促す暗黙的シーン監督モジュールを導入し、単腕・多指ハンド操作の性能と汎化を向上させた研究。
原題: ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision / Wenlong Xia, Jinhao Zhang, Ce Zhang 他
日本語で読む → - 論文VLA画像認識
ロボットマニピュレーションのための説明可能な敵対的ロバスト視覚-言語-行動モデル
スマート農業向けに、光量・色相・ノイズなどの敵対的摂動を検出し自然言語で説明するEvidence-3モジュールをOpenVLA-OFTに統合し、行動予測精度と説明性を向上させた研究。
原題: Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation / Ju-Young Kim, Ji-Hong Park, Myeongjun Kim 他
日本語で読む → - 論文VLAロボティクス
NL2SpaTiaL: マニピュレーションタスク向け自然言語からの幾何時空間論理仕様生成
自然言語から時空間論理仕様を階層的論理木として生成するフレームワークを提案し、マニピュレーションタスクの検証を可能にした。
原題: NL2SpaTiaL: Generating Geometric Spatio-Temporal Logic Specifications from Natural Language for Manipulation Tasks / Licheng Luo, Kaier Liang, Yu Xia 他
日本語で読む → - 論文VLAロボティクス
NavForesee:階層的計画と二重時間軸ナビゲーション予測のための統合視覚言語ワールドモデル
単一の視覚言語モデルで、言語指示の分解・進捗追跡による高レベル計画と、短期環境変化・長期マイルストーンの予測を同時に行い、屋内ナビゲーション性能を向上させた研究。
原題: NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction / Fei Liu, Shichao Xie, Minghua Luo 他
日本語で読む → - 論文VLAロボティクス
遅延対応拡散ポリシー:動的タスクにおける観測と実行のギャップを埋める
推論遅延をポリシー学習に明示的に組み込み、遅延補償された軌道と遅延条件付けで動的タスクの成功率を向上させるフレームワークを提案。
原題: Delay-Aware Diffusion Policy: Bridging the Observation-Execution Gap in Dynamic Tasks / Aileen Liao, Dong-Ki Kim, Max Olan Smith 他
日本語で読む → - 論文VLA画像認識
指し示す場所を意図せよ:視覚的根拠に基づく指示ポリシー
言語指示にバウンディングボックスなどの視覚的手がかりを追加することで、混雑環境や未知物体でも対象を正確に特定できるVLAポリシー「Point-VLA」を提案し、自動データ注釈パイプラインで効率的に学習した。
原題: Point What You Mean: Visually Grounded Instruction Policy / Hang Yu, Juntu Zhao, Yufeng Liu 他
日本語で読む → - 論文VLAロボティクス
STARE-VLA:視覚言語行動モデルの微調整のための段階的ステージ認識強化学習
長期的な行動軌跡を意味のある段階に分解し、段階ごとに密な強化学習信号を与えることで、VLAモデルの微調整を安定化・高精度化する手法を提案。
原題: STARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action Models / Feng Xu, Guangyao Zhai, Xin Kong 他
日本語で読む → - 論文VLAAI
行動なし動画からスキルを学ぶ
オプティカルフローを中間表現として用い、行動なし動画から潜在スキルを抽出し、ロボットの長期タスク計画と行動生成を可能にするフレームワークSOFを提案。
原題: Learning Skills from Action-Free Videos / Hung-Chieh Fang, Kuo-Han Hung, Chu-Rong Chen 他
日本語で読む → - 論文VLAロボティクス
PhysBrain:自己中心視点データで視覚言語モデルを身体知能へ橋渡し
人間の自己中心視点動画をスキーマ駆動で身体化監督に変換するパイプラインを提案し、大規模データセットE2E-3Mで訓練した身体化脳PhysBrainがロボット制御のサンプル効率と成功率を向上させることを示した。
原題: PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence / Xiaopeng Lin, Shijie Lian, Bin Yu 他
日本語で読む → - 論文VLAロボティクス
CLASH: 連続的視覚言語ナビゲーションのための大規模・小規模協調階層フレームワーク
視覚言語ナビゲーションにおいて、小規模モデルと大規模モデルを不確実性に基づき協調させ、シミュレーションと実環境で最先端性能を達成した。
原題: CLASH: Collaborative Large-Small Hierarchical Framework for Continuous Vision-and-Language Navigation / Liuyi Wang, Zongtao He, Jinlong Li 他
日本語で読む → - 論文VLAロボティクス
Token Expand-Merge: VLAモデルのための学習不要トークン圧縮
VLAモデルの推論を高速化するため、追加トークンの動的展開と行動認識に基づく統合を組み合わせた学習不要のトークン圧縮手法TEAM-VLAを提案し、LIBEROで成功率を維持しつつ速度を改善した。
原題: Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models / Yifan Ye, Jiaqi Ma, Jun Cen 他
日本語で読む → - 論文VLAロボティクス
ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデル
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
原題: Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation / Meng Wei, Chenyang Wan, Jiaqi Peng 他
日本語で読む → - 論文VLAロボティクス
視覚と言語によるナビゲーションを通じた人間とロボットの協調の改善に関する調査
視覚と言語によるナビゲーション(VLN)の最近の進歩を約200件の文献レビューで概観し、マルチロボット協調や人間とロボットの相互作用を改善するための研究方向を提案した調査論文。
原題: A Survey on Improving Human Robot Collaboration through Vision-and-Language Navigation / Nivedan Yakolli, Avinash Gautam, Abhijit Das 他
日本語で読む → - 論文VLAロボティクス
暗黙的ニューラルフィードバックによる人間整合型ロボット制御の強化学習
脳波の誤り関連電位を非侵襲的に計測し、事前学習済みデコーダで報酬に変換することで、明示的なフィードバックなしにロボットアームの複雑なピックアンドプレースを強化学習する手法を提案した。
原題: Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control / Suzie Kim
日本語で読む → - 論文VLAロボティクス
EfficientFlow: 身体性AIのための効率的な同変フローポリシー学習
フローマッチングに同変性を導入してデータ効率を高め、加速度正則化で推論を高速化する身体性AI向けポリシー学習フレームワークを提案。
原題: EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI / Jianlei Chang, Ruofeng Mei, Wei Ke 他
日本語で読む → - 論文VLAロボティクス
BLURR: 視覚言語行動モデルのための低リソース推論ブースト
再学習なしで既存のVLAコントローラに組み込める軽量推論ラッパーBLURRを提案し、KVキャッシュや混合精度、単一ステップロールアウトで計算量と遅延を削減した。
原題: BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models / Xiaoyu Ma, Zhengqing Yuan, Zheyuan Zhang 他
日本語で読む → - 論文VLA画像認識
PosA-VLA: 姿勢条件付きアンカー注意による行動生成の強化
VLAモデルの視覚注意を姿勢情報で誘導し、タスクに関連する領域に集中させることで、冗長な動きを抑え精密で効率的な行動生成を実現した研究。
原題: PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention / Ziwen Li, Xin Wang, Hanlue Zhang 他
日本語で読む → - 論文VLAロボティクス
MiVLA: 人間とロボットの相互模倣事前学習による汎化可能な視覚-言語-行動モデル
人間の手とロボットアームの動作類似性を利用し、人間とロボットの行動空間を双方向に整列させる相互模倣事前学習でVLAを訓練し、汎化性能を向上させた研究。
原題: MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training / Zhenhan Yin, Xuanhan Wang, Jiahao Jiang 他
日本語で読む → - 論文VLAロボティクス
CERNet:クラス埋め込み予測符号化RNNによるロボット運動・認識・信頼度推定の統合
クラス埋め込みベクトルを持つ階層的予測符号化RNNで、運動生成とリアルタイム認識、信頼度推定を統合したモデルを提案し、ヒューマノイドロボットで有効性を示した。
原題: CERNet: Class-Embedding Predictive-Coding RNN for Unified Robot Motion, Recognition, and Confidence Estimation / Hiroki Sawada, Alexandre Pitti, Mathias Quoy
日本語で読む → - 論文VLAロボティクス
Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシー
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
原題: Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling / Yueru Jia, Jiaming Liu, Shengbang Liu 他
日本語で読む → - 論文VLAロボティクス
VLAモデルをアンチ探索として誘導:テスト時スケーリングによる安定化
VLAモデルの推論時不安定性を、軽量な疑似カウント推定器で行動チャンクを検証し、最も確からしいものを選ぶテスト時スケーリング手法TACOで解決する。
原題: Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach / Siyuan Yang, Yang Zhang, Haoran He 他
日本語で読む → - 論文VLAロボティクス
私のカップを持ってきて!視覚的注意プロンプティングによる視覚言語行動モデルの個人化
参照画像を視覚メモリとして使い、凍結したVLAモデルにトップダウン注意を注入する学習不要のVAPを提案し、個人所有物の操作を可能にした。
原題: Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting / Sangoh Lee, Sangwoo Mo, Wook-Shin Han
日本語で読む → - 論文VLA画像認識
MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデル
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。
原題: MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning / Haoyu Fu, Diankun Zhang, Zongchuang Zhao 他
日本語で読む → - 論文VLA画像認識
赤外線産業センシングのための視覚言語モデル:積層造形シーン記述への応用
赤外線カメラ画像をRGB互換入力に変換し、CLIPベースの視覚言語モデルを再学習なしで適応させるゼロショット枠組みVLM-IRISを提案し、3Dプリンタ上でのワークピース存在検出を実証した。
原題: Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description / Nazanin Mahjourian, Vinh Nguyen
日本語で読む → - 論文VLAロボティクス
mimic-video: VLAを超える汎化可能なロボット制御のためのビデオ行動モデル
大規模動画モデルを事前学習に用い、その潜在表現からフローマッチングでロボットの低レベル行動を生成するVideo-Action Modelを提案。シミュレーションと実機のマニピュレーションでVLAを上回り、サンプル効率10倍・収束速度2倍を達成した。
原題: mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs / Jonas Pai, Liam Achenbach, Victoriano Montesinos 他
日本語で読む → - 論文VLAロボティクス
VLAモデルの信頼性指標としての輸送不一致
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
原題: Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models / Wanpeng Zhang, Ye Wang, Hao Luo 他
日本語で読む → - 論文VLAロボティクス
視覚シンボルによるマニピュレーション失敗の診断・修正・学習
視覚シンボルを用いてロボットマニピュレーションの失敗を診断し、テキストと視覚の両方で修正ガイダンスを提供するフレームワークViFailbackを提案し、大規模データセットとベンチマークを構築した。
原題: Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols / Xianchao Zeng, Xinyu Zhou, Youcheng Li 他
日本語で読む → - 論文VLAロボティクス
パラメータマージによる視覚-言語-行動ロボット方策の頑健なファインチューニング
ファインチューニング時に事前学習済みモデルと重みを補間することで、汎用能力を保ちつつ新しいタスクを頑健に学習する手法を提案した。
原題: Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging / Yajat Yadav, Zhiyuan Zhou, Andrew Wagenmaker 他
日本語で読む →