Yuqiang Yang
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- X-NavDP: グループQスコア再重み付けマッチングによる新規行動と異種エンボディメントへのナビゲーション拡散ポリシーの一般化ナビゲーション2026/7/1
ナビゲーション拡散ポリシーを強化学習で事後訓練し、多様なロボット形態や困難なシナリオへの一般化を向上させるフレームワークGQRMを提案。シミュレーションと実世界で成功率を大幅に改善した。
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーションナビゲーション2026/3/1
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- LoGoPlanner: メートル法に基づく視覚幾何と自己位置推定を統合したナビゲーション方策ナビゲーション2025/12/1
絶対スケールの視覚幾何バックボーンを微調整し、周囲形状の再構成と暗黙的状態推定を組み合わせることで、外部キャリブレーション不要のエンドツーエンド移動ロボットナビゲーションを実現した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。