Wei Zhao
Apple
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- モデルはすでに知っている:教えずに問い方を学ぶ、視覚言語モデルの少数ショット適応のためのソフトプロンプティングVLA2026/9/10
視覚言語モデルの少数ショット物体検出において、バックボーンを凍結したまま少数の連続プロンプトトークンを最適化するソフトプロンプティングを検討し、プロンプト配置と初期化の設計選択を明らかにした。LoRAと同等精度を2万倍少ないパラメータで達成し、破滅的忘却も回避できることを示した。
- ループ型ワールドモデルワールドモデル2026/6/16
パラメータ共有のトランスフォーマーブロックを反復適用して潜在状態を精緻化する、初のループ型ワールドモデルを提案。従来比100倍のパラメータ効率と適応的計算量を実現し、反復的な潜在深度を新たなスケーリング軸として確立した。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- 一般物体に対するロバストな微分可能衝突検出マニピュレーション2025/11/1
凸凹物体に対応した微分可能な衝突検出フレームワークを提案し、距離ベースの平滑化と適応サンプリングで勾配計算を安定化、把持合成に応用した。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデルVLA2025/8/1
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
- 改良型粒子群最適化による群ドローンのマルチターゲット軌道最適化群制御2025/7/1
粒子群最適化を改良し、Bスプライン曲線と遺伝的アルゴリズムによるタスク割り当てを組み合わせて、動的環境下で複数ドローンの実時間軌道計画を実現した研究。
- オープンエンドなマルチモーダル指示で視覚-言語-行動モデルの可能性を解き放つVLA2025/5/1
言語だけでなく画像・手書き文字・動画などの多様な指示を入力できるVLAモデルOE-VLAを提案し、従来の言語指示と同等以上の性能と4種類の追加タスクでの有効性を示した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- VLAS: 音声指示によるカスタマイズ可能なロボット操作のための視覚-言語-行動モデルVLA2025/2/1
音声認識をロボット方策モデルに直接統合したエンドツーエンドの視覚-言語-行動モデルVLASを提案し、音声指示によるロボット操作を実現した。
- 行動クローニングにおける潜在冗長性の再考:ロボットマニピュレーションのための情報ボトルネックアプローチ模倣学習2025/2/1
行動クローニングの潜在表現に含まれる冗長性を情報理論的に定量化し、情報ボトルネック原理を導入することで、ロボットマニピュレーションの性能を向上させる手法を提案した。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。