Yanzhi Wang
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Q-WAM: 行動サブスペース保護によるWorld Action Modelの4ビット量子化量子化2026/9/27
World Action Modelを4ビットに量子化する際、行動生成に重要なチャネルを低ランク16ビット枝で保護することで、精度をほぼ保ったまま計算・メモリコストを削減する手法を提案。
- Flash-WAM: モダリティ認識蒸留によるワールドアクションモデルの高速化VLA2026/6/3
ビデオとロボット動作を同時生成するワールドアクションモデルを、モダリティごとに適切な蒸留手法を適用して単一ステップ推論に圧縮し、リアルタイム制御を可能にした。
- PhyWorld: 物理的に忠実な世界モデルによるビデオ生成ビデオ生成2026/5/19
ビデオ生成モデルを物理法則に従う世界シミュレータとして機能させるため、2段階のポストトレーニング(フローマッチングとDPO)を導入し、物理的整合性を向上させた。
- ActQuant: 視覚言語行動モデルのための4ビット未満の行動誘導量子化量子化2026/5/19
VLAモデルのエッジ展開を可能にするため、行動予測への寄与度に基づいてビット幅を割り当てる行動誘導型混合精度量子化フレームワークActQuantを提案し、シミュレーションと実機で高い性能を維持しつつ大幅な圧縮を実現した。
- PanoWorld: 幾何学的に一貫したパノラマ動画の世界モデリング動画生成2026/5/14
単一画像とキャプションから、3Dシーン状態を明示的に考慮した幾何学的に一貫した360度動画を生成する世界モデルを提案。深度と軌跡の一貫性を保つ軽量正則化を導入し、専用データセットで評価した。
- PhyGround: 生成ワールドモデルにおける物理推論のベンチマークビデオ生成/物理推論2026/5/11
ビデオ生成モデルの物理法則遵守を評価するための、基準に基づいたベンチマークと自動評価器を提案した論文。
- 機械における人間の認知:世界モデルの統一的視点世界モデル2026/4/1
世界モデルの研究を認知機能の観点から分類し、人間のような認知能力を目指すための統一的枠組みを提案した論文。特に動機付けとメタ認知の研究不足を指摘し、今後の研究方向を示している。
- ロボットはいつ考えるべきか?強化学習による資源認識型推論で身体性ロボットの意思決定を実現VLA2026/3/1
身体性ロボットがLLM推論をいつ・どの役割で・どれだけ使うかを強化学習で適応的に決める階層的枠組みRARRLを提案し、タスク成功率向上と遅延削減を実現した。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
- Moxin-VLMとMoxin-VLAを備えたオープンソースマルチモーダルMoxinモデルVLA2025/12/22
完全オープンソースのLLM「Moxin」を基に、視覚言語理解・視覚言語行動・中国語対応の3つの派生モデルを開発し、公開した。
- エッジからクラウドGPUまでのVision-Language-ActionモデルのクロスプラットフォームスケーリングVLA2025/9/1
5つの代表的なVLAモデルをエッジとデータセンターGPUで評価し、精度・遅延・スループット・メモリ使用量を測定してスケーリング傾向を明らかにした。
- VOTE: 軌道アンサンブル投票による視覚-言語-行動モデルの最適化VLA2025/7/1
VLAモデルの推論遅延と学習コストを削減するため、少ない行動トークンで並列生成する学習フレームワークと、過去と現在の予測を投票で統合する推論最適化を提案し、成功率と推論速度を大幅に向上させた。
- Understanding Time Variations of DNN Inference in Autonomous Driving2022/9/1
- StereoVoxelNet: Real-Time Obstacle Detection Based on Occupancy Voxels from a Stereo Camera Using Deep Neural Networks2022/9/1
- Enabling Level-4 Autonomous Driving on a Single $1k Off-the-Shelf Card2021/10/1