Wenzhao Zheng
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SM4RT: 4D再構成のための構造化モーション幾何学の学習4D再構成2026/7/1
単眼RGBビデオから、物体の剛体運動をSE(3)のモーションベースに分解して表現し、3D再構成と構造化された動きの知覚をエンドツーエンドで行うTransformerモデルを提案した。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- IVGT: 暗黙的視覚幾何トランスフォーマーによるニューラルシーン表現3D再構成2026/5/1
カメラポーズが未知の多視点画像から、連続的で一貫した3D幾何と外観を暗黙的にモデル化する手法を提案。SDFと色を予測する軽量デコーダを用いて、任意の3D位置での空間クエリを可能にし、メッシュ再構成や新規視点合成など多様なタスクで高い性能を示した。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- DriveTok: 3D運転シーンのトークン化による統一的な多視点再構成と理解自動運転/トークン化2026/3/19
多視点の運転シーンを効率的にトークン化する3Dシーン・トークナイザーを提案し、画像再構成やセマンティックセグメンテーション、深度予測、3D占有予測を統一的に扱えることを示した。
- Vega: 自然言語指示による自動運転学習自動運転2026/3/1
多様な運転指示と軌道を含む大規模データセットを構築し、視覚と言語を統合して指示に従った軌道生成と計画を行う統一モデルVegaを提案した。
- TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーションVLA2026/2/1
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
- Astra: 自己回帰デノイジングによる汎用インタラクティブ世界モデル世界モデル2025/12/9
過去の観測と行動から多様なシーンの未来映像を予測する汎用世界モデルAstraを提案。自己回帰デノイジングと行動認識アダプタにより、運転やロボット把持などの精密な行動制御と長期的予測を実現した。
- SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つVLA2025/12/1
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
- 運転視覚幾何Transformer3D再構成2025/12/1
自動運転向けに、カメラパラメータ不要で多視点画像列からメートルスケールの密な3D点群と自車姿勢を推定するTransformerモデルを提案。
- RoboArmGS: ベジェ曲線補正による高品質なロボットアームのスプラッティングロボットアーム/3D再構成2025/11/1
URDFに基づく理想的な関節運動を学習可能なベジェ曲線で補正し、実世界の動きに即した高品質な3Dガウシアン表現を実現した研究。
- Terra: 点潜在表現による探索可能なネイティブ3D世界モデル3D世界モデル2025/10/16
3D入力を点潜在表現に符号化し、3Dガウスプリミティブとして復号する世界モデルを提案。単一生成で任意視点からの高品質レンダリングと探索可能な環境生成を実現した。
- R3D2: 拡散モデルによる自動運転シミュレーションへのリアルな3Dアセット挿入sim2real2025/6/1
拡散モデルを用いて、自動運転のニューラルレンダリングシーンに影や照明を考慮したリアルな3Dアセットをリアルタイムで挿入する手法を提案。
- OmniIndoor3D:包括的な屋内3D再構成3D再構成2025/5/1
RGB-Dカメラで撮影した屋内シーンを、ガウス表現を用いて見た目・形状・パノプティックに高精度で再構成するフレームワークを提案。
- GeoDrive: 3D幾何情報を活用した精密な行動制御可能な運転世界モデル世界モデル2025/5/1
入力画像から3D表現を抽出し、指定した自車軌道に基づく2Dレンダリングを条件として与えることで、3D幾何的一貫性と行動制御性を高めた自動運転向け世界モデルを提案した。
- GaussianAD: 3Dガウシアン中心のエンドツーエンド自動運転自動運転2024/12/1
3Dセマンティックガウシアンで周囲シーンを表現し、視覚入力から知覚・予測・軌道計画をエンドツーエンドで行う自動運転フレームワークを提案。
- GPD-1: 自動運転のための生成的事前学習自動運転2024/12/1
自車・エージェント・地図をトークン化し、自己回帰トランスフォーマで統一的に生成することで、追加学習なしにシーン生成・交通シミュレーション・地図予測・運動計画など多様な運転タスクをこなすモデルを提案。
- LLMを人間のように運転するよう指示する自動運転計画2024/6/1
人間の運転ロジックと交通ルールを指示データとしてLLMを微調整し、解釈可能な推論モジュールで実世界の閉ループ運動計画ベンチマークnuPlanにおいて有効性を示した。