Ziwei Liu
収録論文 47本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTools: 実世界の一人称視点動画における道具中心の推論に向けて一人称視点/道具使用推論2026/9/30
道具を使う一人称視点動画の大規模データセット(100時間)と、知覚・幾何・手順・因果推論を問う1,000問のベンチマークを構築し、既存の動画マルチモーダルモデルが道具使用の理解に苦戦することを示した。
- UniMPA:行動接地型遷移モデリングによる統合記憶・予測・行動モデルVLA2026/9/10
視覚言語行動モデルの遷移実現性ギャップを、記憶・予測・行動を統合した行動接地型インターフェースで解決する手法を提案。
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- ACE-Data-0: 人間中心の環境キャプチャによる具現化データエンジンデータセット2026/7/30
家庭環境を校正済みの録音スタジオに変えるデータ収集エンジンACEを提案し、多感覚データセットACE-Data-0を構築した。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
- 全ての点が等しいわけではない:不確実性を考慮した4D LiDARシーン合成LiDARシーン生成2026/6/1
LiDARシーン生成において、空間的不確実性を利用して「難しい領域から簡単な領域へ」というスケジュールで生成を導く新しいフレームワークU4Dを提案した。
- SpatialBench:あなたの空間基盤モデルは万能選手か?ベンチマーク2026/5/26
空間基盤モデルの真の汎化能力を評価するため、多様な領域・タスク・入力密度をカバーする大規模ベンチマークSpatialBenchを構築し、41モデルを体系的に評価した。
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- PhysX-Omni: 剛体・変形体・関節物体のための統合シミュレーション対応物理3D生成3D生成2026/5/1
剛体、変形体、関節物体など多様なアセットタイプに対応した、シミュレーション対応の物理3D生成の統合フレームワークを提案した論文。
- あなたの運転ワールドモデルは万能選手か?自動運転/評価ベンチマーク2026/5/1
運転ワールドモデルの性能を画質から閉ループ運転まで多面的に評価する統一ベンチマークWorldLensを提案し、既存モデルが全軸で優れないことを示した。
- HSImul3R: 物理を組み込んだシミュレーション可能な人-シーン相互作用の再構築シミュレーション/再構築2026/3/1
カジュアルな映像から、物理的に安定したシミュレーション可能な人-シーン相互作用の3D再構築を行うフレームワークを提案。物理シミュレータを能動的な監督者として双方向に最適化し、実ロボットへの適用も実証した。
- Kinema4D: 時空間身体化シミュレーションのためのキネマティック4Dワールドモデリングシミュレーション2026/3/1
ロボットと環境の相互作用を4次元(時空間)で生成する新しいシミュレータを提案し、ロボット制御の正確な4D表現と環境反応の生成的4Dモデリングを組み合わせることで、物理的に妥当で幾何学的に一貫した相互作用をシミュレートする。
- 単一視点点群からのエンドツーエンド器用把持学習:多物体シーンデータセットによるアプローチマニピュレーション2026/3/1
多物体シーンでの器用な把持を実現するため、単一視点の点群から把持構成を直接予測するエンドツーエンドネットワークDGS-Netと、それを訓練するための多物体シーンデータセットを提案した。
- BFA++: マルチビュー視覚言語行動モデルのための階層的ベスト特徴認識トークンプルーニングVLA2026/2/1
VLAモデル向けに、視点内・視点間の2段階重要度予測で動的にトークンを削減し、マルチビュー入力の計算効率と操作成功率を両立させるフレームワークを提案した。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- DynamicVLA:動的物体操作のための視覚-言語-行動モデルVLA2026/1/1
動的物体操作のためのVLAフレームワークを提案し、時系列推論と閉ループ適応を統合。合成・実世界データからなるDOMベンチマークも構築した。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- U4D: LiDAR系列からの不確実性を考慮した4D世界モデリング4D世界モデリング2025/12/1
LiDARデータから動的な3D環境を生成する際に、不確実性マップを用いて難しい領域から順に生成し、時空間ブロックで時間的一貫性を高めるフレームワークを提案。
- マルチモーダル基盤モデルによる空間知能のスケーリングVLA2025/11/1
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- PhysX-Anything: 単一画像からシミュレーション可能な物理的3Dアセットを生成sim2real2025/11/1
単一の画像から、関節構造や物理属性を備えたシミュレーション可能な3Dアセットを生成するVLMベースのフレームワークを提案し、新データセットPhysX-Mobilityも構築した。
- 空間から行動へ:空間基盤事前分布に基づく視覚-言語-行動モデルVLA2025/10/1
RGB画像から空間基盤モデルで3D幾何事前分布を抽出し、行動ヘッドに注入することで、追加センサーなしにVLAモデルの空間推論能力を高めるFALCONを提案。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- マルチモーダルLLMの空間知能を包括的に評価するEASI空間知能評価2025/8/1
GPT-5など最先端マルチモーダルモデルの空間理解・推論能力を、統一的なタスク分類に基づく8つのベンチマークで大規模に評価し、人間との差や限界を明らかにした。
- 画像からLiDARへのデータ事前学習における時空間一貫性の強化LiDAR事前学習2025/3/1
連続するLiDAR-カメラペアを用いて時空間的手がかりを統合するSuperFlow++を提案し、11の異なるLiDARデータセットで最先端性能を達成した。
- VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究VLA2025/1/1
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
- SMPLest-X:表現豊かな人体姿勢・形状推定のための究極のスケーリング人体姿勢推定2025/1/1
人体・手・顔の動きを統合的に捉えるEHPSにおいて、40のデータセットと最大ViT-Hugeのモデルを用いてスケーリング則を調査し、汎用基盤モデルを構築した研究。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- LiMoE: 自動車シーン向けLiDAR表現の混合エキスパート学習3D認識2025/1/1
LiDARの複数表現(距離画像・疎ボクセル・生点群)をMixture of Expertsで統合し、事前学習からセグメンテーションまで一貫して活用するフレームワークを提案。
- SOLAMI:3D自律キャラクターとの没入型インタラクションのための社会的視覚-言語-行動モデリングVLA2024/11/29
3Dキャラクターが人間と社会的に交流できるよう、視覚・言語・行動を統合した初のエンドツーエンドVLAフレームワークを提案し、合成データセットとVRインターフェースを開発した。
- DynamicCity: 動的シーンからの大規模4D占有生成4D生成2024/10/1
動的運転環境の大規模4D占有シーンを生成するフレームワークを提案し、HexPlane表現のVAEとDiTベース拡散モデルで高品質な生成を実現した。
- 4DコントラスティブSuperFlow:密な3D表現学習器3D知覚2024/7/1
LiDARとカメラの連続ペアを用いた時空間事前学習フレームワークSuperFlowを提案し、点群密度変化への不感性と流れベースのコントラスティブ学習で3D知覚モデルを効率的に学習する。
- 自動運転向けマルチモーダルなデータ効率の良い3Dシーン理解3Dシーン理解2024/5/1
LiDARセマンティックセグメンテーションの半教師あり学習において、LiDARとカメラの対応や言語知識を活用するLaserMix++を提案し、少ないアノテーションで高精度を実現した。
- ユニバーサルLiDARセグメンテーションに向けたマルチスペースアラインメントLiDARセグメンテーション2024/5/1
異なるセンサやシーンで収集された大規模運転データセットを統合し、データ・特徴・ラベル空間でのアラインメントを行うことで、単一パラメータでマルチタスク・マルチデータセット・マルチモダリティのLiDARセグメンテーションを実現するM3Netを提案。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- 自動運転におけるBird's Eye View知覚のロバスト性のベンチマークと改善BEV知覚2024/5/1
BEV知覚モデルのロバスト性を評価するベンチマークRoboBEVを提案し、33モデルを検証してCLIPベースの改善手法を設計した。
- WHAC: 世界座標系に基づく人間とカメラの統合推定人体姿勢推定2024/3/1
単眼動画からSMPL-X人体モデルとカメラ姿勢を世界座標系で同時推定するフレームワークWHACを提案し、新規合成データセットWHAC-A-Moleも公開する。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- InsActor: Instruction-driven Physics-based Characters2023/12/1
- Octopus: Embodied Vision-Language Programmer from Environmental Feedback2023/10/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- Rethinking Range View Representation for LiDAR Segmentation2023/3/1
- LaserMix for Semi-Supervised LiDAR Semantic Segmentation2022/7/1