Tai Wang
Shanghai AI Laboratory
収録論文 42本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VCN-Bench:事前視覚経験に基づく空間推論のためのビデオ文脈化ナビゲーションベンチマークナビゲーション2026/9/28
事前に撮影された動画を手がかりに、指示された目的地を推論してナビゲーションする新ベンチマークVCN-Benchを提案し、MLLMの閉ループ空間推論能力を評価した。
- 視覚品質を超えて:自己運動下の物理的整合性を評価するEgoGenEval評価ベンチマーク2026/9/10
自己運動下での視覚生成モデルの物理的整合性を評価するポーズ不要のベンチマークEgoGenEvalを提案し、16モデルの評価とSFT実験からペアワイズ教師強制目的の限界を示した。
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- X-NavDP: グループQスコア再重み付けマッチングによる新規行動と異種エンボディメントへのナビゲーション拡散ポリシーの一般化ナビゲーション2026/7/1
ナビゲーション拡散ポリシーを強化学習で事後訓練し、多様なロボット形態や困難なシナリオへの一般化を向上させるフレームワークGQRMを提案。シミュレーションと実世界で成功率を大幅に改善した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- 探索・対話・展開可能:オープンワールド移動操作のための視覚駆動型具現化エージェント移動操作2026/7/1
実世界展開可能な移動操作エージェントのためのフレームワークREALを提案し、シミュレーションと実機のギャップを埋める環境とベンチマークを構築、物理ロボットで高い成功率を達成した。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- ReactiveBFM: 汎用ヒューマノイド全身制御に向けたリアクティブ閉ループ動作計画ヒューマノイド制御2026/6/1
既存の行動基盤モデルは事前定義された動作しか実行できず環境変化に弱いため、生成型プランナーと追跡制御を閉ループで統合し、曝露バイアスを軽減するリアクティブな全身制御フレームワークを提案した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- ロボットマニピュレーション方策のための行動空間設計の謎を解くマニピュレーション2026/2/1
双腕ロボットでの大規模実験により、模倣学習における行動空間の設計(絶対vs差分、関節空間vsタスク空間)が方策の学習性と制御安定性に与える影響を体系的に分析した。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- LoGoPlanner: メートル法に基づく視覚幾何と自己位置推定を統合したナビゲーション方策ナビゲーション2025/12/1
絶対スケールの視覚幾何バックボーンを微調整し、周囲形状の再構成と暗黙的状態推定を組み合わせることで、外部キャリブレーション不要のエンドツーエンド移動ロボットナビゲーションを実現した。
- VL-LN Bench:能動的対話による長期的目標指向ナビゲーションに向けてナビゲーション2025/12/1
対話を通じて曖昧な指示を解決しながら特定物体を探索する新しいナビゲーションタスクIIGNと、そのための大規模ベンチマークVL-LN Benchを提案した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- InternScenes: 現実的なレイアウトを持つ大規模シミュレーション可能屋内シーンデータセットsim2real2025/9/1
実世界スキャン・手続き生成・デザイナー作成の3ソースを統合し、約4万シーン・196万物体を含む大規模でシミュレーション可能な屋内3Dシーンデータセットを構築した。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- 視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究VLA2025/7/1
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- GLEAM: 複雑な3D屋内環境における能動的マッピングのための汎化可能な探索方策の学習能動的マッピング/探索2025/5/1
合成・実スキャンの1,152シーンからなる大規模ベンチマークGLEAM-Benchを構築し、意味表現と長期目標・ランダム化戦略で未知の複雑シーンでも高被覆・高精度に探索する汎化可能な能動的マッピング方策を提案した。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- LabUtopia:科学実験エージェントのための高忠実度シミュレーションと階層的ベンチマークsim2real2025/5/1
実験室での科学作業を自動化する身体性エージェントの研究を進めるため、物理・化学反応を扱える高忠実度シミュレータ、多様な実験シーンの自動生成器、5段階の難易度を持つ階層的ベンチマークを統合したスイートを提案。
- RoboGround: 接地視覚言語事前知識を用いたロボットマニピュレーションマニピュレーション2025/4/1
視覚言語モデルによるグラウンディングマスクを中間表現として用い、対象物の位置・形状情報を政策ネットワークに与えることで汎化性能を高めるロボット操作システムを提案。大規模シミュレーションデータ生成パイプラインも構築した。
- 自動運転のための遅延を考慮した3Dストリーミング知覚に向けて3D知覚2025/4/1
実行時遅延を考慮したオンライン評価ベンチマークを提案し、遅延を考慮した履歴統合と予測検出により、Jetson AGX Orin上でオフライン性能の80%を達成する3Dストリーミング知覚フレームワークを構築した。
- VLM-Grounder: ゼロショット3D視覚グラウンディングのためのVLMエージェント3D視覚グラウンディング2024/10/1
2D画像のみを用いた視覚言語モデルにより、3D点群や物体事前情報なしで自然言語指示に基づく3D物体の位置推定をゼロショットで実現したフレームワーク。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- CooHOI: 操作物体の動力学を活用した協調的人間-物体インタラクションの学習マニピュレーション2024/6/1
単一ヒューマノイドの模倣学習とマルチエージェント強化学習を組み合わせ、複数体で協調して物体を運ぶスキルを獲得するフレームワークを提案。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。
- 最先端LiDARセグメンテーションモデル訓練の実証研究LiDARセグメンテーション2024/5/1
LiDARセグメンテーション研究を統一するツールボックスMMDetection3D-lidarsegを提案し、多様なモデル・データ拡張・疎畳み込みバックエンドを統合してベンチマークを効率化した。
- GenNBV: 能動的3D再構成のための汎化可能な次善視点ポリシー能動的3D再構成2024/2/1
強化学習を用いて、任意の視点から撮影できるドローンの次善視点ポリシーを学習し、未知の大規模物体でも高い被覆率で3D再構成を自動化した。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Scene as Occupancy2023/6/1
- MV-FCOS3D++: Multi-View Camera-Only 4D Object Detection with Pretrained Monocular Backbones2022/7/1
- Monocular 3D Object Detection with Depth from Motion2022/7/1
- FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection2021/4/1
- FLAVA: Find, Localize, Adjust and Verify to Annotate LiDAR-Based Point Clouds2020/11/1