Kaixuan Wang
RoboDojo
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- 予想外のロボットポリシー:GPT-6 AstraのRoboDojoとその先における初期評価VLA2026/9/21
大規模言語モデルをロボット操作のポリシーとして直接使えるかを検証し、GPT-6 Astraが公開ポリシーを上回る成功率を示す一方、精度や動的制御を要するタスクは苦手であることを明らかにした。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- ManiTwin: データ生成対応デジタルオブジェクトデータセットを10万点に拡張データセット/シミュレーション2026/3/1
単一画像からシミュレーション対応の3Dアセットを自動生成するパイプラインを構築し、10万点の高品質アセットデータセットを提供する論文。
- Drive-P2D: 自動運転向けVLMのための段階的知覚から意思決定へのベンチマークVLA2026/1/1
自動運転における視覚言語モデル(VLM)を、物体・シーン・意思決定の3段階で評価する6,650問のベンチマークを提案し、推論と回答を分離して採点・誤り分析を行う。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- MultiPark: 次セグメント予測を用いたマルチモーダル駐車トランスフォーマー自動運転/駐車2025/8/1
駐車行動のマルチモーダル性に対応するため、次セグメント予測と学習可能な駐車クエリを導入した自己回帰トランスフォーマーを提案し、実車両で堅牢性を確認した。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- 雑然環境における言語条件付きピック&プレースのための無条件行動事前分布の効率的アラインメントマニピュレーション2025/3/1
視覚・言語・行動の基盤モデルの事前知識を統合し、1つのアテンション層で無条件行動事前分布を3D視覚言語事前分布にアラインメントすることで、少ないデータで学習しつつゼロショット汎化を保ち、雑然環境での言語条件付きピック&プレースを効率的に実現する手法A²を提案。
- FlowNorm: A Learning-based Method for Increasing Convergence Range of Direct Alignment2019/10/1
- Real-time Scalable Dense Surfel Mapping2019/9/1
- An Efficient B-spline-Based Kinodynamic Replanning Framework for Quadrotors2019/6/1
- Trajectory Replanning for Quadrotors Using Kinodynamic Search and Elastic Optimization2019/3/1
- Probabilistic Dense Reconstruction from a Moving Camera2019/3/1
- MVDepthNet: Real-time Multiview Depth Estimation Neural Network2018/7/1