Zibin Dong
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- G0.5: ロボットの推論と行動のための単一自己回帰ストリームVLA2026/8/1
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリングVLA2025/12/1
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
- Embodied-R1: 汎用ロボット操作のための強化学習による身体性推論VLA2025/8/1
「ポインティング」を身体性に依存しない中間表現として用い、3Bの視覚言語モデルを強化学習ファインチューニングで訓練することで、未知の環境や実機タスクへのゼロショット汎化を実現した研究。
- EmbodiedMAE: ロボットマニピュレーションのための統合3Dマルチモーダル表現マニピュレーション2025/5/1
RGB・深度・点群を統合的に学習するマルチモーダルMAEを提案し、DROID-3Dデータセットで訓練することで、シミュレーションと実機の操作タスクにおいて既存の視覚基盤モデルを上回る性能を達成した。
- 見ることから行うことへ:ロボットマニピュレーションのための推論と意思決定の橋渡しマニピュレーション2025/5/1
空間関係推論で中間表現を生成する視覚言語モデルFSDを提案し、ロボット操作のゼロショット性能を大幅に向上させた。
- 条件付けが鍵:拡散ポリシーの学習は思ったより速いVLA2025/5/1
条件拡散ポリシー学習で生じる「損失崩壊」を特定し、条件に依存したソース分布を用いるCocosを提案。少ない学習ステップとパラメータで大規模事前学習VLAに匹敵する性能を実現した。
- CleanDiffuser: 意思決定のための拡散モデル向け使いやすいモジュール式ライブラリ拡散モデル意思決定2024/6/1
意思決定アルゴリズムに特化した初の拡散モデルライブラリCleanDiffuserを提案し、モジュール式で柔軟な実装と広範な評価を通じてその信頼性と設計上の知見を示した。
- Uni-RLHF:多様な人間フィードバックを用いた強化学習のための汎用プラットフォームとベンチマークスイートRLHF2024/2/1
多様な人間フィードバックを扱うRLHFのための注釈プラットフォーム、大規模クラウドソーシングデータセット、モジュール式オフラインRLHFベースラインを提供する統合システムを構築し、30以上のタスクで1500万ステップを超えるデータを収集して評価した。