Deli Zhao
Alibaba Group
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- 固定カメラから自由カメラへ:キャリブレーション不要の視点ロバストな視覚言語行動モデルVLA2026/7/1
カメラの位置が変わっても、その位置情報を明示的に与えずにロボットが自分で視点を推定して操作できる新しいVLAモデルを提案した。カメラ中心の動作予測と手と目の関係行列の予測を組み合わせ、単眼RGB画像だけで多様な視点で成功率を向上させる。
- RynnWorld-4D: ロボット操作のための4D具現化ワールドモデルワールドモデル2026/7/1
RGB、深度、オプティカルフローを統合した4Dワールドモデルを提案し、将来のシーン変化を予測してロボット操作のポリシー学習を支援する。
- GeoProp: ロボット状態を視覚に接地する汎用操作のための手法マニピュレーション2026/7/1
ロボットの状態と視覚特徴を幾何学的に整合させる軽量アダプタを提案し、操作ポリシーの性能を向上させた。
- RynnBrain 1.1:より高機能で汎用的な具現化基盤モデルを目指してVLA/基盤モデル2026/7/1
RynnBrain 1.1は、2Bから122B-A10Bまでの規模を持つ具現化基盤モデル群で、接触点予測や3Dグラウンディングを導入し、ロボット操作に直接対応する表現と出力を実現。実機実験では、Qwenベースや汎用VLAを上回る性能を示した。
- RynnWorld-Teleop: デジタル遠隔操作のための行動条件付きワールドモデルデータ生成2026/7/1
物理的な遠隔操作に代わり、生成ワールドモデルを用いてロボット中心の映像を合成し、実機不要で模倣学習用の軌道データを生成するデジタル遠隔操作パラダイムを提案した。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- ガウススプラッティングによる実世界ゼロショットロボットマニピュレーション学習のための高忠実度シミュレーションデータ生成sim2real2025/10/1
実世界の多視点画像から3DGSとメッシュを組み合わせて物理的に操作可能な高忠実度シミュレーション環境を構築し、MLLMで物体の物理特性や関節構造を自動推定することで、シミュレーションのみで訓練した方策が実世界の多様なマニピュレーションタスクへゼロショット転移できることを示した。
- GP3: マルチビュー画像を用いた3D幾何認識ロボットマニピュレーションポリシーマニピュレーション2025/9/1
マルチビューRGB画像から深度とカメラパラメータを推定し、3Dシーン表現を構築して言語指示に基づく操作を実現するポリシーGP3を提案。シミュレーションで高性能を示し、実機にも少ない微調整で転移可能。
- RynnVLA-001:人間のデモンストレーションを活用したロボットマニピュレーションの改善VLA2025/9/1
人間の操作動画で大規模に事前学習した視覚-言語-行動モデルを提案し、2段階の事前学習とActionVAEで行動予測を効率化してロボット操作性能を向上させた。
- 人間らしい事前知識を活用したアフォーダンス認識型ロボット巧み把持マニピュレーション2025/8/1
人間の手の動きを模倣した事前学習と、機能的に不適切な接触領域を避けるアフォーダンス認識モジュールを組み合わせ、自然で汎用的な巧み把持を実現するフレームワークAffordDexを提案。
- RynnEC:MLLMを身体性認知の世界へVLA2025/8/1
汎用視覚言語モデルに領域エンコーダとマスクデコーダを組み込み、領域中心の動画理解で物体属性・セグメンテーション・空間推論を高精度化した身体性認知向けMLLMを提案。
- WorldVLA:自己回帰型行動世界モデルへの挑戦VLA2025/6/1
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。