Siteng Huang
Alibaba Group
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboChrono:ストリーミングタスク理解のための実ロボットベンチマークベンチマーク2026/9/29
実ロボットと人手の記録からなる39シナリオ・34,713件のベンチマークを構築し、18の視覚言語モデルのゼロショット性能を評価して、視覚照合と時間順序理解の能力差を明らかにした。
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- RynnWorld-4D: ロボット操作のための4D具現化ワールドモデルワールドモデル2026/7/1
RGB、深度、オプティカルフローを統合した4Dワールドモデルを提案し、将来のシーン変化を予測してロボット操作のポリシー学習を支援する。
- RynnBrain 1.1:より高機能で汎用的な具現化基盤モデルを目指してVLA/基盤モデル2026/7/1
RynnBrain 1.1は、2Bから122B-A10Bまでの規模を持つ具現化基盤モデル群で、接触点予測や3Dグラウンディングを導入し、ロボット操作に直接対応する表現と出力を実現。実機実験では、Qwenベースや汎用VLAを上回る性能を示した。
- RynnWorld-Teleop: デジタル遠隔操作のための行動条件付きワールドモデルデータ生成2026/7/1
物理的な遠隔操作に代わり、生成ワールドモデルを用いてロボット中心の映像を合成し、実機不要で模倣学習用の軌道データを生成するデジタル遠隔操作パラダイムを提案した。
- VLA-Corrector: 適応アクションホライズンのための軽量検出・修正推論VLA/行動生成2026/7/1
VLA-Correctorは、アクションチャンク方式のVLAポリシーに軽量な視覚モニタとオンライン勾配ガイダンスを追加し、実行中のずれを検出して修正再計画を行うことで、閉ループ応答性を向上させる。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- ガウススプラッティングによる実世界ゼロショットロボットマニピュレーション学習のための高忠実度シミュレーションデータ生成sim2real2025/10/1
実世界の多視点画像から3DGSとメッシュを組み合わせて物理的に操作可能な高忠実度シミュレーション環境を構築し、MLLMで物体の物理特性や関節構造を自動推定することで、シミュレーションのみで訓練した方策が実世界の多様なマニピュレーションタスクへゼロショット転移できることを示した。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- RynnVLA-001:人間のデモンストレーションを活用したロボットマニピュレーションの改善VLA2025/9/1
人間の操作動画で大規模に事前学習した視覚-言語-行動モデルを提案し、2段階の事前学習とActionVAEで行動予測を効率化してロボット操作性能を向上させた。
- Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデルVLA2025/8/1
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
- 人間らしい事前知識を活用したアフォーダンス認識型ロボット巧み把持マニピュレーション2025/8/1
人間の手の動きを模倣した事前学習と、機能的に不適切な接触領域を避けるアフォーダンス認識モジュールを組み合わせ、自然で汎用的な巧み把持を実現するフレームワークAffordDexを提案。
- WorldVLA:自己回帰型行動世界モデルへの挑戦VLA2025/6/1
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。
- OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化VLA2025/5/1
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
- Humanoid-VLA:視覚統合による汎用人型ロボット制御VLA2025/2/1
言語・自己視点映像・運動制御を統合し、大規模未ラベル動画を自己教師ありで活用することで、物体操作や環境探索をこなす汎用人型ロボット制御フレームワークを提案した。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策VLA2024/12/1
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
- QUAR-VLA: Vision-Language-Action Model for Quadruped Robots2023/12/1