Nanyang Ye
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/ロボットアーム/オープンソースデータ生成/VLAUAV制御sim2realワールドモデル物体追跡
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 多様な経験によるスケーリング:視覚言語行動モデルのための手法VLA2026/6/8
視覚言語行動モデルの実世界展開における課題を解決するため、意図分離アルゴリズムと類似サンプル誘導型強化学習を導入し、ロボットタスクとマルチモーダルベンチマークで優れた性能を達成した。
- OpenEAI-Platform: オープンソースの具現化人工知能ハードウェア・ソフトウェア統合プラットフォームVLA/ロボットアーム/オープンソース2026/6/1
低コストの6+1自由度ロボットアームと再現可能なVLAモデルを統合した完全オープンソースのプラットフォームを提案し、実世界の操作タスクで商用アームや大規模事前学習モデルと同等以上の性能を示した。
- V-CAGE: ロボット操作のための視覚閉ループエージェント生成エンジンデータ生成/VLA2026/4/1
VLAモデル学習用の高品質な合成データを自動生成するエージェントフレームワークを提案。セマンティックなレイアウト計画と視覚自己検証により、物理的に実行可能なシーンと軌道を生成し、データ圧縮も実現する。
- イベント-深度融合に基づく高速UAV障害物回避のためのエンドツーエンド飛行制御ネットワークUAV制御2026/3/1
深度カメラとイベントカメラの相補的な特性を双方向クロスアテンションで融合し、模倣学習で訓練したエンドツーエンドの飛行制御ネットワークを提案。高速飛行時の障害物回避成功率を大幅に向上させた。
- V-CAGE: 長期的な身体動作タスクのための文脈認識型生成と検証sim2real2026/1/1
VLMによる検証ループと階層的指示分解を組み合わせ、物理的・意味的に整合した大規模操作データセットを生成するフレームワークを提案。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- PNAS-MOT: パレート神経アーキテクチャ探索によるマルチモーダル物体追跡物体追跡2024/3/1
NASで追跡用の効率的なアーキテクチャを探索し、マルチモーダル化でロバスト性を高め、エッジデバイス上で低遅延な物体追跡を実現した研究。