Yonggen Ling
収録論文 9本 ・ フィジカルAI/ロボット学習
VLA視覚追跡ヒューマンロボットインタラクションマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Hy-Embodied-VLM-1.0:効率的な物理世界エージェントVLA2026/7/14
物理世界で動作する組み込みエージェント向けの基盤モデルを提案し、行動中心の能力分類に基づくデータパイプラインと効率的なMoEアーキテクチャにより、38ベンチマークで優れた性能を達成した。
- ReferTrack: 参照してから追跡する身体化視覚追跡手法視覚追跡2026/7/1
身体化視覚追跡において、自然言語で指定された対象をまず画像中のバウンディングボックスから選択し、その選択に基づいて追跡経路を生成する「参照→追跡」パラダイムを提案。時間的な対象情報を保持する工夫と参照QA学習により、単眼カメラで高い追跡成功率を達成し、実ロボットでも有効性を確認した。
- TAIHRI: 近接ヒューマンロボットインタラクションのためのタスク認識型3D人体キーポイント位置推定ヒューマンロボットインタラクション2026/4/10
ロボットがユーザーの動作指示を理解し、タスクに関連する身体部位の3D座標を正確に推定する、初の視覚言語モデルを提案した。
- PoseVLA: 汎用ポーズ事前学習による汎化可能な視覚-言語-行動ポリシーVLA2026/2/1
VLAモデルの特徴崩壊と学習効率の低さを解決するため、カメラ中心の統一空間で3D空間事前知識を抽出する事前学習と、ロボット固有の行動空間への適応を行う事後学習に分離したPose-VLAを提案。離散ポーズトークンにより多様な3Dデータと軌道データを統合し、RoboTwin 2.0で79.5%、LIBEROで96.0%の成功率を達成。
- VinT-6D:視覚・触覚・固有感覚を統合した大規模物体把持データセットマニピュレーション2025/1/1
ロボットの手先操作のための、視覚・触覚・固有感覚を統合した大規模データセットVinT-6Dを構築し、シミュレーションと実環境の両方で200万件以上のデータを収集した。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- High-Precision Online Markerless Stereo Extrinsic Calibration2019/3/1
- Probabilistic Dense Reconstruction from a Moving Camera2019/3/1
- Modeling Varying Camera-IMU Time Offset in Optimization-Based Visual-Inertial Odometry2018/10/1