Ying-Cong Chen
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- フロンティアVLMエージェントはロボット汎用istになれるか?Embodied Agent Arenaによる実証研究VLA2026/10/1
VLMのロボット汎用性を評価するベンチマーク「Embodied Agent Arena」を提案し、7つのVLMを幾何推定・空間推論・アフォーダンス・タスク計画・操作の観点で比較した。精密推定は得意だが、協調的な目標指向行動の完遂に課題が残ることを示した。
- PIVOT: マルチターンVLMエージェントのためのピボット認識型オンポリシー自己蒸留VLA2026/9/28
マルチターンVLMエージェントのRL訓練において、失敗の起点となる「ピボット」ステップを内部化して特定・状態復元するフレームワークを提案し、環境ロールバックなしで性能を向上させた。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- RACaP: 進化可能なロボット学習のためのポリシーとしての推論・行動・コーディングVLA2026/9/24
コード生成を進化フェーズに移し、展開時は凍結された型付きポリシーAPIをReActループで呼び出すエージェント型フレームワークを提案。長期的タスクで成功率と速度を大幅に改善し、小型モデルへの蒸留で実機展開を効率化した。
- Robo-Harness K1: 知覚拡張によるロボット操作エージェントの活用VLA2026/9/24
VLMに深度や空間計測などの知覚ツールを提供し、追加学習なしでロボット操作を実現するエージェントフレームワークを提案。少ない実演データでも高い汎化性能を示す。
- World Action Agent:視覚的アクション空間でのロボット操作を可能にするVLM活用フレームワークVLA2026/9/24
VLMをマルチエージェント構成でロボット操作に活用し、接触ビュー・アクションリハーサル・ビュー内補正を組み合わせた視覚的アクション作業空間を提案。LIBERO-Proで75.6%の成功率を達成。
- WorldLines: 長期的な状態を持つ具現化エージェントのベンチマークとモデリング具現化エージェント/長期記憶/ベンチマーク2026/6/17
長期的な家庭支援のためのベンチマークWorldLinesを構築し、記憶と計画の課題を評価するフレームワークObsMemを提案した。
- 言語エージェントのための方策と世界モデルの同時学習言語エージェント2026/6/1
強化学習のロールアウトから得られる遷移データを利用し、方策学習と同時に世界モデルを補助的に学習するフレームワークPaWを提案。推論時の追加コストなしでエージェント性能を向上させる。
- RoboStressBench: 身体化シーンにおける物理的視覚ストレスに対するVLMロバスト性のベンチマークVLM/ベンチマーク2026/5/30
視覚言語モデル(VLM)の実環境でのロバスト性を評価するため、物理的レンダリング方程式に基づき、視覚ストレスを材料・視点・照明・幾何の4次元に分解したベンチマークRoboStressBenchを提案した。
- 焦点可能な単眼深度推定深度推定2026/5/12
指定された対象領域に焦点を当てて深度推定を行う新しいタスクと、プロンプト条件付きのフレームワークを提案した論文。
- RoboEvolve: 限られたデータでのロボット操作のためのプランナーとシミュレーターの共進化操作学習2026/5/1
ロボット操作のデータ不足を解決するため、VLMプランナーとVGMシミュレーターを相互強化する共進化ループで構成されるフレームワークRoboEvolveを提案。未ラベルのシード画像のみから動作を自律生成し、データ効率を大幅に向上させる。
- パノラマ親和性予測親和性予測2026/3/1
360度画像を用いた親和性予測の新タスクを提案し、大規模データセットPAP-12Kと訓練不要のパイプラインPAPを導入した。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- SPOT-Occ: スパースプロトタイプ誘導トランスフォーマーによるカメラベース3D占有予測3D占有予測2026/2/1
カメラ画像から3D占有を予測する際、スパースなボクセル特徴を効率的に集約するため、プロトタイプ誘導型のスパーストランスフォーマーデコーダを提案し、速度と精度を両立させた。
- A4-Agent: ゼロショットアフォーダンス推論のためのエージェントフレームワークアフォーダンス推論2025/12/1
訓練不要のエージェント型フレームワークで、生成モデル・視覚言語モデル・視覚基盤モデルを組み合わせ、言語指示に基づく物体のアフォーダンス領域をゼロショットで推論する。
- PhysToolBench:マルチモーダル大規模言語モデルの物理ツール理解を評価するベンチマークVLA2025/10/1
MLLMが物理ツールをどれだけ理解しているかを評価する初のVQAベンチマークを構築し、32モデルを評価した結果、ツール理解に大きな欠陥があることを明らかにした。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- GaussianProperty: LMMを用いた3Dガウシアンへの物理特性の統合3D表現/物理特性推定2024/12/1
SAMとGPT-4Vを組み合わせて2D画像から物体の材質・物理特性を推定し、投票戦略で3Dガウシアンに付与することで、物理シミュレーションやロボット把持に応用可能にした学習不要のフレームワーク。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。