Sijin Chen
The University of Hong Kong
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SiMDex: 類似する自己中心視点動画のマイニングによるクロスエンボディ器用操作データ選択/器用操作/VLA2026/8/1
ロボットの器用操作のためのVLAモデル訓練に有効な人間の自己中心視点動画を、類似性に基づくデータマイニングで選別するフレームワークを提案。約3200万サンプルから1.49百万件を選び、成功率を47.7%から61.1%に向上させた。
- 橋渡し動作としての翻訳:人間からロボットへの操作スキル転移マニピュレーション2026/6/1
人間の動作データから双腕ロボットへの操作スキル転移を改善するため、頭部カメラ座標系での相対手首並進を橋渡し動作表現として用いる手法を提案し、ノイズの多い6DoF人間動作よりも効果的であることを示した。
- TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応VLA2026/6/1
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
- World Guidance: 行動生成のための条件空間における世界モデリングVLA2026/2/1
未来の観測をコンパクトな条件に圧縮して行動推論に注入し、VLAモデルが未来の行動と条件を同時に予測することで、精密な行動生成と高い汎化性能を実現するフレームワークを提案した。
- 空間から行動へ:空間基盤事前分布に基づく視覚-言語-行動モデルVLA2025/10/1
RGB画像から空間基盤モデルで3D幾何事前分布を抽出し、行動ヘッドに注入することで、追加センサーなしにVLAモデルの空間推論能力を高めるFALCONを提案。
- DSPv2: 全身移動マニピュレーションのための効果的で汎化可能な高密度ポリシーの改良移動マニピュレーション2025/9/1
3D空間特徴と多視点2D意味特徴を融合する新たなエンコーディングとDense Policyの拡張により、全身移動マニピュレーションの模倣学習における汎化性能と動作生成精度を向上させた。
- GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデルVLA2025/7/1
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。