Jingyu Gong
East China Normal University
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundingVLN: 視覚言語ナビゲーションのためのグラウンディングに基づく推論と行動VLA2026/9/16
視覚的グラウンディングを推論と行動の共通インターフェースとして用い、推論を画像位置に紐付け、画素ゴールを予測して動作に変換する視覚言語ナビゲーション手法を提案。R2R-CEで69.9%の成功率を達成。
- 2D-3Dギャップを埋める:視覚言語ナビゲーションのための階層的意味幾何マップナビゲーション2026/6/1
視覚言語ナビゲーションの性能を向上させるため、3D空間情報をVLMが扱える階層的マップに変換し、意味推論と経路計画を分離する手法を提案した。
- World2Minecraft: 占有駆動によるシミュレーションシーン構築シミュレーション環境構築2026/4/30
実世界のシーンを3Dセマンティック占有予測に基づいてMinecraft環境に変換する手法を提案し、データ収集パイプラインと大規模データセットMinecraftOccを導入して、占有予測の性能向上とカスタマイズ可能な具現化AI研究プラットフォームを実現した。
- DailyArt: 潜在ダイナミクスによる単一静止画像からの関節構造の発見関節推定2026/4/9
単一の閉じた状態の画像から、物体の関節パラメータを推定する新しい手法を提案。まず開いた状態の画像を合成して関節の手がかりを露出させ、観測画像との差分から全関節を同時に推定する。
- 3Dガウススプラッティング強化マルチモーダル検索拡張生成によるゼロショットロボット操作マニピュレーション2026/3/1
ロボット操作のゼロショット汎化を改善するため、3Dガウススプラッティングとマルチモーダル検索拡張生成を組み合わせたフレームワークを提案し、物体の姿勢推定精度を向上させた。
- T2S: 生涯模倣学習のためのトークン化スキルスケーリング模倣学習2025/8/1
モデルパラメータをトークン化し、言語ガイド付きでスキルを拡張することで、破滅的忘却を防ぎつつ新しいスキルを効率的に学習する生涯模倣学習フレームワークを提案。
- NaviMaster: GUIナビゲーションと身体性ナビゲーションを統合する統一ポリシーの学習VLA2025/8/1
GUI操作と身体性ナビゲーションを同一のMDPとして捉え、視覚的軌跡収集と強化学習で単一のエージェントを訓練し、両タスクで高性能を達成した。
- DORAEMON: 記憶強化型分散オントロジー認識エージェントによるナビゲーションナビゲーション2025/5/1
人間の脳の腹側・背側経路を模したフレームワークで、VLMと階層的意味空間融合・トポロジーマップを組み合わせ、未知環境でのゼロショット自律ナビゲーションを高精度に実現した。