Jianfeng Gao
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VGM-VS: 高精度ビジュアルサーボのための視覚幾何モデルの再考ビジュアルサーボ2026/9/23
大規模事前学習済みの視覚幾何モデルを活用し、目標画像との相対カメラ姿勢を推定して閉ループ型ビジュアルサーボを行う手法。シーン固有のメトリック適応によりスケール曖昧性を解消し、USB-CやRAM挿入などの高精度組立タスクでサブミリ精度を達成。
- 実世界における空間的に基づく長期的タスク計画タスク計画2026/3/1
ロボット操作のための空間的に実行可能な長期的行動計画を評価するベンチマークを新たに構築し、実世界のロボットビデオを用いた自動データ生成手法を提案して、VLMの計画能力を向上させる。
- AsgardBench:最小限のフィードバック下での視覚に基づく対話的プランニングの評価対話的プランニング2026/3/1
視覚に基づく高レベルの行動系列生成と対話的プランニングを評価するベンチマークを提案し、実行中の視覚観察に基づくプラン適応に焦点を当てる。
- Magma: マルチモーダルAIエージェントのための基盤モデルVLA2025/2/1
画像・動画・ロボットデータを統合的に学習し、UI操作からロボットマニピュレーションまでこなすマルチモーダル基盤モデルを提案。
- TraceVLA:視覚トレースプロンプトで汎用ロボットポリシーの時空間認識を強化VLA2024/12/1
状態行動軌跡を視覚的にエンコードする視覚トレースプロンプトを導入し、VLAモデルの時空間認識を改善。15万件の操作軌跡でOpenVLAを微調整したTraceVLAは、シミュレーションと実機で大幅な性能向上を達成。
- 動画からの潜在行動事前学習VLA2024/10/1
ロボットの行動ラベルなしでインターネット規模の動画からVLAモデルを事前学習する手法を提案し、実世界のマニピュレーションタスクで既存手法を上回る性能を示した。
- Bi-KVIL: 両手マニピュレーションタスクのキーポイントベース視覚模倣学習模倣学習2024/3/1
少数の人間の両手作業動画から、物体と手の主従関係や両手協調戦略を抽出し、新しい環境のカテゴリ物体にも汎化できる視覚模倣学習手法を提案した。
- タスク指向の物体把持と再配置の視覚的模倣学習マニピュレーション2024/3/1
物体の部分観測と形状変化に対応するため、点と物体間の複数空間特徴を暗黙的ニューラル場に符号化するMIMO表現を提案し、人間の実演動画から把持・再配置を模倣学習する枠組みを構築した。
- 対話型エージェント基盤モデルVLA2024/2/1
視覚・言語・行動予測を統合したマルチタスク学習により、ロボティクス・ゲームAI・医療の3領域で動作する汎用エージェント基盤モデルを提案した。
- 身体性AIの基盤世界モデルにおける因果性の本質的役割身体性AI2024/2/1
身体性AIのための基盤世界モデルに因果性を取り入れる重要性を論じ、物理的相互作用の正確な予測に向けた展望と誤解の整理を行った位置論文。
- K-VIL: Keypoints-based Visual Imitation Learning2022/9/1
- Learning to Shift Attention for Motion Generation2021/2/1
- RMM: A Recursive Mental Model for Dialog Navigation2020/5/1
- Learning Compliance Adaptation in Contact-Rich Manipulation2020/5/1
- Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training2020/2/1
- Tactical Rewind: Self-Correction via Backtracking in Vision-and-Language Navigation2019/3/1
- Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation2018/11/1
- CPG-Based Control Scheme for Quadruped Robot to Withstand the Lateral Impact2017/11/1