Jiajun Deng
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WAM-OPD: オンポリシー蒸留によるワールドアクションモデルの高性能化VLA2026/9/28
事前学習済みワールドアクションモデルを、環境ロールアウトを繰り返さずにオンポリシー蒸留で専門タスクに適応させる手法WAM-OPDを提案。
- DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成VLA2026/8/30
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
- RoMAN-Flow: ロボット操作におけるオフライン強化学習のための自己回帰正規化フローの制御オフライン強化学習2026/8/20
自己回帰正規化フローを用いたオフライン強化学習フレームワークを提案し、サンプリング不要の尤度目的と一段階蒸留により推論遅延を削減しつつ、ロボット操作の性能を維持する。
- LabDex: 実験室における器用な操作のための階層的ベンチマークマニピュレーション2026/8/19
化学実験室での器用な操作を評価するための大規模な実世界データセットとベンチマークを導入し、原子スキル、合成タスク、長期実験の階層的タスク分類を提供する。
- ReTouch: オンライン更新型触覚予測による接触豊富な器用操作の実現触覚/操作2026/8/1
触覚予測を実行時のフィードバックでオンライン更新するVLAモデルReTouchを提案し、接触を伴う器用操作の成功率を大幅に向上させた。
- GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習VLA/操作2026/6/7
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
- ドリフトベース方策最適化:オンラインロボット制御のためのネイティブ一段階方策学習ロボット制御2026/4/1
多段階生成方策の推論コストを削減するため、固定点ドリフト目的で訓練時に反復精錬を内部化した一段階生成方策(DBP)と、そのオンラインRLフレームワーク(DBPO)を提案した。
- 3D空間事前知識を用いた手術ロボット操作学習手術ロボティクス2026/3/1
内視鏡画像から3D空間情報を直接抽出するエンドツーエンドの視覚運動ポリシーを提案し、大規模3Dデータセットと空間特徴コネクタにより手術ロボットの空間認識能力を向上させた。
- LISN: VLMベース制御器調整による言語指示型ソーシャルナビゲーションソーシャルナビゲーション2025/12/1
言語指示に従い社会的規範を守るソーシャルナビゲーションのベンチマークLISN-Benchを構築し、VLMがコストマップと制御パラメータを調整する階層型手法を提案した。
- VLMPlanner: 視覚言語モデルと運動計画の統合VLA2025/7/1
視覚言語モデル(VLM)を自動運転の運動計画に組み込み、生画像から得た文脈情報でリアルタイムプランナを誘導するハイブリッド手法を提案。シーン複雑度に応じて推論頻度を調整する機構も導入した。
- Goal-VLA: 画像生成VLMを物体中心の世界モデルとして活用するゼロショットロボットマニピュレーションVLA2025/6/1
画像生成型VLMを世界モデルとして使い、目標状態の画像を生成して物体姿勢を導出することで、追加学習なしに多様な操作タスクを実現するフレームワークを提案。
- GraspCoT: 物理特性推論を統合した柔軟な言語指示による6自由度把持マニピュレーション2025/3/1
物理特性に着目したChain-of-Thought推論とマルチモーダルLLMを組み合わせ、多様な言語指示から6自由度把持姿勢を予測するフレームワークを提案し、新ベンチマークIntentGraspで有効性を示した。