Jifeng Dai
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- 運転意図の増幅による計画指向強化学習の性能向上強化学習/自動運転2026/5/1
単一のデモ軌道から学習する連続行動ポリシーのモード崩壊問題を解決するため、離散的な意図ラベルと分類器フリーガイダンスを用いてサンプリング分布を拡張し、多意図GRPOで微調整するDIALフレームワークを提案した。
- MindVLA-U1: 統合ストリーミングアーキテクチャによる自動運転向けVLAがVAを凌駕自動運転/VLA2026/5/1
自動運転向けに、言語トークンと連続アクション軌道を単一の共有表現で生成する初の統合ストリーミングVLAアーキテクチャを提案し、従来のVAモデルを上回る性能を実現した。
- AnyScene: 任意の場所とその先における高制御性運転シーン生成に向けて自動運転/シーン生成2026/5/1
BEVレイアウトからセマンティック占有シーケンスを生成し、それを基にマルチビュー運転ビデオを合成する統一的な占有中心フレームワークを提案。クロスデータセットやユーザー定義のレイアウトに対して高精度な制御と長期的生成を実現する。
- ストリーミング意図からの行動創発自動運転2026/5/1
自動運転における行動創発を形式化し、意図を連鎖的に推論して行動生成を導くVLAモデルSIを提案した。
- カメラ空間で行動を接地する観測中心の視覚-言語-行動ポリシーVLA2025/8/1
ロボットの手先姿勢をロボット基準座標系ではなくカメラ座標系で予測するOC-VLAを提案し、視点変化への汎化とタスク成功率を改善した。
- OWMM-Agent:マルチモーダルなエージェントデータ合成によるオープンワールド移動マニピュレーション移動マニピュレーション2025/6/1
オープンワールド移動マニピュレーションのためのマルチモーダルエージェントアーキテクチャと、VLMをファインチューニングするデータ合成パイプラインを提案し、実世界でSOTA性能と汎化を実現した。
- 視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御をVLA2025/6/1
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
- Dita: 汎用視覚言語行動ポリシーのための拡散TransformerのスケーリングVLA2025/3/1
Transformerで連続行動列を直接ノイズ除去するマルチモーダル拡散フレームワークを提案し、多様なロボットデータを統合して長期的タスクや実環境適応を実現した。
- 拡散トランスフォーマーポリシーVLA2024/10/1
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
- CooHOI: 操作物体の動力学を活用した協調的人間-物体インタラクションの学習マニピュレーション2024/6/1
単一ヒューマノイドの模倣学習とマルチエージェント強化学習を組み合わせ、複数体で協調して物体を運ぶスキルを獲得するフレームワークを提案。
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- Planning-oriented Autonomous Driving2022/12/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Collaborative Visual Navigation2021/7/1