Yanwei Fu
Fudan University
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StructRL: フローベースVLAのための構造化アクション空間探索VLA/強化学習2026/8/15
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
- Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留するVLA2026/8/1
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
- τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデルVLA/世界モデル2026/6/1
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
- STABLE: セマンティクスと物理の二重システムによるシミュレーション対応テーブルトップレイアウト生成シーン生成2026/5/1
タスク指示からシミュレーション可能なテーブルトップシーンを生成するため、意味推論と物理補正を交互に行う二重システムを提案した。
- Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニングVLA2026/5/1
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
- OFlow: 物体認識を組み込んだ時間的フローマッチングによる堅牢なロボット操作VLA/操作2026/4/1
ロボット操作のためのVLAモデルに、物体認識を組み込んだ時間的フローマッチングを導入し、将来予測と物体認識を統一した潜在空間で行うことで、分布シフト下での堅牢性を向上させた。
- VADF: 視覚適応型拡散ポリシーフレームワークによる効率的なロボット操作マニピュレーション2026/4/1
拡散ポリシーの学習収束の遅さと推論タイムアウト問題を解決するため、訓練時のサンプル難易度に応じた重み付けと、推論時の視覚に基づくタスク分割により、収束ステップ数を削減し早期成功率を向上させるフレームワークを提案した。
- EEGベースの視覚・運動イメージハイブリッド制御によるロボット把持と配置BCI/ロボット制御2026/3/1
脳波(EEG)による視覚イメージと運動イメージを組み合わせ、ロボットの把持対象と配置位置を意図駆動で制御する枠組みを提案・実装した。
- OCRA: 3Dと触覚の事前知識を用いた物体中心学習による人間からロボットへの行動転移模倣学習/行動転移2026/3/1
人間のデモ動画からロボットの操作行動を学習する物体中心フレームワークOCRAを提案。3D点群と触覚情報を統合し、拡散ポリシーでロバストな操作を実現する。
- ST4VLA: 視覚言語行動モデルのための空間誘導訓練VLA2026/2/1
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
- PoseVLA: 汎用ポーズ事前学習による汎化可能な視覚-言語-行動ポリシーVLA2026/2/1
VLAモデルの特徴崩壊と学習効率の低さを解決するため、カメラ中心の統一空間で3D空間事前知識を抽出する事前学習と、ロボット固有の行動空間への適応を行う事後学習に分離したPose-VLAを提案。離散ポーズトークンにより多様な3Dデータと軌道データを統合し、RoboTwin 2.0で79.5%、LIBEROで96.0%の成功率を達成。
- 語り、夢見て、行動する:指示駆動型ロボット操作のためのビデオ世界モデル学習VLA2026/2/1
ビデオ生成モデルを蒸留して高速化し、生成された未来映像と実観測を組み合わせて行動モデルを訓練することで、指示に基づくロボット操作の精度と効率を向上させるフレームワークを提案。
- DST-Calib: 二重経路・自己教師あり・ターゲット不要のLiDAR-カメラ外部キャリブレーションネットワークキャリブレーション2026/1/1
LiDARとカメラの外部キャリブレーションを、専用ターゲットや高精度正解ラベルなしでオンライン実行できる自己教師ありネットワークを提案。両側データ拡張と差分マップ構築により、汎化性能と精度を向上させた。
- ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3DロボットマニピュレーションVLA2026/1/1
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
- シュレーディンガーのナビゲーター:ゼロショット物体ナビゲーションのための未来集合の想像ナビゲーション2025/12/1
軌道条件付き3D世界モデルで複数の未来を想像し、不確実性を考慮してゼロショット物体ナビゲーションを行う手法を提案。
- TP-MDDN: タスク優先度付きマルチ要求駆動ナビゲーションと自律的意思決定ナビゲーション2025/11/1
複数の要求とタスク優先度を考慮した長期的ナビゲーションの新ベンチマークTP-MDDNを提案し、指示分解・目標選択・タスク監視を行う自律意思決定システムAWMSystemで解決する。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- SCOOP'D: Sim2Real生成ポリシーによる混合液固形物のすくい取り学習sim2real2025/10/1
OmniGibsonシミュレータで特権情報を用いたすくい取りデモを収集し、拡散モデルによる生成ポリシーで観測入力から模倣学習することで、実世界でのゼロショットすくい取りを実現した。
- 拡散モデルによる想像的協調で両手マニピュレーションを実現マニピュレーション2025/7/1
動画予測と行動予測を拡散モデルで統合し、推論時には動画予測を省略できる効率的な両手操作フレームワークを提案。シミュレーションと実機で成功率を大幅に向上させた。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
- LLM駆動の空間推論によるオープンボキャブラリ3D視覚グラウンディングのためのニューラル表現フレームワーク3D視覚グラウンディング2025/7/1
大規模言語モデルで言語クエリの空間関係を推論し、視覚特性を強化した階層的特徴場を構築することで、自由記述の指示から3D空間内の対象物体を高精度に特定する手法を提案。
- 時空間認識を組み込んだ視覚運動拡散ポリシー学習VLA2025/7/1
動的ガウス世界モデルを用いて3D空間・4D時空間認識を拡散ポリシーに組み込み、シミュレーションと実機で成功率を向上させた視覚模倣学習手法。
- 一度だけ推定:ロボット把持のための統合・ワンステージ・リアルタイムカテゴリレベル関節物体6D姿勢推定6D姿勢推定2025/6/1
関節物体のカテゴリレベル6D姿勢推定を、インスタンス分割とNPCS表現を同時に出力する単一ステージのネットワークで実現し、200Hzのリアルタイム動作を可能にした研究。
- CAP-Net: 単一RGB-D画像からカテゴリ別関節部品の6D姿勢とサイズを推定する統合ネットワーク6D姿勢推定2025/4/1
RGB-D特徴を統合した単段ネットワークで、関節物体の各部品の6D姿勢とサイズをカテゴリレベルで推定する手法を提案し、sim-to-realギャップを埋める大規模データセットRGBD-Artも構築した。
- 片手で複数物体を連続把持するSeqMultiGraspマニピュレーション2025/3/1
4本指のAllegro Handで、1つ目の物体を落とさずに2つ目の物体を連続して把持するシステムを提案。拡散モデルで把持姿勢を生成し、シミュレーションと実機で検証した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- Polaris: 合成から実世界への視覚グラウンディングと大規模言語モデルによるオープンエンド対話型ロボットマニピュレーションマニピュレーション2024/8/1
GPT-4と視覚グラウンディングモデルを組み合わせ、合成データで学習した姿勢推定パイプラインにより、テーブルトップ上のオープンエンドな対話型マニピュレーションを実現するフレームワークを提案した。
- LAC-Net: 遮蔽下での高精度ロボット把持のための線形融合注意誘導畳み込みネットワークマニピュレーション2024/8/1
RGBと深度を線形融合する注意誘導型ネットワークで物体の遮蔽部分を補完し、雑然とした環境でのロボット把持精度を向上させた研究。
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1
- PourIt!: Weakly-supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic Pouring2023/7/1
- I Know What You Draw: Learning Grasp Detection Conditioned on a Few Freehand Sketches2022/5/1
- Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions2022/5/1
- SAR-Net: Shape Alignment and Recovery Network for Category-level 6D Object Pose and Size Estimation2021/6/1