Feng Yan
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VLA-Precision: 非対称共同ブートストラップによる視覚言語行動モデルの効率的な実世界オンライン強化学習VLA/強化学習2026/9/3
実世界のオンライン強化学習を用いて、精密な操作タスクにおける視覚言語行動モデルの性能を向上させるフレームワークを提案した。
- ST-WAM: 視覚分布シフト下でのロバストな操作のための意味的時間的世界行動モデル操作2026/7/1
視覚分布の変化に頑健なロボット操作のため、DINOv3特徴を共有表現として用いる意味的時間的世界行動モデル(ST-WAM)を提案し、将来予測と履歴検索を改善した。
- SkiP: ロボット操作の効率化のためのスキップと精密化のタイミングマニピュレーション2026/5/1
模倣学習のポリシーが毎ステップ予測するのをやめ、動作が単調な区間はスキップし、接触や把持などの重要区間だけを高解像度で予測する新しい手法を提案。動作の複雑さを自動検出して区間を分割し、実行ステップを15〜40%削減しつつ成功率を維持・向上させる。
- 低コストデータでロボットマニピュレーションの汎化を促進VLA2025/3/1
大規模作業空間での空間推論フェーズに着目し、低コストで収集可能なデータを活用してVLAモデルの汎化性能を高めるフレームワークを提案。
- RoboTron-Nav: 知覚・計画・予測を統合した具現化ナビゲーションの統一フレームワークナビゲーション2025/3/1
言語指示に基づく視覚ナビゲーションのため、知覚・計画・予測をマルチタスク学習で統合し、適応的な3D履歴サンプリングで過去の観測を効率的に活用するフレームワークを提案。CHORES-Sベンチマークで成功率81.1%を達成し、最先端性能を更新した。
- RoboTron-Drive:自動運転のためのオールインワン大規模マルチモーダルモデルVLA2024/12/1
画像や多視点動画を入力とし、知覚・予測・計画を含む多様な自動運転タスクを単一モデルで実行する汎用大規模マルチモーダルモデルを提案し、複数ベンチマークで最先端性能を達成した。
- RoboTron-Mani:ロボット操作のためのオールインワン・マルチモーダル大規模モデルマニピュレーション2024/12/1
カメラパラメータと占有監督で3D知覚を強化し、モダリティ分離マスクとマルチモーダルデコーダで融合を改善したロボット操作モデルと、複数データセットを統合したRoboDataを提案。CALVINで平均系列長を1.7から3.5に向上させ、シミュレーションと実世界で最先端を達成。
- DaDu-Corki:身体性AIロボットマニピュレーションのためのアルゴリズム・アーキテクチャ協調設計マニピュレーション2024/7/1
LLM推論・ロボット制御・通信を分離し、近未来の軌道予測と専用ハードウェアでマニピュレーションを高速化・省エネ化する協調設計フレームワークを提案。
- RoboCAS:複雑な物体配置シナリオにおけるロボットマニピュレーションのベンチマークマニピュレーション2024/7/1
散在・整列・積み重ねなど複雑な物体配置を扱うロボット操作ベンチマークRoboCASを提案し、長期的な空間推論や連鎖反応予測の能力を評価した。
- RoboUniView: ロボット操作のための統一視点表現を持つ視覚言語モデルVLA2024/6/1
カメラパラメータに依存しない統一視点表現を事前学習で獲得し、それに基づいてロボット操作の行動を生成することで、異なるロボットプラットフォーム間での性能差を解消した手法を提案。
- 構造光画像を用いた臨床における顔面位置合わせの新手法位置合わせ2024/5/1
構造光カメラとCT画像から顔の特徴点を抽出し、ICP法で粗位置合わせと精密位置合わせを行うことで、低誤差かつ短時間で顔面深度画像を位置合わせする手法を提案した。