Yifan Li
Shanghai Innovation Institute
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界モデルは計画のために何を区別すべきかロボット計画2026/9/26
計画に必要な情報は目的や候補集合によって異なることを整理し、目的に応じて探索箇所を決めるモジュール設計を提案した論文。
- τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデルVLA2026/8/17
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
- GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリングVLA2026/8/16
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデルVLA/世界モデル2026/6/1
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
- 空間プロンプトを用いたエゴセントリック操作の視覚軌道予測操作/軌道予測2026/5/19
ロボット操作のタスク指示を空間的なプロンプト(バウンディングボックスや点)で行う新しい設定を提案し、エゴセントリック映像から将来のエンドエフェクタ軌道を予測する手法を開発した。
- 複数反射によるLiDAR測距の曖昧さの特性評価センサ/測距2026/4/1
LiDARセンサが複数の反射面を持つ環境で確率的に測距する現象を、実データの累積分布関数を用いて特性評価した論文。
- 全身ロボット操作のための非同期Fast-Slow視覚言語行動ポリシーVLA2025/12/1
VLM推論と高速行動生成を非同期に分離し、潜在表現バッファと全身行動トークナイザで統合したVLAフレームワークを提案。3Bモデルで30Hzの全身行動生成を実現した。
- IndustryNav: 動的産業環境における身体性エージェントの空間推論ベンチマークナビゲーション2025/11/1
動的な倉庫を再現したUnity環境で、視覚言語モデルによる能動的なナビゲーションと空間推論を評価する初の産業向けベンチマークを提案し、最先端モデルの安全性や計画能力の課題を明らかにした。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- TacShade:光・影・グレースケールに基づく形状再構成のための3Dプリント軟質光学触覚センサ触覚2024/6/1
スケッチの明暗表現に着想を得た3Dプリント軟質光学触覚センサを開発し、接触物体の形状を粗く高速に再構成する手法を提案した。
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1