Yichen Zhu
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveMimic: 能動的知覚を備えた自己中心視点ビデオ事前学習VLA2026/6/4
自己中心視点の人間ビデオから能動的知覚(カメラ動作)を活用してロボット操作を事前学習するフレームワークを提案し、ロボットデータ事前学習と同等の性能を実現した。
- dWorldEval: 離散拡散ワールドモデルによるスケーラブルなロボットポリシー評価評価/ワールドモデル2026/4/1
ロボットポリシーを数千環境・数千タスクで評価するため、視覚・言語・行動を統一トークン空間に写像し、単一のTransformerベースの離散拡散ワールドモデルを評価プロキシとして用いる手法を提案。
- Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化VLA/ポストトレーニング2026/4/1
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
- Drive-P2D: 自動運転向けVLMのための段階的知覚から意思決定へのベンチマークVLA2026/1/1
自動運転における視覚言語モデル(VLM)を、物体・シーン・意思決定の3段階で評価する6,650問のベンチマークを提案し、推論と回答を分離して採点・誤り分析を行う。
- 動画検索によるロボットマニピュレーションの学習マニピュレーション2025/11/1
一人称視点の人間のデモ動画を検索し、その中から物体のアフォーダンスや手の軌道を抽出してロボットのマニピュレーション方策を学習する手法を提案。
- ActiveUMI: ロボット不要の人間デモンストレーションによる能動的知覚を伴うロボットマニピュレーションマニピュレーション2025/10/1
VRテレオペレーションキットとセンサ付きコントローラで人間の両手作業デモを収集し、頭部運動による能動的知覚も学習してロボットに転移するデータ収集フレームワークを提案。6つの両手タスクで平均70%の成功率を達成。
- HumanoidExo: ウェアラブル外骨格によるスケーラブルな全身ヒューマノイド操作全身マニピュレーション2025/10/1
人間の動作をウェアラブル外骨格で計測し、全身ヒューマノイドの操作データへ変換するシステムを提案。実機データを補完し、少ない実演で複雑な全身制御や歩行スキル獲得を可能にした。
- dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデルVLA2025/9/1
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。
- WorldEval: 世界モデルを実世界ロボット方策の評価器として活用世界モデル2025/5/1
世界モデルを実世界ロボット方策の評価代理として用いるWorldEvalを提案し、Policy2Vecで行動追従動画を生成して方策ランキングや安全性検出を実現した。
- ChatVLA-2: 事前学習知識を活かしたオープンワールド身体推論を備える視覚-言語-行動モデルVLA2025/5/1
VLMの能力を保持しつつロボット行動に変換するMoE型VLAモデルを提案し、ホワイトボードの数式を読んでカードを選ぶ課題などで数学・OCR・空間推論能力を示した。
- PointVLA: 3D世界をVision-Language-Actionモデルに注入するVLA2025/3/1
事前学習済みVLAモデルを再学習せずに、軽量モジュールで点群入力を注入し3D空間推論能力を付与するフレームワークを提案。
- DexVLA: 汎用ロボット制御のためのプラグイン拡散エキスパートを備えた視覚言語モデルVLA2025/2/1
拡散ベースのアクションエキスパートをVLAモデルに組み込み、身体カリキュラム学習で効率的に訓練することで、多様なロボット身体での複雑な長期的タスクを実現した。
- ChatVLA:視覚・言語・行動モデルによるマルチモーダル理解とロボット制御の統合VLA2025/2/1
視覚言語行動モデルにおける「忘却」と「タスク干渉」を解決するため、段階的アライメント訓練とMixture-of-Expertsを組み合わせたChatVLAを提案し、マルチモーダル理解と実ロボット操作の両方で高性能を実現した。
- ObjectVLA: 実演なしで実世界の物体操作を実現するエンドツーエンドVLAVLA2025/2/1
Vision-Language-Actionモデルを用い、新規物体に対する実演データなしでロボットの物体操作スキルを汎化させる手法を提案し、実機で100種類の未見物体に対し64%の成功率を達成した。
- Diffusion-VLA: 自己生成推論による汎用性と解釈性を備えたロボット基盤モデルVLA2024/12/1
自己回帰モデルと拡散モデルを組み合わせ、自己生成した推論を方策学習に注入することで、解釈性が高く汎用性のある視覚運動方策を実現したロボット基盤モデル。
- CoA-VLA: 視覚・テキストのアフォーダンス連鎖による視覚言語行動モデルの改善VLA2024/12/1
ロボットの行動予測に、物体・把持・空間・移動の4種類のアフォーダンスを視覚とテキストで段階的に推論させることで、複雑なタスクでの精度と頑健性を高める手法を提案。
- TinyVLA: ロボットマニピュレーションのための高速・データ効率的な視覚言語行動モデルVLA2024/9/1
大規模事前学習不要で高速推論が可能なコンパクトな視覚言語行動モデルTinyVLAを提案し、シミュレーションと実機でOpenVLAを上回る速度とデータ効率を実現した。
- ロボット操作のための10億パラメータへの拡散方策のスケーリング模倣学習2024/9/1
拡散方策のスケーリング問題を解決するため、観測特徴の分解と非因果的注意を用いたスケーラブル拡散トランスフォーマー方策を提案し、10億パラメータまで拡張可能にした。
- 離散ポリシー:マルチタスクロボット操作のための分離された行動空間の学習マニピュレーション2024/9/1
ベクトル量子化で行動系列を離散潜在空間にマッピングし、タスク固有のコードを学習することで、マルチタスク操作を可能にするロボット学習手法を提案。実機実験でDiffusion PolicyやOpenVLAを上回る成功率を達成。
- MMRo:マルチモーダルLLMは家庭内ロボットの脳として適格か?VLA2024/6/1
家庭内ロボットの脳としてマルチモーダルLLMを評価する初のベンチマークMMRoを提案し、知覚・計画・視覚推論・安全性の4能力14指標で商用・オープンソースモデルを比較した。
- 検索拡張型身体性エージェントマニピュレーション2024/4/1
ロボットに外部のポリシー記憶を検索させて過去の経験を活用し、複雑な操作タスクの性能を高める手法を提案した。
- Visual Robotic Manipulation with Depth-Aware Pretraining2024/1/1
- Language-Conditioned Robotic Manipulation with Fast and Slow Thinking2024/1/1
- Object-Centric Instruction Augmentation for Robotic Manipulation2024/1/1
- Revisiting Event-based Video Frame Interpolation2023/7/1