Yicheng Feng
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Being-H0.7: 自己中心視点ビデオからの潜在世界行動モデルVLA2026/5/1
将来のフレーム生成をせずに、潜在空間での未来推論をVLAポリシーに組み込む新しいモデルを提案。訓練時のみ未来情報を使う二重分岐設計により、推論時は現在の観察のみで将来を考慮した行動決定を実現し、シミュレーションと実世界タスクで高性能を達成した。
- 後続遷移の再重み付けによる保守的オフラインロボット方策学習オフライン強化学習2026/3/1
ロボットのオフライン事後学習で、各サンプルの行動後の結果に基づいて学習への影響度を再重み付けする手法PTRを提案。不均一なデータセットでの保守的な適応を改善する。
- Joint-Aligned Latent Action: 実世界データからのスケーラブルなVLA事前学習に向けてVLA2026/2/1
人間の操作動画から逆動力学と実行動に整合する潜在行動を学習し、大規模なVLA事前学習を可能にするフレームワークJALAを提案。
- 視覚-言語-行動モデルのスケーリング再考:アラインメント・混合・正則化VLA2026/2/1
VLAモデルのスケーリングを体系的に検証し、エンドエフェクタ相対の行動表現が異なる身体間の転移に重要である一方、異種ロボットデータの単純な混合は負の転移を招くことを示した研究。
- Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現VLA2026/1/1
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
- 人間動画からの視覚-物理アライメントによる空間認識VLA事前学習VLA2025/12/1
人間の動画から3D視覚・動作アノテーションを抽出し、2D視覚と3D空間推論を事前学習で結びつけるVLAモデルを提案。下流のロボットタスクで2D視覚と3D動作の対応が改善し、汎化性能が向上した。
- VLAモデルの信頼性指標としての輸送不一致VLA2025/12/1
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
- Being-H0: 大規模人間動画からの視覚-言語-行動事前学習VLA2025/7/1
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
- Being-0: 視覚言語モデルとモジュール型スキルを統合したヒューマノイドロボットエージェントVLA2025/3/1
基盤モデルによる高レベルな指示理解・計画と、モジュール型スキルライブラリによる歩行・マニピュレーションを、軽量VLMのConnectorで橋渡しする階層型エージェントを提案し、実機ヒューマノイドで長期的タスクを実現した。