Feng Zheng
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NutriBench-Kitchen:栄養管理のための身体化AIベンチマークベンチマーク2026/9/7
調理動画における栄養関連状態の追跡と知識に基づく計画を評価するベンチマークを提案し、既存の視覚言語モデルが人間性能に及ばないことを示した。
- DreamTraj: 未レンダリングのビデオ拡散潜在表現を読み取る6自由度物体軌道生成軌道予測2026/8/1
単一のRGB画像と指示文から、ビデオ生成モデルの内部表現を直接読み取って物体の6自由度軌道を予測する手法を提案。専用データセットMOVEも構築し、既存手法より高速で高精度。
- ロボット操作のための一段フローマッチング用可逆ニューラルネットワークアダプタマニピュレーション2026/6/1
視覚・言語・固有受容などのマルチモーダル観測から高次元の操作行動を一段のノイズ除去で生成する可逆ニューラルネットワークアダプタを提案し、推論コストを削減しつつ精度を維持する。
- VGP-Nav:ロボットナビゲーションのためのメトリック対応視覚幾何知覚ナビゲーション2026/6/1
単眼RGBカメラのみを用いて、メートル単位の正確な自己位置推定と障害物知覚を同時に実現する統合フレームワークを提案した。
- Trans2Occ: 透明物体のボクセル占有推定と把持 - シミュレーションから実世界へマニピュレーション2026/6/1
単一RGB画像から透明物体のボクセル占有を直接予測し、シミュレーションで大規模学習したモデルを実ロボットに微調整なしで適用して把持を実現する枠組みを提案した。
- STABLE: セマンティクスと物理の二重システムによるシミュレーション対応テーブルトップレイアウト生成シーン生成2026/5/1
タスク指示からシミュレーション可能なテーブルトップシーンを生成するため、意味推論と物理補正を交互に行う二重システムを提案した。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- LiveVLN: 視覚言語ナビゲーションにおける停止・再開ループの解消ナビゲーション2026/4/1
事前学習済みVLMナビゲータに多段階動作継続を追加し、実行と新規観測の処理を重ね合わせることで、待ち時間を削減し連続的なナビゲーションを実現するトレーニング不要のフレームワークを提案した。
- RADAR: 意味的計画と自律的因果環境リセットによる閉ループロボットデータ生成データ生成2026/3/1
VLMによるタスク生成とGNN方策、自動成功判定、FSMによる環境リセットを組み合わせ、人手を介さずロボット操作データを収集し続ける閉ループシステムを提案。
- ST4VLA: 視覚言語行動モデルのための空間誘導訓練VLA2026/2/1
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- MesaTask: 3D空間推論によるタスク駆動型卓上シーン生成シーン生成2025/9/1
タスク指示から物理的に妥当な卓上シーンを生成するため、空間推論チェーンとDPOで強化したLLMフレームワークMesaTaskを提案し、大規模データセットMesaTask-10Kを構築した。
- ActiveVLN: マルチターン強化学習による能動的探索を実現する視覚言語ナビゲーションVLA2025/9/1
視覚言語ナビゲーションにおいて、少数の模倣学習で初期化した後、マルチターン強化学習とGRPOで能動的に探索し、効率的に性能を向上させるフレームワークを提案。
- P³: 汎用性の高い身体性エージェントに向けてVLA2025/8/1
リアルタイム知覚と動的スケジューリングを統合し、ツールのフィードバックに依存せず多タスクを計画・実行する身体性エージェントの枠組みを提案し、能動的知覚のベンチマークATPを構築した。
- A0: 汎用ロボットマニピュレーションのためのアフォーダンス認識階層モデルマニピュレーション2025/4/1
物体との接触点と接触後軌道を予測するアフォーダンス表現を用い、高レベルな空間理解と低レベル行動実行を階層的に分けた拡散モデルを提案。複数ロボットで汎用性と実世界性能を示した。
- RoboReflect: 曖昧な状態の物体把持のためのロボット自己内省推論フレームワークマニピュレーション2025/1/1
大規模視覚言語モデル(LVLM)を活用し、把持失敗時にロボットが自己内省して戦略を自動修正・記憶するフレームワークを提案。曖昧な状態の物体8種で既存手法を上回る性能を示した。
- InfiniteWorld: 汎用視覚言語ロボットインタラクションのための統合スケーラブルシミュレーションフレームワークsim2real2024/12/1
Nvidia Isaac Sim上に構築された、汎用視覚言語ロボットインタラクション向けの統合スケーラブルなシミュレータを提案し、3Dアセット構築やReal2Sim、自動注釈などの機能と4つの新しいベンチマークを提供する。
- すべてのロボットを一つに:多用途な汎用身体性エージェントのための新標準と統合データセットデータセット2024/8/1
実世界とシミュレーションのデータを統合した新標準ARIOを提案し、約300万エピソード・32万タスクからなる大規模データセットを構築した。
- PIRVS: An Advanced Visual-Inertial SLAM System with Flexible Sensor Fusion and Hardware Co-Design2017/10/1