Cong Huang
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhysBrain 1.5:視覚言語モデルから物理基盤モデルへVLA2026/9/14
人間のインタラクション動画から身体動作を学習し、行動生成と未来状態予測を統合した8Bの物理基盤モデルを構築、28の身体理解ベンチマークでオープンソース最高性能を達成した。
- SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択データ選択/模倣学習/VLA2026/7/1
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
- FBFM: ワールドアクションモデル実行のための訓練不要な非同期フィードバック機構VLA2026/7/1
フローマッチングに基づくワールドアクションモデルにおいて、チャンク境界を待たずに実観測を内部フィードバックとして注入し、長期タスクでのドリフトを抑制する訓練不要の推論機構を提案した。
- ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3DオブジェクトトークンVLA/ヒューマノイド/操作2026/7/1
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
- EgoPriMo: 対話型ヒューマノイド制御のための自己中心視点動作生成ヒューマノイド制御2026/6/7
自己中心視点の人間デモから全身動作の事前分布を学習し、テキスト指示に基づいて動作の再構築・生成・予測を行う統一フレームワークを提案した。
- ロボセマンティックベンチ:VLAモデルの行動予測における意味的接地の診断VLA/評価ベンチマーク2026/6/1
VLAモデルが複雑な指示の意味を理解して正しい物体を操作できるかを診断するベンチマークを提案し、多くのモデルが物体把握はできるが意味的に正しい選択がランダム以下であることを示した。
- ヒューマン・アズ・ヒューマノイド:人間に合わせた身体を持つエゴ・エクソ人間ビデオからのゼロショット人型ロボット学習模倣学習2026/6/1
人間のデモ動画を高自由度ヒューマノイドのVLA学習に使えるように、身体・センシング・行動ラベルを揃えるフレームワークを提案し、実機で検証した。
- IntentVLA:曖昧なロボット操作のための短期的意図モデリングVLA/操作2026/5/1
視覚と言語の観察が似ていても異なる行動を取るマルチモーダルな模倣データに対し、過去の視覚観察を短期的意図として符号化し、行動生成を条件付けるVLAフレームワークを提案。曖昧さを評価するベンチマークAliasBenchも導入し、複数の環境で安定性と性能を向上させた。
- EA-WM: イベント認識型生成ワールドモデルと構造化された運動学から視覚へのアクションフィールドワールドモデル2026/5/1
ロボットのワールドモデルにおいて、アクション信号を利用してビデオ生成を誘導し、正確なロボットの空間幾何学と物体との相互作用を保持する新しい生成モデルを提案した。
- PhysBrain 1.0 技術報告書VLA2026/5/1
大規模な人間の一人称視点ビデオから物理的常識を抽出し、視覚言語行動モデルとロボット制御ポリシーに転移する手法を提案し、複数のベンチマークで最高性能を達成した。
- FrameSkip: VLAトレーニングにおける少数だが情報量の多いフレームからの学習VLA/データ選択2026/5/1
ロボットのデモ軌道から全フレームを均等に使う代わりに、動作変化や視覚-動作の整合性などに基づいて重要フレームを選び、その割合を増やして学習するフレーム選択手法を提案。データローダのみを変更し、VLAアーキテクチャはそのままに、3つのベンチマークで成功率を向上させた。
- STARRY: ロボット操作のための時空間アクション中心世界モデルVLA/操作2026/4/1
将来の時空間予測とアクション生成を統一拡散プロセスで統合し、幾何学的注意変調により3次元制御を強化する世界モデル拡張型VLAポリシーを提案。
- Cybo-Waiter: ヒューマノイド全身移動操作のための物理エージェントフレームワークヒューマノイド/移動操作2026/3/1
VLMプランを検証可能なタスクプログラムに変換し、3D幾何学的監視でループを閉じるヒューマノイドエージェントフレームワークを提案。移動と操作を統合し、長期的なタスク実行の堅牢性を向上させる。
- CyboRacket: ヒューマノイドラケットスポーツのための知覚から行動へのフレームワークヒューマノイド制御2026/3/1
ヒューマノイドロボットがラケットスポーツでボールを打つための、視覚追跡・軌道予測・全身制御を統合した階層的フレームワークを提案し、実機で成功を実証した。
- 3D-Mix for VLA: VGGTベースの3D情報を視覚言語行動モデルに統合するプラグアンドプレイモジュールVLA/空間知能/3D認識2026/3/1
VLAモデルの空間知能を向上させるため、VGGTによる3D情報をタスク文脈に応じて適応的に融合するプラグアンドプレイモジュール「3D-Mix」を提案し、複数のVLAアーキテクチャとベンチマークで一貫した性能向上を実証した。
- TwinBrainVLA: 非対称Mixture-of-Transformersによる汎用VLMの身体化タスクへの活用VLA2026/1/1
凍結した汎用VLM(左脳)と学習可能な専門家(右脳)を非対称Mixture-of-Transformersで統合し、汎用知識を保ちながら操作タスクを高精度に実行するVLAモデルを提案。
- LangForce: 潜在行動クエリによる視覚言語行動モデルのベイズ分解VLA2026/1/1
視覚言語行動モデルが言語指示を無視して視覚のみに依存する「情報崩壊」問題を、ベイズ分解と潜在行動クエリで解決し、未知環境での汎化性能を向上させた研究。
- PhysBrain:自己中心視点データで視覚言語モデルを身体知能へ橋渡しVLA2025/12/1
人間の自己中心視点動画をスキーマ駆動で身体化監督に変換するパイプラインを提案し、大規模データセットE2E-3Mで訓練した身体化脳PhysBrainがロボット制御のサンプル効率と成功率を向上させることを示した。
- Switching Pushing Skill Combined MPC and Deep Reinforcement Learning for Planar Non-prehensile Manipulation2023/3/1