Xiaofeng Wang
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GigaBrain-WBC-0.5:環境との相互作用に頑健な全身制御のための行動世界モデル全身制御2026/8/18
ヒューマノイドの全身運動追跡制御において、環境との接触を考慮した行動世界モデルを提案し、不適切なコマンドや外乱に対して頑健な制御を実現した。
- GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリングVLA2026/8/16
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル強化学習/操作2026/7/1
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- Zero2Skill: 自律データ収集・訓練・展開によるロボットスキルのブートストラップマニピュレーション2026/7/1
人間の介入を減らしつつロボット操作スキルを自律的に学習するシステムを提案。修正を記憶して再利用することで、人間の作業時間を大幅に削減し、成功率を向上させた。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- ScoutVLA:オープンワールド具現化質問応答のためのデュアルエキスパートVLAモデルによるUAV中心の能動知覚VLA2026/6/9
UAVが環境を能動的に知覚して質問に答える空中具現化質問応答(EQA)において、証拠探索に必要な微細な視点調整を可能にするベンチマークFG-EQAと、ミツバチのダンスに着想を得たデュアルエキスパート型VLAモデルScoutVLAを提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- DVG-WM: 分離型ビデオ生成によるロボット操作のための効率的身体化世界モデル世界モデル2026/6/1
ビデオ生成を動力学学習と視覚合成に分離することで、高品質な予測を高速に実現する身体化世界モデルを提案した。
- MUSE: 状態推定のマルチモーダル不確実性定量化状態推定2026/5/1
視覚慣性オドメトリの不確実性をリアルタイムで定量化する学習ベースのフレームワークを提案し、Mambaを用いて複数の非同期センサストリームから推定の信頼性を評価する。
- VAG: 身体化データ合成のためのデュアルストリーム動画-行動生成VLA2026/4/1
ロボットの基盤モデル学習用に、動画と行動を同時生成する統一フレームワークVAGを提案。動画と行動の整合性を高め、合成データでポリシーの汎化性能を向上させる。
- DriveDreamer-Policy: 幾何学的基盤を持つ世界行動モデルによる生成と計画の統合自動運転2026/4/1
運転タスク向けに、深度生成・将来ビデオ生成・動作計画を単一アーキテクチャで統合した世界行動モデルを提案し、閉ループ計画と世界生成の両方で高性能を達成した。
- StableIDM: 時空間リファインメントによるマニピュレータ切断下での逆動力学モデルの安定化ロボット学習/逆動力学モデル2026/4/1
ロボットの視覚観測から動作指令を予測する逆動力学モデル(IDM)が、マニピュレータが画像から切れて見える状況で性能劣化する問題に対し、空間的特徴集約と時間的平滑化を組み合わせたフレームワークを提案し、精度と実ロボット成功率を向上させた。
- ViVa: ロボット強化学習のためのビデオ生成価値モデル強化学習2026/4/1
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
- TacMamba: 高速反射と低速VLA推論を橋渡しする触覚履歴圧縮アダプタ触覚/VLA2026/3/1
触覚データの高周波処理と視覚ポリシーの低周波処理のギャップを埋めるため、Mambaベースの触覚履歴圧縮器を導入し、VLAモデルにプラグイン可能な高速触覚融合を実現した。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- π-StepNFT: フローベースVLAのオンライン強化学習における広い空間には細かいステップが必要VLA/強化学習2026/3/1
フローベースの視覚言語行動モデルに対する新しい強化学習フレームワークを提案し、尤度計算や価値ネットワークを不要にして、単一の順伝播でステップごとのガイダンスを提供する。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つVLA2025/12/1
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
- スチュワートプラットフォームのための閉形式CBFに基づく安全制御の設計と実験的検証安全制御2025/12/1
スチュワートプラットフォームの複数制約下での安全制御を、二次計画法を用いずに閉形式で解く手法を提案し、シミュレーションと実機実験で有効性を検証した。
- GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化VLA2025/11/1
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
- VLA-R1:視覚-言語-行動モデルにおける推論能力の強化VLA2025/10/1
検証可能な報酬による強化学習とGRPOを組み合わせ、アフォーダンスや軌道に沿った思考連鎖を学習させることで、VLAモデルの推論と実行精度を高めた研究。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- 低コストスチュワートプラットフォームの非線形推定と制御によるエンドツーエンド設計と検証制御/推定2025/10/1
低コストで6自由度のスチュワートプラットフォームを設計し、フィードバック線形化とLQR、拡張カルマンフィルタを統合して、シミュレーションと実験で軌道追従と状態推定を検証した。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- MimicDreamer: 人間とロボットのデモンストレーションを統合しスケーラブルなVLA学習を実現VLA2025/9/1
人間の操作動画をロボット視点・動作に変換する映像拡散モデルと視点安定化・動作整合技術を組み合わせ、実機ロボットでの少数ショット実行を可能にするVLA学習フレームワークを提案。
- EMMA: 生成的視覚転送による実世界ロボットマニピュレーションの汎化VLA2025/9/1
拡散Transformerでロボット操作動画を生成し、実データと混合してVLAポリシーを訓練することで、未知の視覚環境へのゼロショット汎化を実現した。
- EmbodieDreamer: 身体性ワールドモデリングによるReal2Sim2Real転送の促進sim2real2025/7/1
物理パラメータ最適化と動画拡散モデルでシミュレーションと実世界のギャップを埋め、ロボット政策学習を高精度化するフレームワークを提案。
- タスク・パラメータ・ネクサス:モデルベース制御のためのタスク特化型パラメータ学習モデルベース制御2024/12/1
深層ニューラルネットワークを用いて、任意の追従タスクに対するモデルベース制御器の最適制御パラメータをオンラインで予測する手法を提案し、クアッドロータで未見タスクへの汎化性能を実証した。
- ReconDreamer: オンライン修復による走行シーン再構成のための世界モデル構築sim2real2024/11/1
世界モデルの知識を段階的に統合し、オンライン修復でアーティファクトを抑えることで、車線変更などの大規模な操作を含む走行シーンを高品質に再構成する手法を提案。
- DiffTune-MPC: Closed-Loop Learning for Model Predictive Control2023/12/1
- On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving2023/11/1