Baoxiong Jia
BIGAI
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 不整地での脚式移動のための軌跡レベル自動カリキュラム学習歩行2026/8/17
不整地での脚式移動ポリシー学習において、地形マップから直接タスクを生成する軌跡レベルの自動カリキュラム学習フレームワークを提案し、成功率を大幅に向上させた。
- 人間レベルの巧みな遠隔操作を目指して遠隔操作2026/7/1
手と物体の同時追跡制御を用いて、人間の操作意図を学習済みの接触実行にマッピングし、物体の回転や長時間の道具使用など7つの難易度の高い遠隔操作タスクで高い成功率を達成した。
- LARA: 視覚言語行動モデルのための潜在行動表現の整合VLA2026/6/1
本論文は、視覚言語行動モデルと潜在行動モデルを同時に最適化するプラグアンドプレイフレームワークを提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- ESPIRE: 視覚言語モデルの身体化空間推論のための診断ベンチマークVLA/ベンチマーク2026/3/1
視覚言語モデルの空間推論能力を身体化ロボットタスクで評価する診断ベンチマークを提案し、タスクを位置特定と実行に分解して生成問題として扱うことで、受動的な空間推論を超えた分析を可能にした。
- OmniClone: 頑健で万能な全身ヒューマノイド遠隔操作システムの構築遠隔操作2026/3/1
全身ヒューマノイド遠隔操作システムOmniCloneを提案し、診断ベンチマークOmniBenchを用いて従来手法の弱点を特定し、データレシピとシステム改良によりMPJPEを66%以上削減し、計算資源を大幅に削減した。
- OmniTrack: 物理的に整合した参照動作による汎用モーショントラッキングモーショントラッキング2026/2/1
人間の動作データをロボットで追従させる際、体格差やノイズによる物理的に不可能な参照動作を、シミュレーション上の特権方策で実行可能な動作に変換してから追従方策を学習する枠組みを提案。実機で長時間安定した追従やアクロバティック動作を実現。
- LessMimic: 統一距離場表現による長期的ヒューマノイドインタラクションヒューマノイド2026/2/1
距離場(DF)を統一表現として用い、参照動作なしで物体形状に汎化し、長期的な全身インタラクションを単一ポリシーで実現する手法を提案。
- OmniXtreme:高ダイナミックヒューマノイド制御における汎用性の壁を突破ヒューマノイド制御2026/2/1
多様なモーションの学習と実機向けの物理的調整を分離したフレームワークを提案し、ヒューマノイドが多様で高難度な動きを実機で高精度に追従できるようにした。
- 人間とヒューマノイドの協調による協働物体運搬の学習協働マニピュレーション2025/10/1
固有感覚のみを用いた強化学習で、リーダーとフォロワーの行動を単一ポリシーに統合し、人間とヒューマノイドが協調して物体を運ぶ手法を提案。シミュレーションと実機実験で有効性を検証した。
- SceneWeaver: 拡張可能な自己反省型エージェントによるオールインワン3Dシーン合成3Dシーン生成2025/9/1
言語モデルベースのプランナーが多様なシーン生成ツールを選択し、自己評価と反復的な改善を通じて物理的・視覚的・意味的に整合した3D屋内シーンを合成するフレームワークを提案。
- VideoArtGS: 単眼動画から関節物体のデジタルツインを構築3D再構成2025/9/1
単眼動画から関節物体の形状・部位分割・関節パラメータを同時に復元し、高精度なデジタルツインを構築する手法を提案。
- GWM: ロボットマニピュレーションのためのスケーラブルなガウス世界モデルマニピュレーション2025/8/1
ロボット操作のためのガウス世界モデル(GWM)を提案し、ガウスプリミティブの伝播を予測して将来状態を再構成することで、模倣学習とモデルベース強化学習を支援する。
- MetaScenes: 実世界3Dスキャンからの自動レプリカ生成に向けてsim2real2025/5/1
実世界スキャンから構築した大規模シミュラブル3DシーンデータセットMetaScenesと、アセットを自動置換するマルチモーダル整合モデルScan2Simを提案し、ロボット操作とVLNのベンチマークで有効性を示した。
- 脚式ロコマニピュレーションにおける位置・力制御の統合ポリシー学習ロコマニピュレーション2025/5/1
力センサーなしで位置と力の制御を統合的に学習する脚式ロボット向けポリシーを提案し、四足マニピュレータとヒューマノイドで接触を伴う操作タスクの成功率を約39.5%向上させた。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- ArtGS: ガウシアンスプラッティングによる複雑な関節物体の操作可能なレプリカ構築3D再構成/関節物体2025/2/1
3Dガウシアンを用いて複数パーツの関節物体を異なる状態間で統合し、パーツメッシュ再構成と関節パラメータ推定を高精度・高効率で行う手法を提案。
- 3Dシーンにおけるマルチモーダル状況推論VLA2024/9/1
3Dシーン内の状況理解のための大規模マルチモーダル質問応答データセットMSQAとナビゲーション評価ベンチマークMSNNを提案し、既存モデルの限界とマルチモーダル入力の重要性を示した。
- SlotLifter: スロット誘導特徴リフティングによるオブジェクト中心放射輝度場の学習オブジェクト中心学習/3D再構成2024/8/1
スロット誘導特徴リフティングを用いて、3Dシーンの再構成とオブジェクト分解を同時に行うオブジェクト中心の放射輝度モデルを提案し、合成・実世界データセットで高い性能を示した。
- PhysPart: 操作可能物体の物理的に妥当な部品補完3D生成2024/8/1
操作可能な物体の欠けた部品を、形状だけでなく物理的な安定性と可動性を考慮して拡散モデルで生成する手法を提案。
- PhyScene: 身体性AIのための物理的に操作可能な3Dシーン合成シーン生成2024/4/1
拡散モデルと物理・操作可能性に基づくガイダンスを組み合わせ、身体性エージェントが実際に操作できる3D屋内シーンを生成する手法を提案。
- GPT-4Vを用いた閉ループ型オープンボキャブラリ移動マニピュレーションVLA2024/4/1
GPT-4Vを活用し、未知環境での物体探索と操作を閉ループで行うロボットシステムを提案。実世界の8タスクで成功率を約35%向上させた。
- SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding2024/1/1
- An Embodied Generalist Agent in 3D World2023/11/18
- ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes2023/4/1