Xinjie Wang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- InstructMove: 指示追従操作のためのテキスト必須ベンチマークVLA/ベンチマーク2026/8/24
視覚的に顕著な物体や唯一の動作候補に頼らず、言語指示にのみ従って正解が決まる「テキスト必須」な操作ベンチマークInstructMoveを提案し、VLAモデルの指示追従能力を診断・改善する。
- EmbodiedGen V2: 具身知能のためのエージェント型・シミュレーション対応3Dワールドエンジンシミュレーション環境生成2026/7/1
シミュレーション対応の3Dアセットを自動で組み立て、操作・ナビゲーションなどのタスク環境を生成できる世界エンジンを提案。生成環境での強化学習により、シミュレーション成功率と実ロボット成功率を大幅に向上させた。
- ManiSplat: 単眼ビデオからの操作軌道合成 - 分離型3Dガウシアンスプラッティングによるアプローチ3D再構成/操作軌道合成2026/6/9
ロボットの単眼ビデオから、ロボット・物体・背景を分離した3Dガウシアン表現を構築し、操作タスクの軌道を合成するフレームワークを提案した。
- HoloAgent-0: 3D空間メモリを備えた統合具現化エージェントフレームワークVLA2026/6/1
言語指示を実行可能なスキルグラフに変換し、3D空間メモリとロボットスキルを統合して実ロボットで閉ループ実行を実現する統一エージェントフレームワークを提案した。
- 生成3D世界によるロボットVLAのSim-to-Real強化学習のスケーリングVLA2026/3/1
生成3Dモデルと言語駆動シーン設計で多様なシミュレーション環境を自動生成し、VLAモデルの強化学習をスケールさせて実世界への転移性能を大幅に向上させた。
- FSR-VLN: 階層的マルチモーダルシーングラフによる視覚言語ナビゲーションの高速・低速推論VLA2025/9/1
階層的マルチモーダルシーングラフと高速・低速推論を組み合わせ、長距離視覚言語ナビゲーションの成功率を向上させつつ応答時間を82%削減し、ヒューマノイドロボットに実装した。
- EmbodiedGen: 身体性知能のための生成的3D世界エンジンsim2real2025/6/1
物理的リアリティと正確なスケールを持つ3Dアセットを低コストで生成し、物理シミュレーションに直接インポート可能な基盤プラットフォームを提案。
- GeoFlow-SLAM:動的脚式ロボティクスのための堅牢な密結合RGBD慣性・脚式オドメトリ融合SLAMSLAM2025/3/1
高速・高頻度動作する脚式ロボット向けに、幾何学的整合性・脚式オドメトリ・デュアルストリームオプティカルフローを統合し、特徴マッチングや姿勢初期化の失敗、テクスチャレス環境での視覚特徴不足を解決する密結合RGBD慣性SLAMを提案。
- ガウシアン物体彫刻: 表面補完を伴う物体合成的ガウシアンスプラッティング3D再構成2024/12/1
3Dガウシアンスプラッティングと単眼幾何事前分布を組み合わせ、遮蔽領域の表面をゼロショットで補完しながら物体単位で編集可能な3Dシーン再構成を実現した研究。