Jiaxu Wang
The Chinese University of Hong Kong
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ECHO: 手首装着イベントカメラによる過去と未来の文脈を統合したマニピュレーションマニピュレーション2026/9/28
手首装着イベントカメラの観測を圧縮表現に符号化し、過去の把持軌跡と未来のイベント予測を組み合わせて操作方策を学習する手法を提案。露出変動に強く、RLBenchと実機でRGBベースラインを上回る。
- AR-WAM: 視覚条件付きエージェント対応ワールドアクションモデルによるロボットマニピュレーションVLA2026/9/20
言語指示の代わりにバウンディングボックスと操作トークンで条件付けする0.5Bパラメータの世界行動モデルを提案し、エージェント駆動のロボット制御を実現した。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデルVLA2026/8/17
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
- τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデルVLA/世界モデル2026/6/1
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
- MoSA: 運動制約付き応力適応による連続体力学の実機-シミュレーションギャップ緩和 - 残差異方性学習を通じて物理シミュレーション/ロボット操作2026/5/1
実世界の連続体の動力学を視覚観測から学習する際、等方性モデルを物理事前知識として使い、残差応力演算子を学習して軽度の異方性・不均一性を捉えることで、実機とシミュレーションのギャップをさらに縮小するフレームワークを提案した。
- ロボット操作のための効率的な視覚表現を学習する構造的潜在点視覚表現学習2026/5/1
3D認識と操作のための事前学習フレームワークを提案し、点群オートエンコーダの潜在空間に点単位の変分オートエンコーダを挿入して、暗黙的表現の表現力と明示的表現の構造的先行知識を組み合わせたハイブリッド表現「構造的潜在点」を学習する。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- DPL: 実環境に即した深度合成とクロスアテンション地形再構成による深度のみの知覚型ヒューマノイド歩行歩行2025/10/1
ノイズの多い深度画像から地形を再構成するクロスアテンショントランスフォーマと、自己遮蔽を考慮したリアルな深度画像合成手法を組み合わせ、深度センサのみで多様な地形を歩行できるヒューマノイドの学習フレームワークを提案した。
- ポリシーを合成せよ!テスト時分布レベル合成による拡散・フローベースロボットポリシーの改善VLA2025/10/1
複数の事前学習済みロボットポリシーの分布スコアを凸結合しテスト時探索で合成する訓練不要手法GPCを提案し、単一ポリシーを超える性能を実現した。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- LiPS: 直並列構造を持つヒューマノイドロボットの大規模強化学習sim2real2025/3/1
閉ループの直並列機構をシミュレーションで直接モデル化することで、ヒューマノイドロボットの強化学習を大規模並列環境で訓練可能にする手法LiPSを提案する。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- Trinity: モジュール型ヒューマノイドロボットAIシステムヒューマノイド/VLA2025/3/1
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
- 推論時の分布レベル合成によるモダリティ合成可能な拡散ポリシーVLA2025/3/1
個別の視覚モダリティで事前学習済みの拡散ポリシーを追加学習なしに分布スコアのレベルで合成し、より表現力の高いポリシーを実現する手法を提案した。
- 蒸留PPO:ヒューマノイド知覚歩行のための新たな二段階強化学習フレームワーク歩行2025/3/1
完全観測MDPで教師方策を学習し、その知識で生徒方策を正則化・監督する二段階の知覚歩行フレームワークを提案した論文。
- E2H:非侵襲的脳波信号によるヒューマノイド全身制御フレームワークBCI/ヒューマノイド制御2024/10/1
非侵襲的な脳波(EEG)から動作キーワードを解読し、LLMによる動作生成と模倣制御ポリシーを組み合わせてヒューマノイドロボットを全身制御する2段階フレームワークを提案した。
- Mambaポリシー:ハイブリッド選択的状態モデルによる効率的な3D拡散ポリシーマニピュレーション2024/9/1
拡散モデルベースの3Dマニピュレーションポリシーを、MambaとAttentionを組み合わせた軽量なXMambaブロックで置き換え、パラメータ数を80%以上削減しつつ性能を向上させた研究。
- 強化学習のためのクエリベース意味論的ガウシアンフィールドによるシーン表現シーン表現/強化学習2024/6/1
3Dガウシアンスプラッティングと階層的意味論エンコーディングを組み合わせ、強化学習エージェントのための効率的で意味情報を保持したシーン表現を学習する手法を提案。
- Physical Priors Augmented Event-Based 3D Reconstruction2024/1/1
- Chasing Day and Night: Towards Robust and Efficient All-Day Object Detection Guided by an Event Camera2023/9/1