Jiahang Cao
Nanyang Technological University
収録論文 38本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚言語行動ポリシーのためのアドバンテージ誘導事後学習の分解VLA2026/9/23
視覚言語行動ポリシーの事後学習において、アドバンテージ誘導強化学習の設計選択を分解し、段階的評価で有効なモジュール式レシピを特定した。
- ゲームプレイから方策へ:ゲーム化されたロボット不要のインタラクションによるスケーラブルなロボットデータ収集VLA2026/9/16
VRゲームで人間の操作データを収集し、ロボットに転移する枠組みを提案。ゲームから実機へのギャップを埋めるGame2Policyにより、少数の実機デモで成功率が向上することを示した。
- 機能を保つデータ生成によるゼロショット実機-シミュレーション-実機マニピュレーションsim2real2026/9/16
接触を伴うタスクで形状を多様化しても機能的な接触面を保つメッシュ変形により、実機データなしでゼロショットの実機-シミュレーション-実機マニピュレーションを実現する手法を提案。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- Tac4Loco: ヒューマノイド歩行のための時空間足底圧表現の学習歩行2026/8/16
ヒューマノイドロボットの歩行制御において、足底圧力の空間的トポロジーを保持した表現を学習し、シミュレーションと実機のセンサ信号を共通の観測空間にマッピングすることで、不整地での適応的な歩行を実現するフレームワークを提案した。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- GenHOI: タスク固有の訓練なしに生成ビデオを模倣する接触を考慮したヒューマノイドと物体のインタラクションヒューマノイド操作2026/6/1
生成ビデオを模倣することで、タスク固有の訓練や物理デモデータなしに、ヒューマノイドロボットが多様な物体操作タスクをゼロショットで実行できるフレームワークを提案した。
- FT-WBC: 脚式移動マニピュレーションのための耐故障全身制御の学習全身制御/耐故障/脚式移動マニピュレーション2026/6/1
脚式移動マニピュレータのアクチュエータ故障時に、全身の安定性とアームの可動域を両立する耐故障制御フレームワークFT-WBCを提案した。故障推定器と姿勢適応モジュールにより、故障を予測し姿勢計画を適応させることで、シミュレーションと実機で生存率と可動域を向上させた。
- GeoSem-WAM: 幾何・意味を考慮した世界行動モデルVLA2026/6/1
将来のRGB予測に加えて、幾何と意味の予測を補助タスクとして導入し、ロボットの行動決定に有効な潜在表現を学習する世界モデルを提案した。
- ロボット操作のための効率的な視覚表現を学習する構造的潜在点視覚表現学習2026/5/1
3D認識と操作のための事前学習フレームワークを提案し、点群オートエンコーダの潜在空間に点単位の変分オートエンコーダを挿入して、暗黙的表現の表現力と明示的表現の構造的先行知識を組み合わせたハイブリッド表現「構造的潜在点」を学習する。
- AttenA+: ロボット基盤モデルにおける行動の不平等性の是正VLA2026/5/1
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
- MoSA: 運動制約付き応力適応による連続体力学の実機-シミュレーションギャップ緩和 - 残差異方性学習を通じて物理シミュレーション/ロボット操作2026/5/1
実世界の連続体の動力学を視覚観測から学習する際、等方性モデルを物理事前知識として使い、残差応力演算子を学習して軽度の異方性・不均一性を捉えることで、実機とシミュレーションのギャップをさらに縮小するフレームワークを提案した。
- Heracles: 精密追従と生成的合成を橋渡しする汎用人型制御人型制御2026/3/1
人型ロボットの汎用制御において、厳密な参照追従と生成的な適応を統合する拡散モデルベースの中間層を提案し、外乱に対する頑健性と自然な回復動作を実現した。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- 物理整合的な物体間推論による高密度クラッタ環境のReal-to-Simsim2real2026/2/1
単視点RGB-D画像から、接触グラフと微分可能剛体シミュレーションを用いて物理的に整合した3Dシーンを再構成し、接触の多いマニピュレーションを可能にする手法を提案。
- ニューラル配置空間距離場による移動マニピュレータの高速かつ安全な軌道最適化マニピュレーション2026/1/1
移動マニピュレータの全身衝突回避を配置空間で直接モデル化するGCDFを提案し、GPUバッチ処理可能なニューラル距離場と逐次凸最適化により高速・安全な軌道生成を実現した。
- ポリシーを合成せよ!テスト時分布レベル合成による拡散・フローベースロボットポリシーの改善VLA2025/10/1
複数の事前学習済みロボットポリシーの分布スコアを凸結合しテスト時探索で合成する訓練不要手法GPCを提案し、単一ポリシーを超える性能を実現した。
- DPL: 実環境に即した深度合成とクロスアテンション地形再構成による深度のみの知覚型ヒューマノイド歩行歩行2025/10/1
ノイズの多い深度画像から地形を再構成するクロスアテンショントランスフォーマと、自己遮蔽を考慮したリアルな深度画像合成手法を組み合わせ、深度センサのみで多様な地形を歩行できるヒューマノイドの学習フレームワークを提案した。
- ManiVID-3D: 分離された3D表現による視点不変なロボットマニピュレーションのための汎化可能な強化学習マニピュレーション2025/9/1
カメラ視点が変わっても頑健に動作するロボットマニピュレーションのための3D強化学習手法を提案し、視点変化下で成功率を大幅に向上させた。
- LOVON: 脚式ロボットのためのオープン語彙物体ナビゲータナビゲーション2025/7/1
大規模言語モデルによる階層的タスク計画とオープン語彙の視覚検出を統合し、動的で非構造化環境での長距離物体ナビゲーションを実現するフレームワークを提案。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- LiPS: 直並列構造を持つヒューマノイドロボットの大規模強化学習sim2real2025/3/1
閉ループの直並列機構をシミュレーションで直接モデル化することで、ヒューマノイドロボットの強化学習を大規模並列環境で訓練可能にする手法LiPSを提案する。
- ES-Parkour: 生体模倣イベントカメラとスパイキングニューラルネットワークによる高度なロボットパルクール歩行2025/3/1
イベントカメラとスパイキングニューラルネットワーク(SNN)を組み合わせ、四足ロボットのパルクールを従来のANNベース手法より88.3%少ない消費電力で実現した研究。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- Trinity: モジュール型ヒューマノイドロボットAIシステムヒューマノイド/VLA2025/3/1
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
- 推論時の分布レベル合成によるモダリティ合成可能な拡散ポリシーVLA2025/3/1
個別の視覚モダリティで事前学習済みの拡散ポリシーを追加学習なしに分布スコアのレベルで合成し、より表現力の高いポリシーを実現する手法を提案した。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- RoboDexVLM:視覚言語モデルによる巧みなロボット操作のためのタスク計画と運動制御VLA2025/3/1
視覚言語モデルを活用し、多様な物体を把持できる巧みなハンドを持つ協働マニピュレータ向けに、自然言語コマンドで長期的タスクを計画・実行するフレームワークを提案した。
- 蒸留PPO:ヒューマノイド知覚歩行のための新たな二段階強化学習フレームワーク歩行2025/3/1
完全観測MDPで教師方策を学習し、その知識で生徒方策を正則化・監督する二段階の知覚歩行フレームワークを提案した論文。
- PALo: 四足歩行ロボットの姿勢認識型移動制御の学習歩行2025/3/1
四足歩行ロボットの速度追従に加え、体高やピッチ・ロール角をリアルタイムに調整できる姿勢認識型の移動制御を、深層強化学習で実現し実機へ転移した研究。
- RHINO: 人間のデモンストレーションからリアルタイムなヒューマノイド-人間-物体インタラクションを学習ヒューマノイド/インタラクション2025/2/1
人間の指示や動作にリアルタイムで反応し、割り込みにも即応できるヒューマノイドロボットのための階層的学習フレームワークRHINOを提案。人間の意図を推定する高レベルプランナと反応動作・物体操作を実行する低レベルコントローラで構成される。
- E2H:非侵襲的脳波信号によるヒューマノイド全身制御フレームワークBCI/ヒューマノイド制御2024/10/1
非侵襲的な脳波(EEG)から動作キーワードを解読し、LLMによる動作生成と模倣制御ポリシーを組み合わせてヒューマノイドロボットを全身制御する2段階フレームワークを提案した。
- LoopSR: 脚式ロボットの生涯ポリシー適応のためのSim-and-Realループsim2real2024/9/1
実世界の軌道からデジタルツインを再構築し、シミュレーションでの継続学習を通じて脚式ロボットのポリシーを展開後も適応させ続けるフレームワークを提案。
- Mambaポリシー:ハイブリッド選択的状態モデルによる効率的な3D拡散ポリシーマニピュレーション2024/9/1
拡散モデルベースの3Dマニピュレーションポリシーを、MambaとAttentionを組み合わせた軽量なXMambaブロックで置き換え、パラメータ数を80%以上削減しつつ性能を向上させた研究。
- 世界モデルに基づく知覚による視覚的脚式移動歩行2024/9/1
環境の世界モデルを構築し、それを用いて視覚入力から直接脚式ロボットの制御方策を学習する手法を提案。シミュレーションで訓練しながら実世界でも正確な予測が可能で、従来手法より高い走破性と頑健性を示した。
- Fully Spiking Neural Network for Legged Robots2023/10/1
- Chasing Day and Night: Towards Robust and Efficient All-Day Object Detection Guided by an Event Camera2023/9/1