Hao Chen
The Chinese University of Hong Kong
収録論文 67本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MAD-Guard: 閉じたマルチモーダル鑑識タスクにおける自己回帰生成と直接決定インターフェースの比較統制研究VLA2026/9/27
マルチモーダル基盤モデルがトークン生成すべきか直接決定を出力すべきかを、閉じた鑑識タスクで統制比較し、二値直接ヘッドが遅延を2.6〜7.3倍削減しつつ較正誤差も改善することを示した。
- ManiVid: 改変動画の統合的解釈可能なフォレンジック解析動画フォレンジック2026/9/25
改変動画の検出・改変領域の特定・異常説明を統合的に行うタスクとデータセット、フレームワークを提案。
- Metric-Bench: 屋内シーンにおけるVLMの文脈内空間メトリック推論の探究VLA2026/9/22
画像内の参照物体を手がかりに、カメラ内部パラメータなしでVLMが2Dから3Dへのメトリック推論を行うベンチマークと強化学習微調整手法を提案。
- MEMOBench: ロボット操作のためのプロセスレベルメモリベンチマーク操作2026/9/7
ロボット操作における記憶能力を評価するベンチマークMEMOBenchを提案し、記憶の保存・更新・圧縮をプロセスレベルで計測する。
- 近接3D:センシング多様体上の容量近接による形状復元触覚2026/8/31
曲面状の容量性テキスタイルを形状センサとして用い、その表面を非平面センシング多様体として扱い、容量近接場から物体形状を復元する多視点フィードフォワードモデルを提案した。
- ロボットの世界モデルは本当に行動に従うのか?行動条件付き生成の診断とポリシー学習のための整合世界モデル/行動条件付き生成2026/8/25
ロボットの世界モデルが任意の行動に正しく従うかを評価するベンチマークWorldEchoを導入し、既存モデルが専門家の行動は再現できるが多様な非専門家軌道では失敗することを示した。さらに、行動追従を強化するWorldSyncを提案し、シミュレーションと実機タスクでポリシー改善の信頼性を向上させた。
- シーケンス制約付きロボット組立のための後向きレイアウト探索組立計画2026/8/19
組立順序が決められたロボット組立において、各パーツの初期位置と組立場所を衝突なく計画する問題を扱い、逆順に初期位置を割り当てる後向き探索法を提案した。
- HarvestPoint-ACT: 明示的な対象選択と収穫点条件付けによる遮蔽下でのロボット果実収穫マニピュレーション2026/8/19
果実収穫ロボットの模倣学習において、収穫対象の選択とグリッパを閉じる位置を明示的に知覚し、ポリシーに与えることで、遮蔽下でも高い成功率を達成した。
- 空間記憶エージェント:空間知能のための経験に基づく手順記憶空間推論/VLM/自己進化2026/8/13
凍結されたVLMエージェントが、外部ツールやパラメータ更新なしに、検証可能な空間環境での経験から教訓を抽出・蓄積し、推論時に再利用することで空間推論能力を向上させるフレームワークを提案した。
- R4DSG:長尺一人称ビデオにおけるオブジェクト中心の質問応答のための相対4Dシーングラフメモリビデオ理解/質問応答2026/8/11
長い一人称ビデオから、物体の移動や状態変化などの質問に答えるため、安定したアンカーと動的物体を分離し、アンカー相対の変化として物体状態を記憶する新しいメモリ表現を提案した。
- CoRE-VLA:条件付きエキスパートルーティングによるスケーラブルで堅牢な視覚言語行動モデリングVLA2026/7/1
センサ欠落や多様な構成に頑健なVLAモデルを提案し、センサ可用性とタスク意図に基づく条件付きスパース計算でエキスパートをルーティングする。
- Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーンデータセット2026/7/1
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- LaST-HD: スケーラブルな人間データからロボット操作の物理的推論を学習する操作学習2026/6/1
人間の手のデモンストレーションとロボットのデモンストレーションを共有の潜在推論空間で整列させ、物理ダイナミクスを内部化することで、ロボット操作の学習を改善する新しい手法を提案した論文。
- 混在交通環境における不確実性を考慮した自動運転の動作計画自動運転2026/6/1
自動運転車と人間運転車が混在する環境で、人間の意図予測の不確実性を考慮した安全な動作計画手法UAMPを提案した。
- HORIZON: 回復可能性に基づく物理領域スケーリングのカリキュラム歩行2026/6/1
ロボットポリシーの堅牢性を高めるため、物理領域を段階的に拡張するカリキュラム学習手法HORIZONを提案。回復可能性を制約として、四足歩行タスクで有効性を示した。
- 把持→計画と失敗帰属:正確で汎用的なロボット操作のための閉ループ二段階フレームワークマニピュレーション2026/6/1
把持と動作計画の連携における失敗原因の曖昧さを解消するため、失敗帰属モデルを導入し、診断結果に基づいて把持候補生成と計画の両方を最適化する二段階フレームワークGTP-FAを提案した。シミュレーションと実機実験で、RL、IL、拡散ポリシー、VLAなど様々なベース学習器の成功率を向上させた。
- RescueBench: 具身エージェントは現実世界で命を救えるか?ベンチマーク2026/6/1
捜索救助タスクを4段階のパイプラインとして構成した写真リアルな診断ベンチマークを提案し、既存手法の失敗モードを段階別に分析した。
- 完璧なデモは悪い教師:重要な動作セグメントからのロバストな位置合わせ学習模倣学習2026/6/1
熟練者の滑らかなデモは、精密な位置合わせ動作の重要な瞬間が短時間に圧縮されるため、模倣学習の教師として不十分であることを示し、動作認識を強化する時空間特徴STAIRを提案して性能を向上させた。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- どこを見るべきか:基礎モデルは能動的探索を通じて目標視点に到達できるか?視点制御2026/5/31
エージェントが3D環境内で能動的に視点を調整し、目標画像と一致する観測を得る「目標視点再現」タスクを導入し、ベンチマークTVRBenchを構築。既存モデルの成功率は低く、訓練フレームワークで改善を試みた。
- HarmoWAM: 適応的世界行動モデルによる汎用性と精密操作の調和ロボット制御2026/5/1
世界行動モデル(WAM)の2つのパラダイム間のトレードオフを解消するため、予測と反応の2つの専門家を世界モデルで統合し、適応的ゲーティングで切り替えるエンドツーエンドのWAMを提案した。
- AdaTracker: クロスエンボディメント能動的視覚追跡のための適応的インコンテキストポリシー学習視覚追跡/クロスエンボディメント2026/4/1
多様なロボット形態で動作する統一モデルによる能動的視覚追跡を実現するため、エンボディメント固有の制約を文脈として学習し、未知のロボットへゼロショット適応するフレームワークを提案した。
- LaST-R1: 適応的物理潜在推論によるロボット操作の強化学習強化操作学習2026/4/1
ロボット操作の基盤モデルに対し、潜在推論と行動生成を共同最適化する強化学習フレームワークを提案し、LIBEROベンチマークで99.9%の成功率を達成した。
- 拘束下での遊泳:四足生物模倣推進のための安全強化学習フレームワーク強化学習/遊泳ロボット2026/3/1
四足ロボットの遊泳を、推力を最大化しつつ不安定化力を最小化する制約付き最適化問題として定式化し、PID調整ラグランジュ乗数を用いた安全強化学習手法ACPPO-PIDを提案。模倣学習と実機曳航試験で初期化・調整し、自由遊泳への転移を実証した。
- LLMによるオントロジーと類似性に基づく計画を用いた汎用的なタスク指向物体把持マニピュレーション2026/3/1
視覚認識の意味的特徴に頼らず、LLMで構築したオブジェクト・部品・タスクのオントロジーと点群の幾何解析、既知物体の類似性マッチングにより、多様な物体・タスクに汎化するタスク指向把持を実現した。
- AoE: 身体性AIのための常時オンの一人称視点人間動画収集システムデータ収集2026/2/1
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
- AGILE: エージェント生成による動画からの手と物体のインタラクション再構築マニピュレーション2026/2/1
単眼動画から手と物体の動的なインタラクションを再構築するため、VLMが生成モデルを導いて完全な物体メッシュを合成し、SfMに依存しないアンカー・トラック戦略で物体姿勢を追跡するフレームワークを提案。
- 3DGSNav: アクティブ3Dガウシアンスプラッティングによる視覚言語モデルの物体ナビゲーション推論強化物体ナビゲーション2026/2/1
3DガウシアンスプラッティングをVLMの永続メモリとして組み込み、自由視点レンダリングとCoTプロンプトでゼロショット物体ナビゲーションの空間推論を向上させるフレームワークを提案。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- 一般化球面ニューラル演算子:グリーン関数定式化球面ニューラル演算子2025/12/11
球面グリーン関数に基づくニューラル演算子の設計枠組みを提案し、等変性と不変性を柔軟に調整できるGSNOと階層的アーキテクチャSHNetを開発した。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- DualVLA: 推論と行動の部分的デカップリングによる汎用身体性エージェントの構築VLA2025/11/1
ロボット実演で訓練したVLAモデルにマルチモーダル推論を追加すると行動性能が劣化する「行動退化」を解決するため、二層データ選別と二重教師適応蒸留を提案し、推論能力を保ちつつ行動精度を向上させた。
- StaMo: コンパクトな状態表現による汎化可能なロボット動作の教師なし学習VLA2025/10/1
軽量エンコーダと事前学習済みDiTデコーダで2トークンの圧縮状態表現を教師なし学習し、その差分が潜在行動として機能することを発見。VLAモデルに統合してLIBEROで14.3%、実世界で30%の性能向上を達成。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。
- 実生活の人間活動動画を用いたロボットマニピュレーション向け視覚-言語-行動モデルのスケーラブル事前学習VLA2025/10/1
人間の手の日常動画を自動解析してロボットのVLA学習データに変換し、100万エピソード規模のデータセットでモデルを事前学習することで、未知環境でのゼロショット性能と実機微調整時の成功率・汎化性能を向上させた。
- NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応VLA2025/10/1
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- 織物触覚スキンによる身体性ジェスチャ制御で実現する直感的な人間-ロボットインタラクション触覚2025/9/1
曲面上に貼れる織物型静電容量触覚スキンと軽量な畳み込みトランスフォーマーで14種のジェスチャを高精度認識し、ロボットアーム操作を最大57%高速化するHRIフレームワークを提案。
- 検証可能な報酬による実世界ロボット操作のための強化学習型身体性プランニングVLA2025/9/1
VLMに検証可能な報酬で微調整を施し、自然言語指示から長期的操作計画を生成・検証するフレームワークREVERとモデルRoboFarseerを提案した。
- エンジニアリングAGIへの道:LLMの設計能力を測るベンチマークベンチマーク2025/9/1
9つの工学分野にわたる実践的な設計課題を解かせるベンチマークEngDesignを提案し、LLMのドメイン知識統合や制約下推論、目的指向設計の能力を評価する。
- ODYSSEY: 四足歩行ロボットによるオープンワールドでの長期的移動マニピュレーション移動マニピュレーション2025/8/1
視覚言語モデルによる階層的プランナと全身制御ポリシーを統合し、マニピュレータ搭載四足ロボットが言語指示に基づく長期的な移動操作タスクを遂行できるフレームワークを提案した。
- 単視点物体把持のための多段階類似度アプローチ:マッチング、計画、微調整マニピュレーション2025/7/1
未知物体の単視点把持において、類似した既知物体をデータベースから検索し、その把持知識を転移して模倣的把持を計画し、局所微調整で把持品質を最適化する手法を提案。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- WorldVLA:自己回帰型行動世界モデルへの挑戦VLA2025/6/1
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。
- SpineWave:魚の剛柔脊柱運動学を活用した仿生ロボット遊泳の性能向上仿生ロボット/水中ロボット2025/5/1
魚の脊柱に倣った剛柔遷移構造を持つ仿生ロボット魚を開発し、進化的アルゴリズムで流体力学を最適化して遊泳性能を向上させた。
- 泳ぎを学ぶ:四足ロボットの歩容最適化のためのデータ駆動型LSTM流体力学モデル歩行2025/5/1
四足ロボットの水中遊泳における非定常・非線形な流体力を予測するLSTMモデル(FED-LSTM)を構築し、直進・旋回歩容の最適化に適用して性能向上を実現した。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- 多数接触と大変形に対応した連続体ロボットのリアルタイム準静的FEM高速化連続体ロボット/sim2real2025/3/1
連続体ロボットの大変形・多点接触をリアルタイムにモデル化するため、GPU並列計算と高速化ソルバを組み合わせた準静的有限要素法Acc-FEMを提案し、計算効率と精度の両立を実現した。
- 魔法の瞬間:放射輝度場モデルの微分可能な不確かさ定量化不確かさ定量化2025/3/1
レンダリング方程式の高次モーメントを利用し、放射輝度場の色・深度・意味予測の不確かさを微分可能かつ効率的に計算する手法を提案。次善視点選択や能動的レイサンプリングにも応用可能。
- 大域的から局所的検出と静的から動的計画による密集環境下での移動物体の適応把持マニピュレーション2025/2/1
単一のRGBDカメラを用いて、密集した環境で動く未知物体を把持するため、検出を大域から局所へ、計画を静的から動的へと切り替える手法を提案し、実世界実験で有効性を示した。
- UnrealZoo:身体性AIのためのフォトリアルな仮想世界を拡充sim2real2024/12/1
Unreal Engine上に構築した100以上のフォトリアルな3D仮想世界と多様な操作可能エンティティを提供し、身体性AI研究のためのデータ収集・分散学習・ベンチマーク環境を整備した。
- 視覚基盤モデルとオフラインRLによる身体性視覚追跡の強化VLA2024/4/1
視覚基盤モデルで対象のセグメンテーションマスクを抽出し、オフライン強化学習で方策を訓練することで、実世界ロボットにも転移可能な高精度な視覚追跡を実現した。
- BronchoCopilot: マルチモーダル強化学習による自律型ロボット気管支鏡検査医療ロボティクス2024/3/1
気管支鏡カメラ画像と推定ロボット姿勢を統合したマルチモーダル強化学習エージェントを提案し、自律的な気管支鏡操作を実現した。
- 触れて初めてわかる:意味と物性のマルチモーダルベイズ推論触覚2024/2/1
視覚と触覚の計測から物体の意味カテゴリと摩擦・重さなどの物理特性を同時に確率的に推定し、追加学習なしでベイズ更新できる手法を提案した。
- Robotic Test Tube Rearrangement Using Combined Reinforcement Learning and Motion Planning2024/1/1
- PDiT: Interleaving Perception and Decision-making Transformers for Deep Reinforcement Learning2023/12/1
- Automatically Prepare Training Data for YOLO Using Robotic In-Hand Observation and Synthesis2023/1/1
- Transformer in Transformer as Backbone for Deep Reinforcement Learning2022/12/1
- Category-Association Based Similarity Matching for Novel Object Pick-and-Place Task2022/1/1
- Panoramic annular SLAM with loop closure and global optimization2021/2/1
- Planning to Build Soma Blocks Using a Dual-arm Robot2020/3/1
- Integrating Combined Task and Motion Planning with Compliant Control2020/3/1
- DS-PASS: Detail-Sensitive Panoramic Annular Semantic Segmentation through SwaftNet for Surrounding Sensing2019/9/1
- Combined Task and Motion Planning for a Dual-arm Robot to Use a Suction Cup Tool2019/9/1