Xiaojuan Qi
The University of Hong Kong
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- D$^2$-VLA:長期動的マニピュレーションのための二重記憶・二重周波数視覚言語行動モデルVLA2026/9/28
事前学習済みVLAのKVキャッシュに二重記憶と二重周波数制御を組み込み、動く物体を扱う長期タスクで過去の視覚手がかりを保持しつつ応答できるようにした。
- AnyStep-WAM: 予算整合蒸留と適応推論によるワールドアクションモデルVLA2026/9/27
ワールドアクションモデルのノイズ除去ステップ数をタスクの難易度に応じて適応的に配分し、成功率を維持しつつ計算量を最大85%削減するフレームワークを提案。
- AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーションVLA2026/9/16
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
- 単眼深度推定:進展と機会の包括的サーベイ深度推定2026/9/1
単眼画像からの深度推定の進化を、初期の学習ベース手法から基盤モデル時代まで体系的にレビューし、主要なデータセット、手法の分類、応用、今後の課題を整理したサーベイ論文。
- ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化VLA2026/8/31
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
- OptiGeo: 光学的に困難なシーンにおける身体化知覚のための効率的な単眼幾何学深度推定2026/8/30
透明・反射・鏡面環境での単眼深度推定の信頼性を向上させるため、センサ由来のバイアスを補正する学習フレームワークOptiGeoを提案した。
- 動的特徴正規化によるストリーミング映像の3D幾何安定化3D幾何推定2026/5/25
ストリーミングRGB入力から一貫した3D幾何を推定する際の時間的不安定性を、特徴統計量の変動が原因と特定し、軽量な再帰モジュールDyFNを導入して安定化する手法を提案した。
- 想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行マニピュレーション2026/5/1
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
- AniGen: アニメーション可能な3Dアセット生成のための統一的S^3フィールド3D生成2026/4/9
単一画像から、形状・骨格・スキニングを整合的に生成するアニメーション可能な3Dアセット生成フレームワークを提案した論文。
- MG-Nav: 疎な空間メモリによる二段階スケールの視覚ナビゲーション視覚ナビゲーション2025/11/1
領域ごとに多視点のキーフレームと物体意味を集約した疎な空間メモリグラフを用い、大域的な記憶誘導計画と局所的な幾何制御を組み合わせてゼロショット視覚ナビゲーションを実現した研究。
- ロボット学習のための事前学習済み視覚モデルのデータ中心再検討VLA2025/3/1
ロボット学習用の視覚モデルにおいて、非物体中心データでも物体中心表現を獲得できるSlotMIMを提案し、認識・シーン理解・ロボットタスクで性能を向上させた。
- Bunny-VisionPro:模倣学習のためのリアルタイム両手巧みな遠隔操作遠隔操作2024/7/1
VRヘッドセットと低コスト触覚フィードバックデバイスを用いて、両手巧みな遠隔操作をリアルタイムで実現し、模倣学習の性能を向上させるシステムを提案。