Qing Li
The Hong Kong Polytechnic University
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HarnessPAI:物理AIのための進化するハーネスVLA2026/9/24
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
- ウェアラブル知能のためのAIスマートグラス:一人称視点センシングからエージェント型パーソナライゼーションまでウェアラブルAI2026/9/17
AIスマートグラスを、一人称視点センシング・リソース制約下の計算・推論・マルチモーダル対話・実応用制約を統合設計するシステム概念として整理し、ハードウェアから応用・評価までを4次元で俯瞰したサーベイ。
- 何を編集できるのか?オープンエンドな戦略発見と感情編集可能性のランドスケープ画像編集2026/7/27
感情画像編集を「どう編集するか」ではなく「何を編集できるか」と捉え直し、画像固有の編集可能領域を発見するマルチエージェントフレームワークEmoScopeを提案。大規模な人間評価で既存手法を上回る性能を示した。
- UniLM-Nav: ゼロショット・ラストマイルナビゲーションのための統合フレームワークナビゲーション2026/7/1
モバイルマニピュレーションにおけるラストマイルナビゲーションを、視点選択・アフォーダンス接地・ベースポーズ推論に分解し、共有のMLLMで解決する統合フレームワークを提案。OVMMベンチマークでSOTAを達成。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- AdaReP: モデルミスマッチ下での適応的再計画によるニューラルワールドモデル予測制御モデル予測制御2026/6/1
ニューラルワールドモデルを用いたMPCの再計画頻度を、予測誤差の蓄積と局所感度に基づいてオンラインで適応させる手法を提案し、計算コストを削減しつつ性能を維持する。
- 仮説グラフ精緻化:カスケード誤差修正を伴う仮説駆動探索による身体化ナビゲーションナビゲーション2026/4/5
本論文は、身体化エージェントのナビゲーションにおいて、フロンティア予測を修正可能な仮説ノードとして依存関係を考慮したグラフメモリに表現し、検証駆動のカスケード修正により誤ったサブグラフを刈り取るフレームワーク「HGR」を提案する。
- インタラクション推論ベンチマーク(COIN):推論と身体化インタラクションの融合ベンチマーク/操作2026/4/1
部分観測下での長期的なインタラクション推論を評価する新しいベンチマークCOINを提案し、ロボット操作タスクにおける既存手法の限界を明らかにした。
- MVR: 強化学習のためのマルチビュー動画報酬整形報酬設計2026/3/2
複数視点の動画と視覚言語モデルを用いて状態の関連性を学習し、タスク報酬とVLMガイダンスを統合する報酬整形フレームワークを提案。静的画像に基づく手法のバイアスを軽減し、複雑な動作を伴うタスクでの性能を向上させる。
- MarketGen: 自動生成される実体化スーパーマーケット環境を備えたスケーラブルなシミュレーションプラットフォームsim2real2025/11/1
スーパーマーケット環境を自動生成するシミュレーションプラットフォームMarketGenを提案し、レジ袋詰めと棚からの商品収集という2つのタスクのベンチマークを構築した。
- センサネットワーク上でのマルチオブジェクト追跡のための分散期待値伝播マルチオブジェクト追跡2025/5/1
複数センサと複数物体の追跡をクラッタ環境で行うため、各センサが局所的に動作しつつモーメント推定を交換する分散期待値伝播アルゴリズムを提案し、Rao-Blackwell化ギブスサンプリングで効率化した。
- FlowDreamer: フローベースの動作表現を用いたロボットマニピュレーションのためのRGB-Dワールドモデルワールドモデル2025/5/1
3Dシーンフローを明示的な動作表現として用い、U-Netと拡散モデルを組み合わせてロボット操作のためのRGB-Dワールドモデルを構築し、映像予測と視覚計画タスクで性能を向上させた。
- MetaScenes: 実世界3Dスキャンからの自動レプリカ生成に向けてsim2real2025/5/1
実世界スキャンから構築した大規模シミュラブル3DシーンデータセットMetaScenesと、アセットを自動置換するマルチモーダル整合モデルScan2Simを提案し、ロボット操作とVLNのベンチマークで有効性を示した。
- Falcon: 部分ノイズ除去による高速視覚運動ポリシーVLA2025/3/1
拡散ポリシーの推論を高速化するため、過去の行動の部分ノイズ除去結果を再利用する学習不要の手法を提案し、性能を維持しつつ2〜7倍の速度向上を実現した。
- EvolvingAgent: 長期タスクのためのカリキュラム自己進化エージェントと継続的世界モデルVLA2025/2/1
人間の介入なしに自己計画・自己制御・自己反省を通じて長期タスクを遂行するエージェントを提案し、LLMとマルチモーダル経験を活用した計画、世界モデルに基づく行動制御、カリキュラム学習による反省機構を統合した。
- 悪意ある挙動車両に対応する自動運転車の無信号交差点意思決定フレームワーク自動運転意思決定2024/9/1
無信号交差点で悪意ある挙動をする車両に対処するため、Q学習に一次心の理論推論を組み込み、安全性を強調する可変重み付け報酬で自動運転車の意思決定を改善する手法を提案し、Prescan/Simulink連成シミュレーションで検証した。
- SYNERGAI: 人間とロボットの協調のための知覚アライメントHuman-Robot Collaboration2024/9/1
3Dシーングラフを介して人間とロボットの知覚のずれをオンライン対話で自動修正し、協調作業を実現するLLMベースのシステムを提案した。
- OmniJARVIS:統合視覚言語行動トークン化によるオープンワールド指示追従エージェントVLA2024/6/27
Minecraftのオープンワールドで、行動軌跡を自己教師あり学習で離散トークン化し、推論・計画・行動を単一のVLAモデルで統合的に実行できるようにした研究。
- 広範囲センシングのための動的ライトセクション3D再構成手法3D再構成2024/3/1
複数のガルバノメータでカメラの視野を切り替えながらレーザ走査を同期させ、高精度かつ広範囲な3D再構成を実現する手法を提案した。
- SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding2024/1/1
- An Embodied Generalist Agent in 3D World2023/11/18
- PoseGAN: A Pose-to-Image Translation Framework for Camera Localization2020/6/1
- A Roadmap-Path Reshaping Algorithm for Real-Time Motion Planning2019/2/1