Yi Wang
The Hong Kong Polytechnic University
収録論文 49本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 部分的な視覚観測による全身空中把持と持ち上げ空中マニピュレーション2026/9/30
強化学習の教師-生徒フレームワークを用いて、部分的な視覚情報から飛行・アーム・グリッパを統合制御し、空中での把持と持ち上げを実現した研究。
- 局所全身VLA行動からシーン規模の空中マニピュレーションへ空中マニピュレーション2026/9/30
関節型無人航空マニピュレータ向けに、合成データでVLAを訓練し、遅延に頑健な行動実現とシーングラフによる指示接地でシーン規模の空中作業を可能にする統合フレームワークを提案。
- QuadHand:MRC-SDFを用いた全身運動計画によるコンパクトなクアッドロータ空中マニピュレータ空中マニピュレーション2026/9/28
3自由度アームと重心補償機構を備えた小型ドローンの空中マニピュレータを開発し、細部を保ちつつ計算可能なSDF表現と時空間全身軌道最適化で複雑環境での安全な操作を実現した。
- ウェアラブル知能のためのAIスマートグラス:一人称視点センシングからエージェント型パーソナライゼーションまでウェアラブルAI2026/9/17
AIスマートグラスを、一人称視点センシング・リソース制約下の計算・推論・マルチモーダル対話・実応用制約を統合設計するシステム概念として整理し、ハードウェアから応用・評価までを4次元で俯瞰したサーベイ。
- DuctAM: ダクトファン支援型クアッドロータ空中マニピュレータによる高推力プッシュ・プル操作空中マニピュレーション2026/9/14
クアッドロータの操作軸にダクトファンを2基追加し、姿勢変化を抑えつつ水平方向の推力を高めて、カート押し・扉閉め・引き出し開けなどのプッシュ・プル作業を安定して行えるようにした空中マニピュレータ。
- SeqAlign3DVG: シーケンス整合ベンチマークとボクセル推論フレームワークによる3D視覚的グラウンディング3D視覚的グラウンディング2026/8/31
時間順序と観測整合性を備えた画像ベース3D視覚的グラウンディングの新しいベンチマークと、ボクセルメモリと段階的融合を用いた推論フレームワークを提案した。
- ViTaR: 基盤VLA操作のための視触覚残差適応VLA/触覚/操作2026/8/16
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
- 音声視覚ナビゲーションのためのハイブリッドMambaナビゲーション2026/7/14
従来のCNNやRNNに代わり、Mambaベースのエンコーダを用いて音声と視覚の動的マルチモーダル系列を効率的に表現し、ナビゲーション成功率を大幅に向上させた。
- スケッチ事前情報から軌道へ:屋内UAV群のためのミッション指向協調ナビゲーションフレームワーク群制御2026/7/1
屋内点検や警備などのミッション指向タスクにおいて、スケッチマップの事前情報を活用し、2Dガイド経路と3D軌道最適化を組み合わせたUAV群の協調ナビゲーションフレームワークを提案した。
- 力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速VLA/力覚/接触操作2026/7/1
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
- 任意形状の中継面を用いた3Dガウシアン過渡レンダリングによる非視線計測非視線計測2026/6/19
平面壁や密なサンプリングを仮定せず、任意形状の中継面からの測定データを用いて隠れたシーンを3Dガウシアンで表現し、微分可能な過渡レンダリングで直接再構成する手法を提案。実データで最先端の精度を達成した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- 空間複雑性の分解:LLMの空間推論のための階層的分解空間推論2026/5/27
LLMの空間推論能力を向上させるため、複雑なタスクを階層的に分解する手法と、MCTS誘導のグループ相対方策最適化(M-GRPO)を提案し、ナビゲーションや計画などの空間タスクで最先端の性能を達成した。
- 材料認識型ハミルトンリスク場による安全ナビゲーションの学習ナビゲーション2026/5/1
ポート・ハミルトンナビゲーションに文脈エネルギー項を追加し、局所リスク場に応じて回避動作を選択的に活性化・抑制する安全ナビゲーション手法を提案した。
- 配備しながら学習:汎用ロボットポリシーのためのフリート規模強化学習強化学習/VLA2026/5/1
事前学習済みのVLAポリシーを、ロボットフリートからの実データで継続的に強化学習し、配備中に性能を向上させるフレームワークを提案。16台の二腕ロボットで95%の成功率を達成。
- FU-MPC:モーター駆動LiDARを用いた効率的かつ高精度なUAV探査のためのフロンティア・不確実性考慮モデル予測制御探査/制御2026/5/1
未知環境でのUAV探査効率と自己位置推定精度を両立するため、独立駆動の回転LiDARを搭載し、飛行軌道に沿ってLiDARの回転を最適化する階層的探査フレームワークを提案した。
- SEDualVLN: 空間強化デュアルシステムによる視覚言語ナビゲーション視覚言語ナビゲーション2026/5/1
視覚言語ナビゲーションの性能を高めるため、空間認識を強化した2つのシステム(VLMとMLLM)を組み合わせたフレームワークを提案し、VLN-CEベンチマークで最高性能を達成した。
- EARL: 一人称視点インタラクション推論とピクセル接地のための解析誘導型強化学習フレームワークVLA2026/5/1
一人称視点映像から人間と環境のインタラクションを理解し、テキスト回答とピクセル単位のマスクを生成する強化学習フレームワークを提案した。
- MASS: メッシュ整合楕円変形可能サーフェルスプラッティングによる自己中心視単眼ビデオからの手の再構築とレンダリング手の再構築/レンダリング2026/4/1
自己中心視の単眼ビデオから高精細な3D手を再構築するため、変形可能な2Dガウシアンサーフェル表現を用いた新しい手法を提案し、メッシュ整合楕円とフラクタル密度化によるメッシュからサーフェルへの変換、およびサーフェル変形と不透明度マスクによる効率的なモデリングを実現した。
- 厳密な終了条件を備えた双方向ヒューリスティック探索による最適運動力学経路計画経路計画2026/4/1
双方向ヒューリスティック探索と厳密な終了条件を統合した、漸近最適な運動力学サンプリングベース経路計画アルゴリズムBTIT*を提案し、既存手法より高速な初期解と収束性を実証した。
- AERR-Nav: ゼロショット物体ナビゲーションのための適応的探索・回復・回想戦略ナビゲーション2026/3/1
未知の多階建て環境でのゼロショット物体ナビゲーションを改善するため、ロボットの状態を動的に切り替える適応的戦略と、高速・低速思考モードを備えた探索状態を提案した。
- RoboPocket: スマホでロボットポリシーを即座に改善模倣学習2026/3/1
スマートフォンとARを用いて、物理ロボットを使わずに模倣学習のデータ収集を効率化し、ポリシーを即時改善するシステムを提案した論文。
- NS-VLA:神経記号型視覚言語行動モデルVLA2026/3/1
視覚・言語特徴から記号的にプリミティブを抽出し、オンライン強化学習で行動系列を生成する神経記号型VLAフレームワークを提案。少データ・摂動環境で高精度かつゼロショット汎化を示す。
- バックドアが部分観測性と出会うとき:実世界強化学習への攻撃強化学習セキュリティ2026/1/1
実世界の強化学習ではLiDARやオドメトリなど制御不能な補助状態が混在するため、条件付き拡散で確率的トリガー分布を学習し、視覚パッチによるバックドア攻撃を安定して発動させる手法を提案した。
- GRL-SNAM: 未知環境における経路微分ハミルトニアンを用いた幾何学的強化学習による同時ナビゲーションとマッピングナビゲーション2026/1/1
未知環境で地図を事前に持たずに、局所的なセンサ情報のみから経路探索と地図構築を同時に行う強化学習フレームワークを提案。ハミルトニアン最適化によりセンサ入力を局所的なエネルギー地形に変換し、適応的に経路を更新する。
- 音声視覚ナビゲーションのための残差クロスモーダル融合ネットワーク音声視覚ナビゲーション2026/1/1
音声と視覚の双方向残差融合により、異種モダリティ間の相補的な統合と微細な位置合わせを実現し、未知環境での音源探索性能とクロスドメイン汎化を向上させた研究。
- SOP:視覚-言語-行動モデルのためのスケーラブルなオンライン事後学習システムVLA2026/1/1
ロボット群が実世界で収集した経験と人間の介入をクラウド上の学習器に非同期で送り、更新された方策を即座に受け取るオンライン分散事後学習システムを提案。布畳みや箱組立などのタスクで大規模VLAモデルの性能を数時間で大幅に向上させる。
- ImplicitRDP: 構造的スローファスト学習による視覚-力覚拡散ポリシーVLA2025/12/1
視覚と力覚を単一ネットワークで統合し、非同期トークンを因果注意で処理する拡散ポリシーを提案。接触の多い操作タスクで高い反応性と成功率を実現した。
- ロボット収穫のためのライチ検出と成熟度分類のRGB-D画像データセット農業ロボティクス2025/10/1
多様な天候・時間帯・品種で撮影したライチのRGB-D画像11,414枚を収集し、検出と成熟度分類のアノテーションを付与したオープンデータセットを構築した。
- ロボット知覚と遠隔操作計画のためのオープン語彙時空間シーングラフVLA2025/9/1
自然言語による遠隔操作で生じる通信遅延による状態のずれを解消するため、LVLMを用いてオープン語彙の3D物体表現を時間方向に拡張し、遅延タグを付与した時空間シーングラフを構築する手法を提案した。
- 深層学習による網膜静脈カニュレーション自律システム:ニワトリ胚モデルでの検証医療ロボティクス2025/7/1
深層学習とOCT画像を用いて針の位置・接触・穿刺をリアルタイム認識し、網膜静脈カニュレーションを自律的に行うロボットシステムを開発し、ニワトリ胚モデルで有効性を示した。
- 重要解剖構造を保持する地形拡張ナビゲーション(CAPTAiN):椎弓切除術教育への応用手術ナビゲーション2025/6/1
脊椎ドリル手術中に層状の色分けボクセルガイダンスを提供するナビゲーションシステムCAPTAiNを開発し、仮想椎弓切除術で未熟な術者の成績と認知負荷を改善することを示した。
- ミリ波レーダ支援によるマルチビークル知覚融合の改善協調知覚2025/6/1
ミリ波レーダの点群を用いて、車両間で知覚データをリアルタイムかつ高精度に位置合わせ・融合する軽量システムMMatchを提案。
- Genie Centurion:人間による巻き戻し・修正ガイダンスで実世界ロボット訓練を加速VLA2025/5/1
失敗時に状態を巻き戻して人間が修正デモを行い、1人の操作者が複数ロボットを監督できるデータ収集手法を提案し、従来法より成功率を最大40%向上させた。
- OccProphet: カメラのみの4D占有予測の効率限界を押し広げるObserver-Forecaster-Refinerフレームワーク4D占有予測2025/2/1
カメラ画像のみから将来の3D占有状態を予測する4D占有予測において、Observer・Forecaster・Refinerの3軽量コンポーネントで計算コストを大幅に削減しつつ精度を向上させたフレームワークを提案。
- 双方向ガイダンスヒューリスティックを用いた漸近最適サンプリングベース経路計画経路計画2024/12/1
双方向ヒューリスティック探索と遅延戦略を組み合わせ、暗黙的な双方向運動木を構築することで探索領域を効率的に絞り込み、漸近最適な経路計画を実現するBIGIT*を提案した。
- 物体中心ロボットマニピュレーションのための身体性学習に関するサーベイマニピュレーション2024/8/1
物体中心のロボットマニピュレーションにおける身体性学習の最新研究を、知覚学習・方策学習・タスク指向学習の3つに分類して整理し、データセットや評価指標、課題と今後の方向性をまとめたサーベイ論文。
- EKFとMHEによる脚式ロボット移動のための高速分散状態推定状態推定2024/5/1
脚式ロボットの浮遊ベース状態推定を、姿勢はEKF、線形速度はMHEに分散し、200Hzで動作する高速推定フレームワークを提案した。
- 自動運転における占有知覚のサーベイ:情報融合の観点から占有知覚2024/5/1
自動運転向けの3D占有知覚について、入力モダリティごとの手法や情報融合技術、学習法、データセット上の性能を体系的に整理したサーベイ。
- Enabling Mammography with Co-Robotic Ultrasound2023/12/1
- Terrestrial Locomotion of PogoX: From Hardware Design to Energy Shaping and Step-to-step Dynamics Based Control2023/9/1
- Scene Graph for Embodied Exploration in Cluttered Scenario2022/7/1
- 1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)2022/6/1
- Learning Ultrasound Scanning Skills from Human Demonstrations2021/11/1
- Learning Friction Model for Magnet-actuated Tethered Capsule Robot2021/9/1
- Audio-Visual Grounding Referring Expression for Robotic Manipulation2021/9/1
- Learning Friction Model for Tethered Capsule Robot2021/8/1
- Tensity Research Based on the Information of Eye Movement2014/9/1