Hui Xiong
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Talk2Sensors: センサ適応型物理的手がかりマッチングによる自動運転の3D視覚グラウンディング3D視覚グラウンディング/自動運転/マルチセンサ2026/8/5
カメラ・LiDAR・4Dレーダーのマルチセンサデータを用いた自動運転向け3D視覚グラウンディングのデータセットと、言語クエリに応じてセンサ情報を動的に統合するTransformerベースのフレームワークを提案した。
- 抑制は効くが局所性は脆い:VLAポリシーにおけるタスクベクトル否定の閉ループ標的・制御監査VLA2026/8/1
マルチタスクの視覚言語行動(VLA)ポリシーからタスクベクトルを引き算したときの挙動を、全10スキルで監査し、抑制可能・抵抗・全崩壊の3つの様式があることを示した。
- フローマッチング不確実性の幾何学:コスト不要の不確実性プロキシとフローベースVLA故障検出への応用VLA2026/7/30
フローマッチング生成モデルの不確実性を速度場の幾何学的性質から捉え、追加コストなしで計算できる不確実性プロキシ(denoising acceleration)を提案し、オンライン故障検出に応用した。
- 介入可能なマルチモーダル模倣のためのソースリフトフローマッチング模倣学習2026/7/1
フローマッチングポリシーに介入可能なハンドルを導入し、ユーザーが同じ状態から複数の有効な行動を選択できるようにする手法を提案した。
- ジャストインタイムシーングラフ成長:長時間ロボティクスにおける知覚飽和への対抗知覚/シーングラフ2026/7/1
この論文は、ロボットの長時間タスク実行中に生じる知覚の飽和問題を解決するため、タスクに応じて必要な部分だけを動的に活性化する3Dシーングラフ構築手法JITOMAを提案している。
- LH-AVLN: 長時間音声・視覚・言語ナビゲーションのベンチマークナビゲーション2026/7/1
複数目標と空間化された音響手がかりを組み合わせた長時間ナビゲーションのベンチマークを提案し、音声を活用した参照エージェントPAG-Navを開発して評価した。
- 視覚言語行動モデルにおける視野外操作のための空間記憶VLA2026/5/1
視覚言語行動モデルに、可動カメラの多視点観測から構築した空間記憶を組み込み、視野外の物体操作を可能にするフレームワークSOMAを提案した。
- 身体化知能における触覚ベースのマルチモーダル融合:視覚・言語・接触駆動パラダイムのサーベイ触覚/サーベイ2026/5/1
触覚と視覚・言語を統合するマルチモーダル触覚融合の研究を包括的に調査し、データセットと手法の階層的分類法を提案した論文。
- 人間とAIのコーディング協調のスケールには、統治可能なコンセンサス層が必要ソフトウェア工学2026/4/20
AI支援開発の成果物をコードとチャット履歴から、型付きプロパティグラフで表現されるコンセンサス層に置き換えるパラダイムを提案し、監査可能性と介入距離の削減を目指す。
- WaterVideoQA:マルチモーダルエージェントによるASV中心の知覚と規則準拠推論VLA2026/2/1
水上航行環境に特化した大規模動画QAベンチマークWaterVideoQAと、マルチエージェント神経記号システムNaviMindを提案し、ASVの認知・推論能力を評価・向上させる。
- AutoFly: 実環境でのUAV自律ナビゲーションのための視覚-言語-行動モデルVLA2026/2/1
RGB入力から擬似深度特徴を抽出するエンコーダと二段階学習を組み合わせ、粗い指示のみでUAVが自律的に経路計画と障害物回避を行うVLAモデルを提案し、自律行動に焦点を当てた新データセットも構築した。
- 脳に着想を得た身体性知能による流動的で高速な反射的ロボティクス制御VLA2026/1/1
皮質・小脳・脊髄の構造を模したニューロモーフィックVLAを実機ロボットに初めて実装し、腕の振動抑制や20ms未満の安全反射、時間記憶を実現した。
- 外乱に頑健なUSVナビゲーションのための分布ロバスト強化学習ナビゲーション2025/12/1
異分散な観測ノイズに悩む無人水上艇の航法に対し、分布ロバスト最適化と暗黙的分位点ネットワークを統合したDRIQNを提案し、最悪ケース性能を改善した。
- Da Yu:水上監視とシーン理解のためのUSV向け画像キャプショニングVLA2025/6/1
水上環境の画像キャプションデータセットWaterCaptionを構築し、USV向けのエッジ展開可能なマルチモーダル大規模言語モデルDa Yuを提案した。
- SD-OVON: 動的シーンにおけるオープンボキャブラリ物体ナビゲーションのための意味論対応データセットとベンチマーク生成パイプライン物体ナビゲーション2025/5/1
マルチモーダル基盤モデルを活用し、実世界の意味論と常識に沿ったフォトリアルな動的シーンと操作可能物体を含むオープンボキャブラリ物体ナビゲーション用データセット・ベンチマークを自動生成するパイプラインを提案。
- 未知の動的環境における3Dセマンティックマップを用いたオープンボキャブラリ移動マニピュレーション移動マニピュレーション2024/6/1
VLMとLLMを活用して3Dセマンティックマップを構築し、未知の動的環境で自然言語指示に基づく移動マニピュレーションを実現するフレームワークを提案。実機実験で高い成功率を示した。
- HR-INR: イベントカメラによる連続時空間ビデオ超解像時空間超解像2024/5/1
イベントカメラを活用し、任意のスケールで動画の解像度とフレームレートを同時に向上させる連続時空間ビデオ超解像フレームワークを提案。
- Talk2Radar: 自然言語と4Dミリ波レーダーを結ぶ3D参照表現理解VLA2024/5/1
4Dミリ波レーダーの点群と自然言語を対応付ける初のデータセットTalk2Radarを構築し、3D参照表現理解のための新モデルT-RadarNetを提案した。
- Pontryagin Optimal Control via Neural Networks2022/12/30