Yuxuan Hu
Nanyang Technological University
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- mmHRI: ミリ波レーダによるプライバシー保護型ヒューマンロボットインタラクションHRI2026/9/28
ミリ波レーダで人の動作と3D姿勢を推定し、それをテキスト指示に変換してVLAポリシーを制御する、プライバシー保護型のロボットマニピュレーション枠組みを提案した。
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- FORGE: キーポイント軌道推論による機能的一般化を目指したツール使用マニピュレーション2026/7/1
ロボットが特定の道具にしか使えない問題を解決するため、道具の機能に基づく一般化を実現する手法を提案。キーポイント軌道を中間表現として用い、機能推論と動作実行を分離する2段階ポリシーを開発し、未見の道具での成功率を2倍以上向上させた。
- ActiveVital: ホームヘルスケアロボットのための幾何学を考慮した身体装着型バイタルサイン計測ヘルスケアロボティクス2026/6/1
家庭用ロボットが非接触で呼吸数と心拍数を正確に計測できるよう、ミリ波レーダーの観測角度を視覚情報で能動的に調整するフレームワークを提案した。
- 視覚運動ポリシー学習における暗黙的空間表現の再考模倣学習2026/6/1
空間ソフトマックスプーリングがロボット操作の視覚表現として有効であることを示し、その限界を克服する新しいエンコーダPRISMを提案した論文。
- EM-Fall: ヒューマノイドロボットによる昼夜を問わない転倒検知のための身体化ミリ波センシング転倒検知2026/6/1
移動型ヒューマノイドロボットにミリ波センシングを統合し、視点を能動的に調整して遮蔽や照明条件に影響されずに転倒を検知するフレームワークを提案した。
- 意味論と幾何学的接地の分離:言語条件付き模倣学習のための空間的視覚プロンプト模倣学習2026/6/1
言語条件付きロボット操作において、意味推論と空間制御を分離し、視覚基盤モデルで生成した空間的視覚プロンプトを行動生成器に注入する新しいアーキテクチャSVP-ILを提案。少ないデモデータでも高精度を達成した。
- FLASH: スパースサンプリングによる効率的な視覚運動ポリシーVLA2026/5/1
拡散モデルやフローマッチングの反復処理による遅延を解消するため、ルジャンドル多項式で軌道を表現し、履歴係数から生成を開始することで単一推論で長い行動範囲を実現する高速な視覚運動ポリシーを提案した。
- MARSポリシー:必要な時だけマルチモーダルに模倣学習2026/5/1
ロボット操作の模倣学習において、タスクの全フェーズで多様性が必要とは限らないことに着目し、必要な時だけ確率的生成を適応的に行い、単一モードのフェーズでは決定的学習に切り替えるMARSポリシーを提案した。シミュレーションと実機で成功率向上と推論遅延削減を実証した。
- LMGenDrive: マルチモーダル理解と生成的ワールドモデルを統合したエンドツーエンド運転自動運転2026/4/1
本論文は、LLMベースのマルチモーダル理解と生成的ワールドモデルを統合した初のエンドツーエンド自動運転フレームワークLMGenDriveを提案し、将来の運転ビデオと制御信号を同時生成することで、長尾・オープンワールドシナリオへの一般化を向上させる。
- Action-to-Actionフローマッチング:固有感覚履歴を起点とした高速ロボット方策VLA2026/2/1
ランダムノイズではなく過去の固有感覚行動を起点にフローマッチングで行動生成する方策を提案し、1ステップ推論と高い汎化性能を実現した。
- 実行履歴に着目した拡散ポリシーによる長期的ロボット操作における多峰性行動の曖昧性解消マニピュレーション2026/2/1
ロボットの実行履歴を視覚空間に投影して拡散ポリシーの条件に加えることで、長期タスクで観測が似ていても行動が異なる曖昧さを解消し、背景の乱れにも頑健にした手法を提案。
- WaveMan: ヒューマノイドロボットのためのミリ波による部屋規模の人間インタラクション知覚ヒューマンロボットインタラクション2026/1/1
ミリ波センシングを用いて、ユーザーの位置に依存せずプライバシーを守りながら部屋規模で人間のインタラクションを認識するシステムを提案し、未学習の位置でも高精度を実現した。
- M³Aポリシー:フォトメトリック再レンダリングによる可変材料操作拡張ポリシーマニピュレーション2025/12/1
単一の実演から光輸送に基づくフォトメトリック再レンダリングで多様な材料の実演を生成し、材料に依存しない操作ポリシーを学習する枠組みを提案。
- DIPOLE: 視覚と幾何を融合したロバストな視覚運動汎化VLA2025/11/1
視覚と言語・幾何の相補的なモダリティを訓練時のドロップアウトとクロスアテンションで融合し、照明や視点変化に強い拡散ポリシーを実現した。
- LMDrive: Closed-Loop End-to-End Driving with Large Language Models2023/12/1