Yue Ma
Hong Kong University of Science and Technology
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 意図と軌道の分離:世界行動モデルのための表現演繹フレームワークVLA2026/8/1
世界行動モデルにおける高レベルの状態遷移と低レベルの軌道生成の表現が絡み合う問題を解決するため、思考連鎖ガイダンスを用いた表現演繹フレームワークPILOTを提案し、複雑なロボット操作タスクでの成功率と物理的解釈性を向上させた。
- EgoGenesis: オンライン固定投影メモリとAction-3D RoPEによる自己中心的世界行動モデリングVLA2026/7/30
自己中心視点の操作ビデオを合成する世界行動シミュレータを提案し、生成データで実ロボットの汎化性能を向上させた。
- GeoEdit: 幾何認識オブジェクト編集のためのデュアルブランチ拡散画像編集2026/6/29
3D物理制約を守りながら写真内のオブジェクトを正確に操作するための、トレーニング不要のLift-Manipulate-Render-Denoiseパイプラインを提案。
- 身体性ギャップを橋渡しする:分離型クロス身体性ビデオ編集ビデオ生成/身体性転移2026/5/1
人間のデモ動画からロボットの実行動画を生成する際、タスク情報と身体性情報を分離して表現し、拡散モデルを用いてロボット動画を合成する手法を提案した。
- ST-BiBench:双腕身体性タスクにおけるマルチストリーム・マルチモーダル協調のMLLMベンチマークVLA2026/2/1
双腕ロボットの身体性タスクを対象に、マルチモーダル大規模言語モデルの時空間的なマルチストリーム協調能力を評価する多層ベンチマークST-BiBenchを提案し、30以上のモデルを評価して高次推論と細粒度実行の乖離を明らかにした。
- 熱・可視・LiDAR融合によるリアルタイム3Dセマンティックマッピングのためのマルチモーダル信号処理3Dセマンティックマッピング2026/1/1
可視・赤外画像をピクセルレベルで融合し、LiDAR点群を投影して熱源をセグメンテーションすることで、温度情報をセマンティック層として付加した3Dマップを生成する手法を提案。
- CycleGANとYOLOを統合した深層学習モデルによるPCB赤外線欠陥検出への応用研究産業検査2026/1/1
赤外線データ不足を解決するため、CycleGANで可視光画像から擬似赤外線画像を生成し、YOLOv8検出器を訓練するクロスモーダル拡張手法を提案した。
- 可逆ネットワークによる不確実性を考慮した確率的3D人間動作予測動作予測2025/7/1
可逆ネットワークで姿勢を潜在空間にパラメータ化し、将来の潜在分布を予測することで、不確実性を定量化できる3D人間動作予測手法を提案。
- GPS遮蔽建設現場における自律点検のためのスマートMAV開発自律飛行2024/8/1
GPSが使えない屋内建設現場で、関心領域の特定と経路計画を階層的に行い、3Dガウススプラッティングで再構築するスマートドローンの枠組みを提案し、実環境で検証した。
- SemanticSLAM: Learning based Semantic Map Construction and Robust Camera Localization2024/1/1