Xiangyu Zhu
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAマニピュレーションヒューマンロボットインタラクション移動操作3Dシーン理解シーングラフ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Dream4ACT: 複数身体に対応した動画・行動モデリングのための共有視覚行動インターフェースVLA2026/9/30
関節構成を4つの仮想カメラ映像として描画する「action views」で身体差を吸収し、単一の動画拡散モデルで順動力学・逆動力学・観測行動生成を統合した世界モデルを提案。
- 物体中心条件付けによる視覚運動フローマッチングマニピュレーション2026/9/21
シーンを物体ごとの意味特徴と空間手がかりに分離し、フローマッチング方策の条件付けに用いることで、視覚的妨害や位置ずれに頑健なマニピュレーションを実現した。
- 一目でわかる:顔から見た目の性格を推定するヒューマンロボットインタラクション2026/7/16
顔画像のみから初対面の印象に基づく性格(MBTI)を推定するフレームワークGlanceFaceを提案。視覚言語モデルによる意味的先行知識と不確実性を考慮した学習で、ノイズの多い主観的アノテーションに対処し、対話前の適応的初期戦略に活用できる。
- GeoHAT: 移動操作のための幾何適応型ハイブリッド行動変換器移動操作2026/6/1
移動操作タスクにおいて、信頼できる幾何情報のみを注入し、必要な箇所にのみ注意を向けるという原理に基づく、エンドツーエンドの拡散ベースフレームワークGeoHATを提案。軽量なフーリエ空間エンコーダとゲート付き融合、およびアームとベースを分離したハイブリッド行動デコーダにより、シミュレーションベンチマークで高い成功率を達成した。
- DGSG-Mind: 長期シーン理解とグラウンディングのための動的3Dガウシアンシーングラフ3Dシーン理解2026/5/1
動的な3Dシーン表現にオープンボキャブラリの意味情報を統合し、インスタンス認識型の3Dガウシアン動的シーングラフと推論エージェントを構築した。
- DynamicGSG: 環境適応のための動的3Dガウシアンシーングラフシーングラフ2025/2/1
ガウシアンスプラッティングを用いて動的で高忠実度なオープンボキャブラリのシーングラフを構築し、環境変化に応じて局所的に更新することでロボットの長期的な環境適応を可能にするシステムを提案。
- H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps2023/9/1
- When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning2022/5/1