Zi Huang
収録論文 5本 ・ フィジカルAI/ロボット学習
3D生成VLAナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Scene-SAM3D: 微調整不要の多視点シーン資産生成3D生成2026/7/18
単一画像から3Dオブジェクトを生成するSAM3Dを、キャリブレーション済みの多視点画像から3Dシーン資産を生成するフレームワークに拡張した。冗長な視点を削減しつつ、隠れた領域の情報を補完し、潜在速度融合と軽量なガウス最適化により高品質なシーンを生成する。
- AnchorVLA: アンカー拡散による効率的なエンドツーエンド移動操作VLA2026/4/1
移動操作において、拡散ポリシーの多様な行動生成を保ちつつ、推論コストを削減するため、アンカー軌道周辺で局所的に拡散する手法を提案し、実行時のドリフトを軽減する自己補正機構も導入した。
- MergeVLA: スキル横断モデルマージによる汎用視覚言語行動エージェントVLA2025/11/1
異なるタスクで訓練したVLAエキスパートを統合する際の非マージ性の原因を分析し、タスクマスク付きLoRAとクロスアテンションのみの行動エキスパートで設計段階からマージ可能にしたVLAアーキテクチャを提案。
- 汎用身体性エージェントのための視覚言語事前学習における順序性と連続性の証明可能な学習VLA2025/2/1
人間の行動動画から視覚言語表現を事前学習する際に、目標到達に基づく時間対比学習ではなく、フレーム間の意味的差異とブラウン橋制約を用いて順序性と連続性を学習するAcTOLを提案し、模倣学習実験で操縦タスクの性能と指示スタイルへの頑健性を向上させた。
- 指示を超えてナビゲート:障害物環境における視覚と言語によるナビゲーションナビゲーション2024/7/1
視覚と言語によるナビゲーション(VLN)において、予期せぬ障害物による指示と現実の不一致に対応するため、R2R-UNOデータセットを構築し、適応的にナビゲートするObVLN手法を提案した。