Zhiyang Liu
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavGen: 視覚生成モデルを身体性3Dナビゲーションのスケーラブルなデータエンジンとして活用VLA2026/9/25
テキストから動画を生成するモデルをデータエンジンとして使い、屋内・屋外の視覚言語ナビゲーション(VLN)エピソードを約40万件生成し、実世界のドローン飛行実験で75%の成功率を達成した。
- NTR: エンドツーエンド運転におけるシーントークンボトルネックのためのニューラルトークン再構成自動運転2026/5/1
エンドツーエンド自動運転のシーントークンボトルネックに、マスク潜在再構成による自己蒸留を導入し、計画に有用な視覚表現を保持させる手法を提案。
- センサモータポリシーによる精密なアグレッシブ空中機動ドローン制御2026/4/1
ドローンの狭い隙間を高速で通過するアグレッシブな機動を、視覚と自己受容感覚から直接制御指令を出力するセンサモータポリシーを強化学習で訓練して実現した。
- NavDreamer: 動画生成モデルをゼロショット3Dナビゲータとして活用ナビゲーション2026/2/1
動画生成モデルを言語指示とナビゲーション軌道のインターフェースとして用い、ゼロショットで3Dナビゲーションを実現するフレームワークを提案。
- USS-Nav: 軽量UAVのゼロショット物体ナビゲーションのための統合時空間意味シーングラフナビゲーション2026/2/1
未知環境でUAVがゼロショットで物体を探索できるよう、空間接続グラフとオープン語彙の意味情報を統合した階層的シーングラフを逐次構築し、LLMによる大域目標決定と局所プランナを組み合わせた軽量ナビゲーション手法を提案した。
- ロボットマニピュレーションのための3Dアフォーダンスキーポイント検出マニピュレーション2025/11/1
RGB-D画像から物体のアフォーダンスを3Dキーポイントで検出し、把持位置・方向・範囲を推定してロボット操作を実現する手法を提案。
- ロボットマニピュレーションのための大規模VLMベース視覚-言語-行動モデル:サーベイVLA2025/8/1
大規模視覚言語モデルを基盤とした視覚-言語-行動(VLA)モデルによるロボットマニピュレーション研究を、アーキテクチャの分類や関連分野との統合、今後の方向性を含めて初めて体系的にレビューしたサーベイ論文。
- DexGrasp-Diffusion:多様な多指ロボットハンドのための拡散モデルによる統合的な機能把持生成手法マニピュレーション2024/7/1
拡散モデルを用いて、様々な多指ロボットハンドに対応した機能的な把持を生成する統合手法を提案し、物体のアフォーダンス指示に沿った把持を実現した。
- 一度のスキャンで実現する動的シーン再構成パイプライン:未知物体の6自由度ロボット把持マニピュレーション2024/4/1
シーンを一度スキャンして物体メッシュと姿勢追跡を登録し、操作中もリアルタイムで姿勢追跡して再構成点群を更新することで、遮蔽に強く高精度な6自由度把持を可能にする二段階パイプラインを提案した。
- DR-Pose: A Two-stage Deformation-and-Registration Pipeline for Category-level 6D Object Pose Estimation2023/9/1
- Learning-Free Grasping of Unknown Objects Using Hidden Superquadrics2023/5/1
- GET-DIPP: Graph-Embedded Transformer for Differentiable Integrated Prediction and Planning2022/11/1