Yinan Deng
Beijing Institute of Technology
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OmniNav: 動的環境における堅牢な長期的目標ナビゲーションナビゲーション2026/9/8
動的環境での長期的な目標ナビゲーションを、シーン記憶の更新、信念修正、操作可能なエンドポイント選択を統合した因子化タスク状態推定として定式化し、頑健な探索と操作を実現するシステムを提案した。
- PhysReal: ハイブリッド構成モデリングによる実世界の変形物体物理の学習物理シミュレーション/変形物体2026/9/7
実世界の変形物体の物理をビデオから学習し、シミュレーションするフレームワークを提案。解析モデルとニューラル残差を組み合わせた構成モデルをMPMシミュレータと3DGSレンダラに統合し、段階的カリキュラムでパラメータを推定する。
- PaMoSplat: 部品認識と動作ガイドによる動的シーン再構成のためのガウススプラッティング動的シーン再構成2026/5/1
動的シーン再構成のための新しいガウススプラッティングフレームワークを提案し、部品認識とオプティカルフローによる動作推定を統合して、高品質なレンダリングと正確なトラッキングを実現した。
- 一度見れば実行できる:ワンショット動画デモからタスクを学習する視覚-言語-行動モデルVLA2025/12/1
テスト時に1本の専門家デモ動画を見るだけで新しい操作スキルを獲得できるVLAモデルViVLAを提案し、未見タスクで30%以上の性能向上を達成した。
- OmniMap: 光学・幾何・意味を統合する汎用マッピングフレームワーク3Dマッピング2025/9/1
光学・幾何・意味の3属性をリアルタイムで同時に捉えるオンラインマッピングフレームワークOmniMapを提案し、3DGSとボクセルのハイブリッド表現で高精度なレンダリング・形状復元・ゼロショット意味セグメンテーションを実現した。
- OpenMulti: オープンボキャブラリなインスタンスレベル分散型マルチエージェント暗黙的マッピングマルチエージェントマッピング2025/9/1
複数ロボットが協調して、オープンボキャブラリでインスタンスレベルの意味理解を伴う暗黙的マップを分散構築するフレームワークを提案。
- OpenVox: リアルタイムなインスタンスレベルのオープンボキャブラリ確率的ボクセル表現オープンボキャブラリマッピング2025/2/1
VLMを活用し、インスタンス単位でオープンボキャブラリな意味理解とロバストな逐次再構成をリアルタイムで行う確率的ボクセル表現を提案した論文。
- OpenIN: 動的な家庭環境におけるオープン語彙インスタンス指向ナビゲーションナビゲーション2025/1/1
よく使う物とその置き場所(キャリア)の関係を表すオープン語彙のシーングラフを構築・更新し、LLMの常識と視覚言語特徴の類似度を用いて、移動する特定の物体へ効率的にナビゲートする手法を提案した。
- LCP-Fusion: 局所制約と計算可能な事前情報を強化したニューラル暗黙SLAMSLAM2024/11/1
スパースボクセルオクツリーとSDF事前情報を組み合わせたハイブリッド表現により、局所制約を強化しつつ未知のシーン境界でも高精度なマッピングとトラッキングを実現するニューラル暗黙SLAMを提案。
- OpenObject-NAV: 動的な運搬関係シーングラフに基づくオープン語彙物体指向ナビゲーション物体ナビゲーション2024/9/1
頻繁に使う物体とその運搬元の関係を表すオープン語彙シーングラフを構築・更新し、LLMの常識と視覚言語特徴の類似度でナビゲーションを計画する手法を提案。シミュレータと実機で移動した物体への効率的な到達を実証した。
- OpenObj: 細粒度理解を備えたオープン語彙オブジェクトレベルNeRF3D再構成/NeRF2024/6/1
視覚言語モデルを活用し、オブジェクト内部の細部まで理解できるオープン語彙のオブジェクトレベルNeRFを構築する手法を提案。ゼロショットセマンティックセグメンテーションやロボット操作タスクで優れた性能を示す。
- LGSDF: 局所更新に支援された符号付距離場の継続的グローバル学習マッピング2024/4/1
局所的な軸並行グリッド更新とニューラルネットワークによる継続的自己教師学習を組み合わせ、従来より高精度なESDFマップを構築する手法を提案。
- OpenGraph: 大規模屋外環境におけるオープン語彙階層型3Dグラフ表現3Dシーン理解2024/3/1
視覚言語モデルを用いて画像から物体とその説明を抽出し、LiDAR点群に投影して3Dマップを構築、レーングラフで階層化することで、大規模屋外環境でのオープン語彙なシーン理解を実現した。