Sunghwan Hong
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA3D物体検出カメラモーション生成シーン位置合わせ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ChronoGraph: 視覚言語モデルによる機能的な4Dシーングラフで相互作用理解と接地計画を実現VLA2026/9/30
行動によるシーンの変化を4Dシーングラフとして表現し、視覚言語モデルで理解と計画を統合する手法を提案。グラフを思考連鎖として学習させ、実世界の移動マニピュレーションにも応用した。
- Map-Det3D: ストリーミング入力からの多視点3D物体検出のためのメトリックフィードフォワード3D再構築事前知識3D物体検出2026/8/12
単眼ビデオから直接メトリック3D空間で物体検出を行うため、RGBから3D再構築するフィードフォワードモデルを幾何学的バックボーンとして利用し、2Dから3Dへのリフティングを回避する新しいオンライン多視点3D物体検出モデルを提案した。
- LIME: 一人称視点ビデオから意図を考慮したカメラモーションを学習するカメラモーション生成2026/7/1
ロボットが自然言語の指示に基づいて次に観察すべきカメラの相対姿勢を生成する手法を提案。一人称ビデオから多様な意図とカメラ動作のペアを学習し、観察利得の予測と連続的なフローマッチングによる姿勢生成を組み合わせる。
- PROSE: 視覚言語モデルによる学習不要の自己中心視点シーン位置合わせシーン位置合わせ2026/6/15
頭部装着カメラで撮影した同一室内の異なる時刻のRGB映像を、事前学習済み視覚言語モデルを用いて物体レベルの3Dシーングラフに変換し、物体対応付けと幾何的検証により位置合わせする学習不要の手法を提案した。
- 幾何学的行動モデルによるロボットポリシー学習VLA2026/6/1
事前学習済みの幾何基盤モデルを共有基盤として、言語条件付きの未来予測と行動生成を統合した操作ポリシーを提案。シミュレーションと実機で高精度・高速・軽量を実証。