Seungryong Kim
収録論文 6本 ・ フィジカルAI/ロボット学習
空間推論VLAロボット制御/視覚表現/拡散モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考空間推論2026/6/11
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
- 幾何学的行動モデルによるロボットポリシー学習VLA2026/6/1
事前学習済みの幾何基盤モデルを共有基盤として、言語条件付きの未来予測と行動生成を統合した操作ポリシーを提案。シミュレーションと実機で高精度・高速・軽量を実証。
- Pri4R: 特権的4D表現で視覚言語行動モデルに世界の動力学を学習させるVLA2026/3/1
訓練時のみ特権的な4D情報を使い、3D点追跡を予測する軽量ヘッドをVLAに追加して世界の動力学を暗黙的に学習させ、推論時は元のアーキテクチャのまま高性能な操作を実現した研究。
- 拡散モデルをロボット制御に活用するための条件の探求ロボット制御/視覚表現/拡散モデル2025/10/1
事前学習済みテキスト画像拡散モデルを微調整せずにロボット制御のためのタスク適応的な視覚表現として利用する手法ORCAを提案し、制御タスクに適した条件設計の重要性を示した。
- 能動的テスト時視覚言語ナビゲーションVLA2025/6/1
不確実なナビゲーション結果に対するエピソード的フィードバックを用いたテスト時能動学習フレームワークATENAを提案し、混合エントロピー最適化と自己能動学習戦略で適応的な意思決定を実現した。
- Semi-Supervised Learning with Mutual Distillation for Monocular Depth Estimation2022/3/1