Byungkun Lee
収録論文 5本 ・ フィジカルAI/ロボット学習
視覚RL/アーキテクチャVLAVLA/操作スキル発見
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- V-Simba: 視覚的連続制御におけるRLのアーキテクチャ的可能性を解き放つ視覚RL/アーキテクチャ2026/8/1
状態ベースRLで効果的なSimbaアーキテクチャを視覚RLに応用し、正規化層と点別畳み込みを追加したシンプルなアーキテクチャV-Simbaを提案。DMC、Adroit、Meta-WorldでSOTAと同等以上の性能を達成しつつ、計算効率も向上した。
- ロボットのように見る:ロボット中心のポイントマップによる視覚言語行動モデルVLA2026/7/1
視覚言語行動モデル(VLA)がカメラ視点とロボット座標系のずれで性能を落とす問題を、ロボット座標系の3D座標を画素に格納したポイントマップを入力に用いることで解決し、既存VLAに最小限の変更で統合できることを示した。
- 3D HAMSTER: 3D軌道ガイダンスによる階層型視覚言語行動モデルの計画と制御の橋渡しVLA/操作2026/6/1
階層型VLAモデルにおいて、プランナーが直接3D軌道を予測できるようにし、2Dガイダンスの幾何学的歪み問題を解決した。実世界操作で優れた性能を示した。
- 視覚運動制御のための畳み込み注入器による事前学習済みViTの適応VLA2024/6/1
事前学習済みViTに畳み込みを注入する追加モジュールCoInを提案し、視覚運動制御タスクへの適応性能を向上させた。
- やるべきこととやらないこと:指示動画を用いた望ましいスキルの学習スキル発見2024/6/1
指示動画から望ましい行動と望ましくない行動を区別する指示ネットワークを学習し、スキル発見アルゴリズムの報酬を調整することで、複雑な連続制御タスクにおいて安全で望ましいスキルを効率的に獲得する手法を提案。