Trong-Bao Ho
収録論文 4本 ・ フィジカルAI/ロボット学習
VLAロボットポリシー/アクション・チャンキングVLA/モデル圧縮VLA/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FOCA: 未来指向型条件付けによるデータ効率的な視覚言語行動適応VLA2026/6/18
視覚言語行動モデルの少数ショット模倣学習における性能低下を改善するため、未来の相互作用埋め込みと目標観察を活用した未来指向型条件付けフレームワークを提案した。
- 正しく始めて正しく着地:初期ノイズ選択による非同期実行ロボットポリシー/アクション・チャンキング2026/6/1
アクション・チャンキングの非同期実行時に生じるチャンク境界の不整合を、生成前の初期ノイズを適切に選ぶことで解決する学習不要の手法PAINTを提案。逆オイラー反転と再描画ルールで整合性を保ち、シミュレーションと実機で性能を向上させた。
- 視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分であるVLA/モデル圧縮2026/6/1
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
- EquiVLA: 回転同変ビジョン・言語・行動モデルのための汎用フレームワークVLA/操作2026/6/1
凍結した視覚言語バックボーンとフローマッチング拡散トランスフォーマー行動ヘッドを組み合わせた任意のアーキテクチャに適用可能な、エンドツーエンドのSO(2)同変VLAモデルの最初の汎用フレームワークを提案。回転に対する幾何学的帰納バイアスを導入し、データ効率と汎化性能を大幅に向上させた。