Duy M. H. Nguyen
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FOCA: 未来指向型条件付けによるデータ効率的な視覚言語行動適応VLA2026/6/18
視覚言語行動モデルの少数ショット模倣学習における性能低下を改善するため、未来の相互作用埋め込みと目標観察を活用した未来指向型条件付けフレームワークを提案した。
- vla.cpp: 視覚言語行動モデルのための統合推論ランタイムVLA/推論最適化2026/6/6
ロボット上で動作する軽量なC++推論ランタイムを提案し、複数のVLAモデルを単一のランタイムで効率的に実行可能にした。
- 視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分であるVLA/モデル圧縮2026/6/1
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
- 自己改善型VLAポリシー:スプリアスロバストなアクション平滑化のための選択的拡散ノイズVLA/ロバスト性2026/6/1
拡散ベースのVLAポリシーのテスト時ロバスト性を高めるため、拡散ノイズ空間を制御可能な自由度として利用し、スプリアスな視覚相関への依存を減らしつつ滑らかなアクションを生成するノイズ選択手法SDNを提案した。
- 正しく始めて正しく着地:初期ノイズ選択による非同期実行ロボットポリシー/アクション・チャンキング2026/6/1
アクション・チャンキングの非同期実行時に生じるチャンク境界の不整合を、生成前の初期ノイズを適切に選ぶことで解決する学習不要の手法PAINTを提案。逆オイラー反転と再描画ルールで整合性を保ち、シミュレーションと実機で性能を向上させた。
- EquiVLA: 回転同変ビジョン・言語・行動モデルのための汎用フレームワークVLA/操作2026/6/1
凍結した視覚言語バックボーンとフローマッチング拡散トランスフォーマー行動ヘッドを組み合わせた任意のアーキテクチャに適用可能な、エンドツーエンドのSO(2)同変VLAモデルの最初の汎用フレームワークを提案。回転に対する幾何学的帰納バイアスを導入し、データ効率と汎化性能を大幅に向上させた。
- Audio-3DVG:音声と点群の統合による3D視覚グラウンディング3D視覚グラウンディング2025/7/1
音声指示から3D点群中の対象物体を特定するタスクに対し、物体言及検出と音声誘導注意を組み合わせたフレームワークを提案し、標準データセットに音声記述を合成して評価した。