Ngan Le
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FoldQuantVLA: 一貫した折り畳みによる視覚-言語-行動モデルのネイティブローbit量子化VLA2026/9/21
視覚-言語-行動モデルを再学習なしで4bit量子化し、TensorRTプラグインで高速化する手法を提案。実機タスクで成功率を維持・向上させた。
- GloVLA: 幾何学的移動と局所VLAの相互作用による非構造環境での頑健な物体中心操作マニピュレーション2026/9/5
物体中心操作を幾何学的な移動制御と局所的なVLAポリシーに分離するハイブリッドフレームワークを提案し、非構造環境での成功率と推論コストを改善した。
- グリッパー認識型視覚言語行動モデルVLA2026/8/25
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
- 視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分であるVLA/モデル圧縮2026/6/1
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
- 自己改善型VLAポリシー:スプリアスロバストなアクション平滑化のための選択的拡散ノイズVLA/ロバスト性2026/6/1
拡散ベースのVLAポリシーのテスト時ロバスト性を高めるため、拡散ノイズ空間を制御可能な自由度として利用し、スプリアスな視覚相関への依存を減らしつつ滑らかなアクションを生成するノイズ選択手法SDNを提案した。
- CodeGraphVLP: コードによる計画とセマンティックグラフ状態を組み合わせた非マルコフ型視覚言語行動モデルVLA/操作2026/4/1
長期的なロボット操作タスクにおいて、セマンティックグラフ状態とコードベースのプランナーを組み合わせ、視覚言語行動モデルの実行を支援する階層的フレームワークを提案した。
- 物体中心・幾何グラウンディングによる clutter に頑健な VLA モデルVLA2025/12/1
VLA の知覚と行動を分離し、タスク関連物体の領域選択と3D構造の強調を行う知覚モジュールを導入することで、 clutter や背景変化に強い操作を実現した。
- SlotVLA: ロボットマニピュレーションにおける物体関係表現のモデリングVLA2025/11/1
物体中心・物体関係表現を用いたスロットアテンション型VLAフレームワークを提案し、物体注釈付きベンチマークLIBERO+を構築した。
- ロボットマニピュレーションにおける記憶状態の進展を再考する:オブジェクト中心の視点VLA2025/11/1
視覚的に類似した物体との連続的な相互作用を要する非マルコフ的タスクにおいて、物体ごとの履歴を保持するスロット中心のVLAフレームワークを提案し、LIBERO-Memベンチマークで評価した。
- Robotic-CLIP: ロボット応用のための行動データによるCLIPの微調整VLA2024/9/1
大規模な行動動画データでCLIPを対照学習により微調整し、動的な行動理解を可能にしたRobotic-CLIPを提案。言語駆動型ロボットタスクで既存CLIPモデルを上回り、実世界の把持タスクでも有効性を示した。
- ネガティブプロンプト誘導を用いた言語駆動型6自由度把持検出マニピュレーション2024/7/1
自然言語の指示に基づき、散らかった点群の中から目的の物体を6自由度で把持する手法を提案。大規模データセットGrasp-Anything-6Dと、不要物体を避けるネガティブプロンプト誘導拡散モデルを導入した。
- 条件付き一貫性モデルによる軽量な言語駆動型把持検出マニピュレーション2024/7/1
拡散モデルを軽量化した一貫性モデルと言語プロンプトを組み合わせ、高速推論を実現する言語駆動型把持検出法を提案し、実機実験で有効性を示した。
- マスク誘導アテンションによる言語駆動型把持検出マニピュレーション2024/7/1
セグメンテーションマスクと言語指示をTransformerのアテンションで統合し、遮蔽に強い言語駆動型の把持検出を実現した研究。
- Open-Fusion: Real-time Open-Vocabulary 3D Mapping and Queryable Scene Representation2023/10/1
- Open-Vocabulary Affordance Detection using Knowledge Distillation and Text-Point Correlation2023/9/1
- Language-Conditioned Affordance-Pose Detection in 3D Point Clouds2023/9/1
- Open-Vocabulary Affordance Detection in 3D Point Clouds2023/3/1