Ngo Anh Vien
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GloVLA: 幾何学的移動と局所VLAの相互作用による非構造環境での頑健な物体中心操作マニピュレーション2026/9/5
物体中心操作を幾何学的な移動制御と局所的なVLAポリシーに分離するハイブリッドフレームワークを提案し、非構造環境での成功率と推論コストを改善した。
- FOCA: 未来指向型条件付けによるデータ効率的な視覚言語行動適応VLA2026/6/18
視覚言語行動モデルの少数ショット模倣学習における性能低下を改善するため、未来の相互作用埋め込みと目標観察を活用した未来指向型条件付けフレームワークを提案した。
- EquiVLA: 回転同変ビジョン・言語・行動モデルのための汎用フレームワークVLA/操作2026/6/1
凍結した視覚言語バックボーンとフローマッチング拡散トランスフォーマー行動ヘッドを組み合わせた任意のアーキテクチャに適用可能な、エンドツーエンドのSO(2)同変VLAモデルの最初の汎用フレームワークを提案。回転に対する幾何学的帰納バイアスを導入し、データ効率と汎化性能を大幅に向上させた。
- 正しく始めて正しく着地:初期ノイズ選択による非同期実行ロボットポリシー/アクション・チャンキング2026/6/1
アクション・チャンキングの非同期実行時に生じるチャンク境界の不整合を、生成前の初期ノイズを適切に選ぶことで解決する学習不要の手法PAINTを提案。逆オイラー反転と再描画ルールで整合性を保ち、シミュレーションと実機で性能を向上させた。
- 視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分であるVLA/モデル圧縮2026/6/1
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
- ReFineVLA: 教師ガイドによるファインチューニングを用いたマルチモーダル推論対応の汎用ロボットポリシーVLA2026/4/1
VLAモデルに推論能力を組み込むため、専門家教師モデルが生成した推論根拠をデータセットに追加し、事前学習済みVLAをファインチューニングする手法を提案。シミュレーション操作ベンチマークで評価し、視覚・言語・行動の整合性と汎化性能の向上を示した。
- マルチエンボディメント把持エージェントに向けてマニピュレーション2025/10/1
様々なグリッパ設計に対応するデータ効率の良いフローベースの同変把持合成アーキテクチャを提案し、JAXで実装して性能と推論速度を向上させた。
- TD-GRPC: 群相対方策制約を用いた時間差分学習によるヒューマノイド歩行歩行2025/5/1
TD-MPCにGRPOと方策制約を組み合わせ、計画と学習の整合性を保ちながらヒューマノイドの歩行・動的運動を安定化させる手法を提案。
- 拡散ポリシーによるハイブリッドオフポリシー強化学習の探索強化:非把持マニピュレーションへの応用マニピュレーション2024/11/1
離散行動(接触点選択)と連続行動(動作パラメータ)を統合した最大エントロピー強化学習フレームワークを提案し、連続ポリシーを拡散モデルで表現することで多様な探索を実現。実機6D姿勢合わせタスクで成功率を53%から72%に向上させた。
- マルチエンボディメント把持のための拡散モデルマニピュレーション2024/10/1
グリッパ形状に依存しないシーン表現とグリッパ形状を考慮した把持姿勢生成を拡散モデルで実現し、多様なグリッパ間で把持戦略を転移可能にした。
- ロボットビンピッキングのための6自由度把持の効率的なエンドツーエンド検出マニピュレーション2024/5/1
パワースフェリカル分布に基づく把持分布モデルを導入し、単一の上面深度画像から多様な衝突のない6自由度把持を生成する手法を提案。シミュレーションと実機で約90%の物体除去率を達成した。
- ロボットビンピッキングにおけるオンライン把持学習のための疑似ラベリングと文脈カリキュラム学習マニピュレーション2024/3/1
半教師あり学習と強化学習を組み合わせ、未ラベルデータを活用してビンピッキングのオンライン把持学習を効率化する手法を提案し、実機で有効性を示した。
- Uncertainty-driven Exploration Strategies for Online Grasp Learning2023/9/1
- DMFC-GraspNet: Differentiable Multi-Fingered Robotic Grasp Generation in Cluttered Scenes2023/8/1
- SA6D: Self-Adaptive Few-Shot 6D Pose Estimator for Novel and Occluded Objects2023/8/1
- Model-free Grasping with Multi-Suction Cup Grippers for Robotic Bin Picking2023/7/1
- Multi-Arm Bin-Picking in Real-Time: A Combined Task and Motion Planning Approach2022/11/1
- Deep Black-Box Reinforcement Learning with Movement Primitives2022/10/1
- Meta-Learning Regrasping Strategies for Physical-Agnostic Objects2022/5/1
- Hierarchical Policy Learning for Mechanical Search2022/2/1
- A Hybrid Approach for Learning to Shift and Grasp with Elaborate Motion Primitives2021/11/1
- Non-local Graph Convolutional Network for joint Activity Recognition and Motion Prediction2021/8/1
- Residual Feedback Learning for Contact-Rich Manipulation Tasks with Uncertainty2021/6/1
- Differentiable Robust LQR Layers2021/6/1
- Bayes-Adaptive Deep Model-Based Policy Optimisation2020/10/1