Anh Nguyen
収録論文 54本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- グリッパー認識型視覚言語行動モデルVLA2026/8/25
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
- 人間とシーンのインタラクションのための効率的な接触表現人間-シーンインタラクション2026/8/10
人間と環境の接触情報をスパースなマスクで表現し、計算を高速化しつつ精度も向上させる手法を提案した論文。
- 視覚的把持を超えて:検出から実行までの複雑な把持のベンチマーキング把持/ベンチマーク2026/7/1
複雑な実世界の把持タスクを評価するための新しいベンチマークGCA-Benchを提案し、従来の視覚ベースの把持検出を超えて、シーン推論と意味的制約を含むタスクでの大規模基盤モデルの性能を評価した。
- CoMo3R-SLAM: 学習型3D再構成事前知識を用いた屋外マルチエージェント向け協調単眼高密度SLAMSLAM2026/5/1
単眼RGBカメラのみで、学習型の3D再構成事前知識を活用し、複数エージェントが協調して高密度で一貫した3D地図を構築するSLAMシステムを提案した。
- MAGS-SLAM: 単眼マルチエージェント・ガウススプラッティングSLAMによる幾何・光度整合的な再構成SLAM2026/5/1
RGBカメラのみを用いた複数エージェントによる3DガウススプラッティングSLAMを提案し、各エージェントが局所サブマップを構築して圧縮情報を交換することで、深度センサなしで協調的な高品質3D再構成を実現した。
- CodeGraphVLP: コードによる計画とセマンティックグラフ状態を組み合わせた非マルコフ型視覚言語行動モデルVLA/操作2026/4/1
長期的なロボット操作タスクにおいて、セマンティックグラフ状態とコードベースのプランナーを組み合わせ、視覚言語行動モデルの実行を支援する階層的フレームワークを提案した。
- 限られたデモデータ下での嗜好後悔によるニューロロボット方策最適化模倣学習2026/4/1
デモデータが少ない環境でロボットが複雑な行動を学習できるよう、自己模倣フレームワークMYOEと嗜好後悔を用いた方策最適化手法を提案した。
- AeroScene: 航空ロボティクス向け漸進的シーン合成シーン生成2026/3/1
階層型拡散モデルでドローン用の物理的に妥当な3Dシーンを自動生成し、大規模データセットを構築してナビゲーション等のタスクに応用した研究。
- 膨張式シリコンポケットを備えた軟硬ハイブリッドグリッパーによる摩擦調整把持グリッパー/把持2026/3/1
剛性シェルと空気圧で膨らむシリコンポケットを組み合わせたグリッパー指を提案し、把持力を上げずに摩擦を能動的に変えて、重い・滑りやすい・壊れやすい物体を安全に把持できることを実証した。
- 自己感応型空気圧可変剛性関節を用いたプローブから把持への操作マニピュレーション2026/3/1
柔軟な物体の剛性を推定し、適切な把持位置を選ぶための、自己感応型空気圧可変剛性関節を持つグリッパを用いたプローブから把持への操作フレームワークを提案した。
- 物体中心・幾何グラウンディングによる clutter に頑健な VLA モデルVLA2025/12/1
VLA の知覚と行動を分離し、タスク関連物体の領域選択と3D構造の強調を行う知覚モジュールを導入することで、 clutter や背景変化に強い操作を実現した。
- 言語条件付き世界モデルによる環境記述の読解と方策汎化の向上モデルベースRL2025/11/28
DreamerV3を拡張し、環境の振る舞いを記述した言語を注意機構で観測内の実体に結びつける世界モデルLED-WMを提案。専門家デモや計画なしに、未知のゲームへの方策汎化を改善した。
- SlotVLA: ロボットマニピュレーションにおける物体関係表現のモデリングVLA2025/11/1
物体中心・物体関係表現を用いたスロットアテンション型VLAフレームワークを提案し、物体注釈付きベンチマークLIBERO+を構築した。
- ロボットマニピュレーションにおける記憶状態の進展を再考する:オブジェクト中心の視点VLA2025/11/1
視覚的に類似した物体との連続的な相互作用を要する非マルコフ的タスクにおいて、物体ごとの履歴を保持するスロット中心のVLAフレームワークを提案し、LIBERO-Memベンチマークで評価した。
- MobiDock: ロボットドッキングによるモジュール型自己再構成両腕移動マニピュレータの設計と制御マニピュレーション2025/10/1
2台の独立ロボットが物理的に接続して1つの両腕移動マニピュレータになるモジュール型システムを提案し、ドッキングで協調制御を簡素化して安定性と効率を向上させた。
- 空気圧シリコーンポケットで把持中の摩擦を変調できるハイブリッドグリッパ指マニピュレーション2025/10/1
剛性シェルと膨張式シリコーンポケットを組み合わせたグリッパ指を提案し、内圧制御で表面摩擦を能動的に変えることで、把持力を上げずに重く滑りやすい物も壊れやすい物も安定把持できることを示した。
- OVITA: 開放語彙で解釈可能な軌道適応軌道適応2025/8/1
複数の大規模言語モデルを活用し、自然言語指示に基づいてロボット軌道を動的環境やユーザー好みに適応させる解釈可能なフレームワークを提案。
- GraspMAS: マルチエージェントシステムによるゼロショット言語駆動型把持検出マニピュレーション2025/6/1
複雑な言語指示や混雑環境に対応するため、Planner・Coder・Observerの3エージェントで把持を計画・実行・評価するゼロショット言語駆動型把持検出フレームワークを提案。
- 身体性行動連鎖推論とマルチモーダル基盤モデルによるヒューマノイドのゼロショット移動操作エージェントVLA2025/4/1
基盤モデルの推論と身体性行動連鎖(CoA)機構を組み合わせ、人間の指示を移動・操作のプリミティブ列に分解することで、ヒューマノイドのゼロショット移動操作を実現したフレームワーク。
- RoboDesign1M:ロボット設計理解のための大規模データセットデータセット2025/3/1
科学論文から収集した100万件のマルチモーダルデータでロボット設計理解のための大規模データセットを構築し、設計生成や質問応答などのタスクでベンチマークを提供した。
- 林業クレーンによる自律的な丸太把持に向けて:シミュレータとベンチマークマニピュレーション2025/2/1
林業クレーンの丸太把持・持ち上げを強化学習で自律化するため、MuJoCoベースの8自由度クレーンシミュレータを構築し、カリキュラム学習による速度制御で96%の成功率を達成、オープンソースのベンチマークを提供した。
- 不規則物体を動的に把持するためのオンライン軌道再計画マニピュレーション2025/1/1
不規則な物体を把持するため、10秒以内のオフライン初期軌道計画と100ms以内のオンライン軌道再計画を組み合わせた軌道最適化フレームワークを提案し、視覚の姿勢推定誤差や外乱に対応する。
- SplineFormer:血管内自律ナビゲーションのための説明可能なTransformerベース手法医療ロボティクス2025/1/1
ガイドワイヤの形状をスプラインとして予測するTransformerアーキテクチャを提案し、実機で血管内ナビゲーションを自律実行した研究。
- 柔軟な薄物把持のための受動空圧ソフト関節を備えたハイブリッドグリッパマニピュレーション2024/10/1
人間が指先で紙や布をつまむ動作に着想を得て、剛体回転関節にソフト空圧リングを組み合わせた2指ハイブリッドグリッパを開発し、薄く変形しやすい物体の把持効率を最大8倍改善した。
- GraspMamba: 階層的特徴学習を備えたMambaベースの言語駆動型把持検出フレームワークマニピュレーション2024/9/1
Mambaビジョンと階層的特徴融合を用いて、乱雑な画像や長いテキスト記述でも高速・高精度に把持位置を検出する言語駆動型モデルを提案した。
- Robotic-CLIP: ロボット応用のための行動データによるCLIPの微調整VLA2024/9/1
大規模な行動動画データでCLIPを対照学習により微調整し、動的な行動理解を可能にしたRobotic-CLIPを提案。言語駆動型ロボットタスクで既存CLIPモデルを上回り、実世界の把持タスクでも有効性を示した。
- 条件付き一貫性モデルによる軽量な言語駆動型把持検出マニピュレーション2024/7/1
拡散モデルを軽量化した一貫性モデルと言語プロンプトを組み合わせ、高速推論を実現する言語駆動型把持検出法を提案し、実機実験で有効性を示した。
- マスク誘導アテンションによる言語駆動型把持検出マニピュレーション2024/7/1
セグメンテーションマスクと言語指示をTransformerのアテンションで統合し、遮蔽に強い言語駆動型の把持検出を実現した研究。
- ネガティブプロンプト誘導を用いた言語駆動型6自由度把持検出マニピュレーション2024/7/1
自然言語の指示に基づき、散らかった点群の中から目的の物体を6自由度で把持する手法を提案。大規模データセットGrasp-Anything-6Dと、不要物体を避けるネガティブプロンプト誘導拡散モデルを導入した。
- 言語駆動の閉ループ把持:モデル予測による軌道再計画マニピュレーション2024/6/1
言語コマンドで対象物を指定し、6D姿勢推定とオンライン軌道計画を組み合わせた閉ループ制御により、動く物体を滑らかに把持するゼロショットのモジュール型フレームワークを提案した。
- ロボット支援心血管カテーテル治療におけるツールセグメンテーションのための多方向デコーダ分岐による弱教師あり学習医療画像セグメンテーション2024/4/1
1つのエンコーダと複数の分岐デコーダを持つU-Netで擬似ラベルを生成し、部分注釈のみの血管造影データからカテーテル器具を高精度にセグメンテーションする弱教師あり手法を提案した。
- Autonomous Catheterization with Open-source Simulator and Expert Trajectory2024/1/1
- Open-Fusion: Real-time Open-Vocabulary 3D Mapping and Queryable Scene Representation2023/10/1
- Learning to Terminate in Object Navigation2023/9/1
- Open-Vocabulary Affordance Detection using Knowledge Distillation and Text-Point Correlation2023/9/1
- Language-Conditioned Affordance-Pose Detection in 3D Point Clouds2023/9/1
- Grasp-Anything: Large-scale Grasp Dataset from Foundation Models2023/9/1
- Reducing Non-IID Effects in Federated Autonomous Driving with Contrastive Divergence Loss2023/3/1
- Open-Vocabulary Affordance Detection in 3D Point Clouds2023/3/1
- Two-Step Online Trajectory Planning of a Quadcopter in Indoor Environments with Obstacles2022/11/1
- Machine Learning-based Framework for Optimally Solving the Analytical Inverse Kinematics for Redundant Manipulators2022/11/1
- CathSim: An Open-source Simulator for Endovascular Intervention2022/8/1
- Deep Federated Learning for Autonomous Driving2021/10/1
- Occlusion-robust Visual Markerless Bone Tracking for Computer-Assisted Orthopaedic Surgery2021/8/1
- Autonomous Navigation with Mobile Robots using Deep Learning and the Robot Operating System2020/12/1
- Autonomous Navigation in Complex Environments with Deep Multimodal Fusion Network2020/7/1
- Hybrid Data-Driven and Analytical Model for Kinematic Control of a Surgical Robotic Tool2020/6/1
- End-to-End Real-time Catheter Segmentation with Optical Flow-Guided Warping during Endovascular Intervention2020/6/1
- Nonlinearity Compensation in a Multi-DoF Shoulder Sensing Exosuit for Real-Time Teleoperation2020/2/1
- Scene Understanding for Autonomous Manipulation with Deep Learning2019/3/1
- V2CNet: A Deep Learning Framework to Translate Videos to Commands for Robotic Manipulation2019/3/1
- Translating Videos to Commands for Robotic Manipulation with Deep Recurrent Neural Networks2017/10/1
- AffordanceNet: An End-to-End Deep Learning Approach for Object Affordance Detection2017/9/1
- Real-Time 6DOF Pose Relocalization for Event Cameras with Stacked Spatial LSTM Networks2017/8/1