Muzhi Han
収録論文 8本 ・ フィジカルAI/ロボット学習
モバイルマニピュレーションタスクプランニングVLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- M2Diffuser: 3Dシーンにおけるモバイルマニピュレーションのための拡散ベース軌道最適化モバイルマニピュレーション2024/10/1
ロボット中心の3Dスキャンから移動と操作を統合した全身軌道を拡散モデルで生成し、推論時に物理制約とタスク目的を最適化する手法を提案。20以上のシーンで既存手法を上回り、実機転移も成功。
- M3Bench:3Dシーンにおけるモバイルマニピュレーションの全身動作生成ベンチマークモバイルマニピュレーション2024/10/1
3Dシーンで物体を並べ替える全身動作軌道を生成するモバイルマニピュレーションの新ベンチマークM3Benchを提案し、自動データ生成ツールと物理シミュレーション評価を提供する。
- InterPreT: 言語フィードバックからの対話的述語学習による汎化可能なタスクプランニングタスクプランニング2024/5/1
人間の非専門家による言語フィードバックから記号述語と作用素を学習し、PDDLに変換してロボットの長期タスクプランニングを実現するLLMベースのフレームワーク。
- GPT-4Vを用いた閉ループ型オープンボキャブラリ移動マニピュレーションVLA2024/4/1
GPT-4Vを活用し、未知環境での物体探索と操作を閉ループで行うロボットシステムを提案。実世界の8タスクで成功率を約35%向上させた。
- Ag2Manip: エージェント非依存の視覚・行動表現による新規マニピュレーションスキルの学習マニピュレーション2024/4/1
人間の操作動画からエージェント非依存の視覚表現と、ロボットの運動学を汎用エージェント代理に抽象化した行動表現を学習し、ドメイン固有のデモなしで新規マニピュレーションタスクの性能を大幅に向上させた。
- LLM³: 動作失敗の推論を組み込んだ大規模言語モデルベースのタスク・動作計画マニピュレーション2024/3/1
大規模言語モデルを使ってタスク計画と動作計画を橋渡しし、動作計画の失敗フィードバックをプロンプトで与えて提案を反復改善する、ドメイン非依存のTAMPフレームワークを提案した。
- Part-level Scene Reconstruction Affords Robot Interaction2023/7/1
- Reconstructing Interactive 3D Scenes by Panoptic Mapping and CAD Model Alignments2021/3/1