Weixin Mao
LimX Dynamics
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FluxVLAエンジン:具現化知能のためのワンストップVLAエンジニアリングプラットフォームVLA2026/9/15
VLAモデルや世界行動モデル、オフライン強化学習を実ロボットに展開するための、データ形式・学習・評価・推論・ロボットインターフェースを統一するオープンな設定駆動型プラットフォームを提案。
- 長期的操作のためのアドバンテージ報酬モデリングマニピュレーション2026/4/1
長期的なロボット操作タスクにおいて、スパースな報酬の代わりに相対的なアドバンテージを推定する報酬モデリング手法を提案し、タオル折りタスクで高い成功率を達成した。
- オープンワールドタスク実行におけるVLAエージェントの長期記憶VLA/タスク実行2026/4/1
化学実験自動化のための二層メモリと将来状態予測を備えたVLAベースのフレームワークChemBotを提案し、長期的なタスク成功率を向上させた。
- BFA++: マルチビュー視覚言語行動モデルのための階層的ベスト特徴認識トークンプルーニングVLA2026/2/1
VLAモデル向けに、視点内・視点間の2段階重要度予測で動的にトークンを削減し、マルチビュー入力の計算効率と操作成功率を両立させるフレームワークを提案した。
- 一度見れば実行できる:ワンショット動画デモからタスクを学習する視覚-言語-行動モデルVLA2025/12/1
テスト時に1本の専門家デモ動画を見るだけで新しい操作スキルを獲得できるVLAモデルViVLAを提案し、未見タスクで30%以上の性能向上を達成した。
- VAT: ViTの全表現を活用する視覚行動トランスフォーマーVLA2025/12/1
ViTの全層の特徴を行動生成に融合させるVATを提案し、LIBEROベンチマークで98.15%の成功率を達成した模倣学習モデル。
- BFA: マルチビュー細粒度マニピュレーションのための最良特徴量認識融合マニピュレーション2025/2/1
マルチビュー画像を用いた細粒度マニピュレーションにおいて、各視点の重要度を軽量ネットワークで予測し、再重み付けして融合するプラグアンドプレイ手法を提案。タスク成功率を22-46%向上させた。
- RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行VLA2024/12/1
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
- Multi-GraspLLM:多様なロボットハンドのための意味誘導型把持生成マルチモーダルLLMマニピュレーション2024/12/1
自然言語指示に基づき、複数のロボットハンドに対応した把持姿勢を生成する統合フレームワークを提案し、接触注釈付き大規模データセットMulti-GraspSetを構築した。
- SegGrasp: セマンティック・幾何学誘導セグメンテーションによるゼロショットタスク指向把持マニピュレーション2024/10/1
視覚言語モデルと凸分解による幾何情報を組み合わせ、学習なしで対象物の機能部位を狙うゼロショット把持を実現したフレームワーク。
- SubjectDrive: 被写体制御による自動運転向け生成データのスケーリング自動運転/生成データ2024/3/1
被写体を制御できる生成モデルを開発し、多様な生成データを大量に作ることで自動運転の認識モデルの性能を継続的に向上させられることを示した。
- PillarNeSt: Embracing Backbone Scaling and Pretraining for Pillar-based 3D Object Detection2023/11/1
- ADriver-I: A General World Model for Autonomous Driving2023/11/1