Yu Qiao
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現VLA/操作2026/3/1
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- カメラ空間で行動を接地する観測中心の視覚-言語-行動ポリシーVLA2025/8/1
ロボットの手先姿勢をロボット基準座標系ではなくカメラ座標系で予測するOC-VLAを提案し、視点変化への汎化とタスク成功率を改善した。
- 視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御をVLA2025/6/1
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
- Dita: 汎用視覚言語行動ポリシーのための拡散TransformerのスケーリングVLA2025/3/1
Transformerで連続行動列を直接ノイズ除去するマルチモーダル拡散フレームワークを提案し、多様なロボットデータを統合して長期的タスクや実環境適応を実現した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- LimSimシリーズ:自動運転の検証と強化のためのシミュレーションプラットフォーム自動運転シミュレーション2025/2/1
自動運転システムの検証・改善に向け、道路網情報や人間らしい意思決定アルゴリズム、関心領域(AoI)による計算最適化を統合したシミュレーションプラットフォームLimSimシリーズを提案。多様なベースラインアルゴリズムと評価指標を備え、モジュール型・エンドツーエンド・VLMベースの各システムに対応可能。
- ZOPP: 自動運転のためのゼロショットオフボードパノプティック知覚フレームワーク自動運転/パノプティック知覚2024/11/1
視覚基盤モデルのゼロショット認識能力と点群の3D表現を統合し、自動運転シーンの多様な要素を自動ラベリングするマルチモーダルなパノプティック知覚フレームワークを提案した。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。
- 拡散トランスフォーマーポリシーVLA2024/10/1
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
- DynamicCity: 動的シーンからの大規模4D占有生成4D生成2024/10/1
動的運転環境の大規模4D占有シーンを生成するフレームワークを提案し、HexPlane表現のVAEとDiTベース拡散モデルで高品質な生成を実現した。
- 対話型自動運転のための推論型マルチエージェント行動トポロジー自動運転2024/9/1
マルチエージェントの将来軌道からブレイド理論に基づく行動トポロジー(BeTop)を抽出し、予測と計画の一貫性を高める学習フレームワークBeTopNetを提案した。
- DriveArena: 自動運転のための閉ループ生成シミュレーションプラットフォーム自動運転シミュレーション2024/8/1
生成モデルで実写のような画像を作り出し、交通シミュレータと組み合わせて自動運転エージェントを閉ループで評価できる高忠実度シミュレーションシステムを構築した。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- 継続的に学習・適応・改善する:自動運転のための二重プロセスアプローチ自動運転2024/5/1
人間の認知プロセスに着想を得て、注意選択と二重プロセス意思決定(分析的推論とヒューリスティック処理)を組み合わせ、反省機構と記憶バンクで自己改善する自動運転フレームワークLeapADを提案。CARLAでの閉ループ評価でカメラ入力のみの手法を上回り、ラベルデータも大幅に削減できることを示した。
- RH20T-P: 組み合わせ可能な汎化エージェントに向けたプリミティブレベルロボットデータセットマニピュレーション2024/3/1
ロボット操作のための約3.8万本の動画クリップからなるプリミティブレベルデータセットRH20T-Pを構築し、計画実行型の組み合わせ汎化エージェントのベースラインを実装した。
- Rethinking Mutual Information for Language Conditioned Skill Discovery on Imitation Learning2024/2/1
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- LimSim++: A Closed-Loop Platform for Deploying Multimodal LLMs in Autonomous Driving2024/2/1
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- Real-time Holistic Robot Pose Estimation with Unknown States2024/2/1
- Towards Knowledge-driven Autonomous Driving2023/12/1
- On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving2023/11/1
- Tree-Planner: Efficient Close-loop Task Planning with Large Language Models2023/10/1
- DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models2023/9/1
- LimSim: A Long-term Interactive Multi-scenario Traffic Simulator2023/7/1
- Drive Like a Human: Rethinking Autonomous Driving with Large Language Models2023/7/1
- Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model2023/5/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- Perception Imitation: Towards Synthesis-free Simulator for Autonomous Vehicles2023/4/1
- Rethinking Range View Representation for LiDAR Segmentation2023/3/1
- Planning-oriented Autonomous Driving2022/12/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot2022/6/1
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline2022/6/1
- PointCLIP: Point Cloud Understanding by CLIP2021/12/1
- Affordance Transfer Learning for Human-Object Interaction Detection2021/4/1
- Pose-Assisted Multi-Camera Collaboration for Active Object Tracking2020/1/1