Pei Lin
Alibaba Inc.
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CAAT: 接触認識アテンションスケーリングと触覚マスキングによるデータ効率的な接触リッチ操作マニピュレーション2026/8/1
視覚と触覚を統合するTransformerベースのポリシーに、接触前後で情報の重みを切り替える接触認識アテンションスケーリングと動的触覚マスキングを導入し、デモからの学習効率と成功率を向上させた。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- TaF-VLA: 力に基づくマニピュレーションのための触覚-力アラインメントVLAモデルVLA2026/1/1
触覚入力を視覚的テクスチャではなく物理的な接触力に結びつけるTaF-Adapterを提案し、1000万件超の触覚-力同期データセットで学習してVLAモデルに統合した。
- PP-Tac: 触覚フィードバックを用いた巧みなロボットハンドによる紙つかみ触覚2025/4/1
高解像度触覚センサを備えた多指ロボットハンドで、紙のような薄くて柔らかい物体を把持するシステムを開発し、87.5%の成功率を達成した。