Haitao Lin
Tencent Robotics X
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/1
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストなゼロショット汎化を実現するインタラクティブワールドモデルを提案した。
- MaskWAM: マスクプロンプトと予測を統合したワールドアクションモデルVLA2026/6/11
ロボット制御のためのワールドアクションモデルに、マスクを入力と予測の両方に統合する手法を提案し、言語の曖昧さを低減して汎化性能を向上させた。
- Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへVLA2026/6/1
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデルVLA2026/4/8
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
- PoseVLA: 汎用ポーズ事前学習による汎化可能な視覚-言語-行動ポリシーVLA2026/2/1
VLAモデルの特徴崩壊と学習効率の低さを解決するため、カメラ中心の統一空間で3D空間事前知識を抽出する事前学習と、ロボット固有の行動空間への適応を行う事後学習に分離したPose-VLAを提案。離散ポーズトークンにより多様な3Dデータと軌道データを統合し、RoboTwin 2.0で79.5%、LIBEROで96.0%の成功率を達成。
- ロボットマニピュレーションのための人間参加型オンライン棄却サンプリングマニピュレーション2025/10/1
オンライン棄却サンプリングと人間による修正を組み合わせ、VLAモデルを安定かつ高精度に微調整する手法Hi-ORSを提案し、実機で接触の多い操作を短時間で習得させた。
- 一度だけ推定:ロボット把持のための統合・ワンステージ・リアルタイムカテゴリレベル関節物体6D姿勢推定6D姿勢推定2025/6/1
関節物体のカテゴリレベル6D姿勢推定を、インスタンス分割とNPCS表現を同時に出力する単一ステージのネットワークで実現し、200Hzのリアルタイム動作を可能にした研究。
- CAP-Net: 単一RGB-D画像からカテゴリ別関節部品の6D姿勢とサイズを推定する統合ネットワーク6D姿勢推定2025/4/1
RGB-D特徴を統合した単段ネットワークで、関節物体の各部品の6D姿勢とサイズをカテゴリレベルで推定する手法を提案し、sim-to-realギャップを埋める大規模データセットRGBD-Artも構築した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- LAC-Net: 遮蔽下での高精度ロボット把持のための線形融合注意誘導畳み込みネットワークマニピュレーション2024/8/1
RGBと深度を線形融合する注意誘導型ネットワークで物体の遮蔽部分を補完し、雑然とした環境でのロボット把持精度を向上させた研究。
- Polaris: 合成から実世界への視覚グラウンディングと大規模言語モデルによるオープンエンド対話型ロボットマニピュレーションマニピュレーション2024/8/1
GPT-4と視覚グラウンディングモデルを組み合わせ、合成データで学習した姿勢推定パイプラインにより、テーブルトップ上のオープンエンドな対話型マニピュレーションを実現するフレームワークを提案した。
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1
- PourIt!: Weakly-supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic Pouring2023/7/1
- Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions2022/5/1
- I Know What You Draw: Learning Grasp Detection Conditioned on a Few Freehand Sketches2022/5/1
- SAR-Net: Shape Alignment and Recovery Network for Category-level 6D Object Pose and Size Estimation2021/6/1