Songlin Wei
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SIMPLE: ヒューマノイドの移動操作のためのシミュレーションベースのポリシー学習と評価ヒューマノイド/シミュレーション2026/6/1
ヒューマノイドの全身移動操作タスクを対象とした、大規模で再現可能な統一シミュレーションテストベッドを提案し、多様なタスクとデータ生成パイプラインを統合して、シミュレーションと実世界の性能相関を示した。
- Ψ₀: 汎用人型ロコマニピュレーションに向けたオープン基盤モデルVLA2026/3/1
高品質な一人称視点の人間動画でVLMを事前学習し、人型ロボットの実機データで追加学習する段階的パラダイムにより、少ないデータで人型ロコマニピュレーションを実現するオープン基盤モデルを提案した。
- 視覚的推論を用いた文脈内模倣学習模倣学習2026/3/1
ロボットが少数のデモから新しいタスクを適応学習する際、視覚的な推論トレースをプロンプトに追加し、行動予測と推論過程を同時に学習するフレームワークを提案。シミュレーションと実世界で成功率と汎化性能が向上した。
- GraspVLA:10億規模の合成行動データで事前学習した把持基盤モデルVLA2025/5/1
シミュレーションで生成した10億フレームの把持データセットSynGrasp-1Bを用いて、視覚・言語・行動を統合したVLAモデルGraspVLAを事前学習し、実世界でのゼロショット汎化と少数ショット適応を実現した。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- Uni-NaVid:身体性ナビゲーションタスクを統合する動画ベースの視覚-言語-行動モデルナビゲーション2024/12/1
指示追従・物体探索・質疑応答・人物追跡など多様なナビゲーションタスクを単一モデルで統合し、未知の実環境での長期的な混合タスクを可能にする動画ベースのVLAモデルを提案。
- RoboHanger: 多様な衣類へのハンガー挿入を学習する汎化可能なロボットシステムマニピュレーション2024/12/1
平置きされた未知の衣類にハンガーを挿入するタスクを、サブタスク分割と低次元行動パラメータ化、シミュレータでの合成データ生成により学習し、実世界で8種類の未見衣類に対し75%の成功率を達成した。
- GAPartManip:材質に依存しない関節物体操作のための大規模パーツ中心データセットマニピュレーション2024/11/1
透明な蓋や反射する取っ手など深度知覚が難しい家庭内の関節物体を操作するため、材質ランダム化とパーツ単位の操作姿勢注釈を備えた大規模データセットを構築し、頑健な操作を可能にするモジュール型フレームワークを提案した。
- D3RoMa: 素材に依存しないロボットマニピュレーションのための視差拡散ベース深度センシング深度推定2024/9/1
ステレオ画像から拡散モデルで視差マップを予測し、透明・鏡面物体でも高精度な深度推定を実現してロボット操作を改善する手法を提案。
- SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects2023/12/1
- Make a Donut: Hierarchical EMD-Space Planning for Zero-Shot Deformable Manipulation with Tools2023/11/1