Jiankai Sun
Stanford University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmbodiedSWE:長期的器用ロボティクスのためのコーディングエージェントVLA2026/9/23
コーディングエージェントが長期的・器用なロボットタスクを解き、その解を多様な軌道に拡張してVLAを訓練し、実機タスクまで完了できることを示した研究。
- PRIMAL3: 強化学習と模倣学習によるマルチエージェント経路探索 - LaCAM3を活用した大規模フレームワーク群制御2026/8/1
本論文は、強化学習と模倣学習を統合した大規模マルチエージェント経路探索フレームワークPRIMAL3を提案し、ボトルネックや行き止まりなどの重要な状態でのエージェント間の協調を改善する。
- SARM2: 自己改善型ロボット操作のためのマルチタスク段階認識報酬モデリングマニピュレーション2026/6/1
長期的なロボット操作タスクにおいて、行動クローニングに依存せず、自己ロールアウトからポリシーを改善するための、段階推定器とMMoE価値ヘッドを組み合わせたマルチタスク報酬モデルRMと、それを用いた自己改善フレームワークSPIRALを提案した。
- 観測・行動の正準化による姿勢非依存のロボット機能的把持マニピュレーション2026/6/1
マグカップの取っ手を掴む機能的把持タスクにおいて、観測と行動を物体中心座標系に正準化する強化学習フレームワークAnyMugを提案し、シミュレーションのみで訓練した単一ポリシーを実機にゼロショット転移して高い成功率を達成した。
- LEGS: 具現化ガウススプラッティング世界における遠隔操作不要のVLA微調整による人型ロコ操作VLA/シミュレーション/人型ロボット2026/6/1
人型ロボットの移動操作タスク向けに、遠隔操作デモなしで合成データを生成し、VLAポリシーを微調整するハイブリッドシミュレータLEGSを提案。3DGS背景とメッシュ前景を組み合わせ、実機で遠隔操作デモと同等以上の性能を達成した。
- ロックインの打破:低データVLA後訓練における操縦性の維持VLA2026/4/1
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
- π、しかし飛ばす:VLAモデルの空中マニピュレーションへの物理誘導転移空中マニピュレーション/VLA2026/3/1
固定ベースのマニピュレータ向けに事前学習されたVLAモデルを空中プラットフォームへ転移させる際の「ダイナミクスギャップ」を、推論時のペイロード認識ガイダンスと合成データ生成で橋渡しし、空中ピックアンドプレースの成功率を向上させた。
- SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する自動運転/VLA2026/2/1
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
- V2X協調自動運転のエンドツーエンド競技会:研究課題と進展V2X協調自動運転2025/7/1
V2X通信を活用した協調自動運転のエンドツーエンド競技会を開催し、帯域制約下での知覚・計画の課題と上位解法の傾向を分析した。
- GRaD-Nav++:ガウスラディアンスフィールドと微分可能力学による視覚言語モデル駆動ドローン航法VLA2025/6/1
3Dガウススプラッティングシミュレータと微分可能強化学習で訓練した軽量VLAモデルを機載し、自然言語指示に従ってリアルタイムにドローンを飛行させるフレームワークを提案。
- ParticleFormer: 多物体・多素材ロボット操作のための3D点群ワールドモデルワールドモデル2025/6/1
剛体・変形・柔軟素材が混在する多物体操作を対象に、実ロボット知覚データから直接学習できるTransformerベースの3D点群ワールドモデルを提案し、MPCによる下流操作タスクで高精度な動力学予測を実現した。
- 空間認識型ロボット把持:汎用把持制御ポリシーマニピュレーション2025/5/1
単眼深度推定と6自由度把持プロンプトを統合した空間表現と拡散ポリシーにより、環境変化に頑健な汎用ロボット把持を実現した。
- CoinRobot: 物理的知能のための汎用エンドツーエンドロボット学習マニピュレーション2025/3/1
多様なロボットや環境に適応できる汎用エンドツーエンド学習フレームワークを提案し、7つのマニピュレーションタスクで拡散モデルベースの手法が高い性能と汎化性を示した。
- GRaD-Nav: ガウス放射輝度場と微分可能力学による効率的な視覚ドローン航法の学習VLA2025/3/1
3Dガウススプラッティングと微分可能強化学習を組み合わせ、視覚ベースのドローン航法ポリシーを効率的に学習するフレームワークを提案。シミュレーションから実機へのゼロショット転移と新しい環境への適応を実現した。
- SIREN: マルチロボットGaussian Splattingマップのセマンティック・初期化不要レジストレーションマルチロボットSLAM2025/2/1
カメラ姿勢や画像、初期変換が一切なくても、セマンティクスを活用して複数ロボットのGaussian Splattingマップを高精度に位置合わせ・統合する手法を提案。
- ARCH: 長期的な接触を伴うロボット組立のための階層型ハイブリッド学習マニピュレーション2024/9/1
パラメータ化されたスキルの低レベルライブラリと模倣学習で訓練した高レベル方策を組み合わせ、接触の多い長期的な組立作業を高精度かつデータ効率的に実現する階層型手法を提案。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- Foundation Models in Robotics: Applications, Challenges, and the Future2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Connected Autonomous Vehicle Motion Planning with Video Predictions from Smart, Self-Supervised Infrastructure2023/9/1
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play2023/2/1
- NeRF-Loc: Transformer-Based Object Localization Within Neural Radiance Fields2022/9/1
- Self-Supervised Traffic Advisors: Distributed, Multi-view Traffic Prediction for Smart Cities2022/4/1
- Dojo: A Differentiable Physics Engine for Robotics2022/3/1
- PlaTe: Visually-Grounded Planning with Transformers in Procedural Tasks2021/9/1
- Transferable Active Grasping and Real Embodied Dataset2020/4/1
- Learning a Decision Module by Imitating Driver's Control Behaviors2019/12/1