Yandan Yang
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ABot-M0.5: 移動と操作を統合した世界行動モデルVLA/移動操作2026/7/1
移動操作ロボットのための世界行動モデルを提案し、時間粒度・行動空間・学習と推論の整合性を揃えることで、長期的なタスク実行の精度とロバスト性を向上させた。
- ST-WAM: 視覚分布シフト下でのロバストな操作のための意味的時間的世界行動モデル操作2026/7/1
視覚分布の変化に頑健なロボット操作のため、DINOv3特徴を共有表現として用いる意味的時間的世界行動モデル(ST-WAM)を提案し、将来予測と履歴検索を改善した。
- DLAM: 時間的制約を伴う分布型潜在アクションVLA2026/7/1
本論文は、ロボットの行動データ不足を補うため、行動ラベルなしのビデオから潜在アクションを学習する新しいモデルDLAMを提案する。各遷移を対角ガウス分布として表現し、時間的整合性を保ちながら再構成誤差の伝播を抑えることで、ロボットポリシー学習の性能を向上させる。
- 多視点潜在事前分布による行動多様体学習を用いたロボット操作VLA2026/5/1
単眼入力の奥行き曖昧性を解決するため、事前学習済み多視点拡散モデルで潜在的な新視点を合成し、3次元幾何学的ガイダンスで多視点特徴を整列するG3Tと、有効な行動多様体上で直接行動を予測するAMLを提案した。
- 代数的一貫性を持つ潜在アクションモデル:視覚・言語・行動モデルのためのALAMVLA2026/5/1
アクションラベルなしの動画から潜在アクションを学習し、代数的一貫性(合成・可逆性)を課すことで、VLAモデルの生成に適した構造化された潜在遷移を獲得する手法を提案した。
- ABot-Claw: 持続的・協調的・自己進化型ロボットエージェントの基盤VLA/エージェント基盤2026/4/11
OpenClawを拡張し、異種ロボットの協調、視覚中心のマルチモーダル記憶、批評家ベースの閉ループフィードバックを統合することで、実世界での長期的・自己進化的なロボットエージェントを実現する基盤を提案した。
- ABot-PhysWorld: 物理整合を備えたロボット操作のための対話型世界基盤モデル世界モデル2026/3/1
物理的に不自然な操作動画を生成する問題を解決するため、物理認識アノテーション付きの大規模データセットとDPOベースの後訓練を導入し、物理的に妥当で行動制御可能な動画を生成する世界モデルを提案した。
- ABot-M0: 行動多様体学習によるロボットマニピュレーションのためのVLA基盤モデルVLA2026/2/1
異種ロボットデータを統合した大規模データセットUniACTを構築し、行動が低次元多様体上に存在するという仮説に基づくAction Manifold Learningで効率的なVLA基盤モデルを実現した。
- SceneWeaver: 拡張可能な自己反省型エージェントによるオールインワン3Dシーン合成3Dシーン生成2025/9/1
言語モデルベースのプランナーが多様なシーン生成ツールを選択し、自己評価と反復的な改善を通じて物理的・視覚的・意味的に整合した3D屋内シーンを合成するフレームワークを提案。
- World-Env: ワールドモデルを仮想環境として活用するVLAポストトレーニングVLA2025/9/1
物理的に整合性のあるワールドモデルを仮想シミュレータとして使い、VLAモデルを強化学習でポストトレーニングする枠組みを提案。タスクごとに5件の実演データだけで複雑なマニピュレーション性能を向上させる。
- MetaScenes: 実世界3Dスキャンからの自動レプリカ生成に向けてsim2real2025/5/1
実世界スキャンから構築した大規模シミュラブル3DシーンデータセットMetaScenesと、アセットを自動置換するマルチモーダル整合モデルScan2Simを提案し、ロボット操作とVLNのベンチマークで有効性を示した。
- PhyScene: 身体性AIのための物理的に操作可能な3Dシーン合成シーン生成2024/4/1
拡散モデルと物理・操作可能性に基づくガイダンスを組み合わせ、身体性エージェントが実際に操作できる3D屋内シーンを生成する手法を提案。