Shuai Yang
Shanghai Jiao Tong University
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LongLive-Plug: 動画生成のための一度きりの蒸留フレームワーク動画生成2026/9/29
ベースモデルにLoRAとして再利用可能な能力を学習させ、下流モデルに訓練不要でプラグアンドプレイ展開できる蒸留手法を提案。
- VLMエージェントによる文脈内ロボット学習VLA2026/9/16
商用VLMを活用し、デモやフィードバックから勾配更新なしでロボット行動を生成するGPT-Policyを提案。実機実験で人間のビデオデモがタスク完了率を向上させることを示した。
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- 基盤から応用へ:実践におけるVLAモデルの改善VLA/ロボット基盤モデル2026/7/1
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
- TRIG: 軌道とリグを分離したメトリック幾何学習自動運転/幾何学習2026/7/1
自動運転のためのカメラ姿勢を自己軌道とカメラリグに分解し、それぞれを別々に学習する幾何認識フレームワークを提案。姿勢推定・深度予測・3D再構成でSOTAを達成。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応VLA2026/6/1
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
- WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおけるビデオワールドモデル2026/5/24
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。