Mike Zheng Shou
National University of Singapore
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Show-Harness: VLMエージェントだけでロボットを操作VLA2026/9/9
VLMが離散的な意味アクション単位を通じてロボットを直接制御できる「Embodied Harness」を提案し、GUIベースのデモ収集インターフェースGUMIも開発した。
- 失敗境界学習によるロバストな視覚言語行動モデルVLA2026/9/5
専門家デモの模倣だけでは失敗境界が不明なため、デジタルツインでのロールアウトとセマンティック進捗定位を用いて失敗境界を発見・整形し、ロバストなVLAモデルを実現する手法DLSを提案。
- VLAベースのエンドツーエンド自動運転のための協調的マルチモーダル相互作用自動運転2026/8/21
VLAモデルを用いた自動運転において、異種センサ間の効果的なマルチモーダル相互作用と複数軌道計画を統合し、安全性と解釈可能性を向上させるシステムを提案した。
- MANGO-Grasp: 幾何指向3Dガウス上のマハラノビス場によるクロスエンボディ器用把持把持2026/8/3
異なる多指ハンド間で安定した把持を合成するクロスエンボディ器用把持のため、物体を幾何指向3Dガウスプリミティブで、ロボットハンドを形態・運動学的記述子で表現し、マハラノビス場を用いて相互作用を予測・最適化するフレームワークを提案した。
- エルミート曲線による視覚言語行動モデルの軌道事前分布VLA2026/8/1
VLAモデルのアクションチャンクをエルミート曲線でパラメータ化し、滑らかさと連続性を明示的に強制する3つの変種を提案。正則化として用いるのが最も効果的で、実ロボットタスクで成功率を大幅に向上させた。
- ActionMap: ボクセル行動ヒートマップによるロボットポリシー学習VLA/行動表現2026/6/5
既存のVLAモデルの行動デコーダを、行動空間上のボクセルヒートマップを予測するヘッドに置き換えることで、学習効率と性能を向上させる手法を提案した論文。
- Dream.exe: ビデオ生成モデルは実行可能なロボット操作を夢見ることができるか?操作2026/6/3
ビデオ生成モデルが生成した操作映像を物理シミュレータで実行可能なロボット軌道に変換し、実行成功率で物理世界の理解度を評価するフレームワークDream.exeを提案した。
- 生き残るものを監視せよ:合成ロボット動画からの幾何学誘導VLA適応VLA/シミュレーション2026/6/1
合成ロボット動画から幾何学情報(2Dエンドエフェクタ経路点)を抽出し、VLAモデルの視覚バックボーンを補助タスクで調整する手法を提案。制御は実デモのみで学習し、幾何学情報で表現の崩壊を防ぐ。
- SWEET: 画像編集によるスパースな世界モデリングを用いた身体性タスク実行操作2026/5/19
ロボット操作タスクにおいて、密なビデオ生成の代わりに画像編集モデルを用いてタスク関連のキーフレームを予測するスパースな視覚世界モデルを提案し、計算コストを削減しつつタスク実行を可能にした。
- OmniHumanoid: ペアデータ不要の適応によるストリーミング型クロス身体性ビデオ生成ビデオ生成/身体性転写2026/5/12
異なる身体性(人間やロボット)間で動作を転写するビデオ生成フレームワークを提案。共有動作モデルと軽量な身体性アダプタにより、ペアデータなしで新しいロボットへの適応を可能にした。
- 多様性の罠を回避するアンカー中心適応によるロボット操作マニピュレーション2026/5/1
ロボット操作におけるVLAモデルの実機適応で、多様なデモ収集が逆効果になる「多様性の罠」を特定し、アンカー中心適応(ACA)という2段階フレームワークを提案。実機実験で成功率を向上させた。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- GameWorld: マルチモーダルゲームエージェントの標準化・検証可能な評価に向けて評価ベンチマーク2026/4/8
ブラウザ環境で動作するマルチモーダル大規模言語モデル(MLLM)を汎用ゲームエージェントとして評価するためのベンチマークGameWorldを提案し、34種類のゲームと170のタスクを通じて、現状のエージェントが人間の能力に遠く及ばないことを示した。
- Olaf-World: 動画世界モデリングのための潜在行動の方向づけ世界モデル2026/2/10
ラベルなし動画から行動制御可能な世界モデルを学習するため、潜在行動を映像特徴の時間差分に整合させるSeqΔ-REPAを提案し、ゼロショット行動転移とデータ効率を改善した。
- World-VLA-Loop:ビデオ世界モデルとVLAポリシーの閉ループ学習VLA2026/2/1
ビデオ世界モデルとVLAポリシーを相互に改善する閉ループ学習フレームワークを提案し、実世界での強化学習のコストを削減しつつVLA性能を向上させた。
- カテゴリレベルで汎化可能な触覚ツール操作のためのセマンティック・コンタクト場触覚2026/2/1
視覚的意味情報と密な接触推定を統合した3D表現「SCFields」を提案し、シミュレーション事前学習と実データ微調整により、未知のツールへの触覚操作の汎化を実現した。
- H2R-Grounder: 人間のインタラクション動画を物理的に接地したロボット動画へ変換するペアデータ不要のパラダイム動画生成/模倣学習2025/12/1
人間と物体のインタラクション動画を、ペアとなるロボット動画なしで物理的に整合したロボットマニピュレーション動画に変換する動画拡散ベースのフレームワークを提案。
- EVOLVE-VLA: 環境フィードバックによるテスト時訓練で視覚言語行動モデルを適応させるVLA2025/12/1
テスト時に環境との相互作用から学習し、ノイズの多い進捗推定を平滑化して方策を進化的に改善するVLA向けテスト時訓練フレームワークを提案。
- RobotSeg: 画像と動画におけるロボットセグメンテーションの基盤モデルとデータセットセグメンテーション2025/11/1
SAM 2を改良し、構造認識型メモリと自動プロンプト生成、ラベル効率の良い学習でロボットの画像・動画セグメンテーションを高精度化した基盤モデルと大規模データセットを提案。
- MachaGrasp: 形態認識型クロスエンボディメント巧みな手の把持のための関節動作生成マニピュレーション2025/10/1
手の形態記述から固有把持(eigengrasp)を導出し、低次元の関節係数を予測することで、異なる多指ハンドでも高速かつ高成功率に把持を生成するフレームワーク。
- VLA-Touch:二段階の触覚フィードバックで視覚-言語-行動モデルを強化VLA2025/7/1
ベースのVLAモデルを微調整せずに、触覚言語モデルによる高レベル計画と拡散ベース制御器による行動修正の二段階で触覚フィードバックを統合し、接触を伴うタスクの計画効率と実行精度を向上させた。
- DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation2023/12/1