Wei-Shi Zheng
Sun Yat-sen University
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Praxis: 一人称視点動画から物理的相互作用の事前知識を蒸留し、汎用的な全身マニピュレーションを実現全身マニピュレーション2026/9/25
一人称視点の実演動画から物理的相互作用の事前知識を抽出し、視覚言語誘導ナビゲーション・姿勢キャリブレーション・器用な全身操作を組み合わせることで、タスクごとの再学習なしに多様な物体操作を可能にするフレームワークを提案。
- TrapVLA: 設定された失敗モードへのVLAモデルのトラッピングセキュリティ/VLA2026/8/27
視覚言語行動モデルに対するバックドア攻撃の新タスクを提案し、テキストトリガーで特定の失敗パターンを誘発する手法を開発した。
- 統一潜在空間における異種スキルの段階的学習キャラクター制御2026/8/24
物理ベースのキャラクター制御において、多様なデータ・教師信号・タスクから得た異種スキルを統一潜在空間で段階的に学習するフレームワークHetSkillsを提案。モーション追跡、テキストからのモーション生成、モーション補完、下流タスク適応で有効性を示した。
- 動的操作の実現:単一の静的デモからの動的マニピュレーション学習マニピュレーション2026/8/1
単一の静的デモから多様な動的操作のデモを合成するデータ拡張パイプラインと、タスクの動的特性に応じて推論頻度を調整する適応的ポリシーを提案し、シミュレーションと実世界で高いデータ効率と性能を達成した。
- 堅牢なマルチロボット操作のための閉ループマルチエージェントフレームワーク群制御2026/7/1
LLMを用いた階層型閉ループエージェントフレームワークを提案し、複数ロボットの協調操作を実現。計画・操作・検証の3エージェントが連携し、実世界実験で高い成功率と適応性を示した。
- タスク編集による汎用3D視覚運動ポリシー学習模倣学習2026/6/1
3D視覚運動ポリシーの学習効率を高めるため、タスクをシーン・スキル・オブジェクトに分解し再結合するデモ生成フレームワーク「Task-Edit」を提案した。実世界実験で、長期的操作タスクにおける汎化性能の向上を実証した。
- HATS: マルチアームデータ収集のための人間エージェント遠隔操作システム遠隔操作/データ収集2026/6/1
単一の人間オペレータがMLLMベースのエージェントの支援を受けながら、複数アームの操作データを収集できる遠隔操作システムを提案。2本の主アームを人間が直接操作し、2本の補助アームをエージェントが制御することで、専門家2人によるチームと同等の効率と成功率を達成した。
- 抽象から具体へ:視覚言語行動モデルのための行動表現学習VLA2026/5/21
VLAモデルの分布シフト下での性能低下に対し、長期的な行動表現を学習するBehaviorVLAを提案。因果Mambaベースのエンコーダと位相条件付きデコーダで、シミュレーションと実世界で高い成功率とデータ効率を達成。
- 能動的空間脳と汎化可能な行動小脳によるヒューマノイド全身操作全身操作2026/5/1
複雑な3D環境での空間理解と行動生成の課題に対し、マルチエージェント大規模モデルを用いた能動的空間知覚と汎化可能な行動生成を組み合わせたヒューマノイド全身操作フレームワークを提案した。
- 多視点潜在事前分布による行動多様体学習を用いたロボット操作VLA2026/5/1
単眼入力の奥行き曖昧性を解決するため、事前学習済み多視点拡散モデルで潜在的な新視点を合成し、3次元幾何学的ガイダンスで多視点特徴を整列するG3Tと、有効な行動多様体上で直接行動を予測するAMLを提案した。
- BiDexGrasp: 物体の形状とサイズを考慮した協調的な両手巧みな把持マニピュレーション2026/4/1
両手ロボットハンドによる巧みな把持のための大規模データセットと生成モデルを提案し、効率的なデータ合成パイプラインと協調・適応的な把持生成フレームワークを構築した。
- DexGrasp-Zero: 形態整合型ポリシーによるゼロショット異種エンボディ器用把持マニピュレーション2026/3/1
異なる多指ハンド間でゼロショット転移可能な器用把持ポリシーを提案。解剖学的ノードと直交運動プリミティブを用いた形態整合グラフ表現と、物理特性注入機構を備えたグラフ畳み込みネットワークにより、未見のハンドへの汎化を実現。
- VLANeXt:強いVLAモデルを構築するためのレシピVLA2026/2/1
VLA設計空間を統一フレームワークで再検討し、12の知見をまとめた実践的レシピと、LIBEROなどでSOTAを上回るモデルVLANeXtを提案した論文。
- リスク認識型ワールドモデル予測制御による汎化可能なエンドツーエンド自動運転自動運転/モデルベース制御2026/2/1
専門家の模倣に頼らず、ワールドモデルで複数行動の結果を予測しリスク評価で低リスク行動を選ぶ枠組みを提案。危険行動を学習させて長尾シナリオでも安全な判断を可能にする。
- ReViP: 視覚-固有感覚の再バランスによる視覚-言語-行動モデルの偽完了の緩和VLA2026/1/1
VLAモデルが固有感覚に過度に依存して生じる「偽完了」問題を分析し、進捗を考慮した視覚的手がかりで視覚と言語の接地を強化する新フレームワークReViPを提案した。
- 人間同士のデモンストレーションから全身ヒューマノイド相互作用を学習するヒューマノイド/模倣学習2026/1/1
人間同士の相互作用データを物理的に整合する形でヒューマノイドに再ターゲティングし、いつ・どこで行動するかを分離して学習する階層的政策で全身協調動作を実現した。
- CycleManip: 履歴知覚と理解を活用した周期タスクマニピュレーションマニピュレーション2025/12/1
ロボットが周期的な動作を指定された終了時刻まで行うタスク(例:瓶を振る、釘を打つ)を、履歴の効果的な知覚と理解によりエンドツーエンドの模倣学習で実現するフレームワークとベンチマークを提案。
- デュアルアクターポリシーによる分解型物体操作マニピュレーション2025/11/1
物体操作を接近と操作の段階に分け、それぞれに特化した2つのアクターと段階を選択する意思決定器を組み合わせたDual-Actor Policyを提案し、新規データセットで従来手法を上回る性能を示した。
- ZeroDexGrasp: プロンプトベース多段階意味推論によるゼロショットタスク指向巧み把持合成マニピュレーション2025/11/1
マルチモーダル大規模言語モデルと把持リファインメントを組み合わせ、ラベル付きデータなしでタスクと物体の意味から人間らしい巧みな把持姿勢を生成するゼロショット手法を提案。
- OmniDexGrasp: 基盤モデルと力覚フィードバックによる汎用可能な巧みな把持マニピュレーション2025/10/1
基盤モデルで人間の把持画像を生成し、それをロボット動作に変換して力覚適応制御で把持する、多様な指示・タスク・ハンドに汎用可能な巧みな把持フレームワークを提案。
- World-Env: ワールドモデルを仮想環境として活用するVLAポストトレーニングVLA2025/9/1
物理的に整合性のあるワールドモデルを仮想シミュレータとして使い、VLAモデルを強化学習でポストトレーニングする枠組みを提案。タスクごとに5件の実演データだけで複雑なマニピュレーション性能を向上させる。
- TypeTele: 操作タイプでテレオペレーションに器用さを引き出すテレオペレーション2025/7/1
人間の手の動きを模倣するのではなく、ロボットハンド特有の操作タイプをライブラリ化し、MLLMでタスクに適したタイプを選択することで、テレオペレーションの器用さと成功率を向上させるシステムを提案。
- iManip: ロボットマニピュレーションのためのスキル漸進学習マニピュレーション2025/3/1
ロボットが既存の知識を保持したまま新しい操作スキルを追加学習できるスキル漸進学習フレームワークiManipを提案し、時間的リプレイと拡張可能なPerceiverIOで破滅的忘却を抑制した。
- AffordDexGrasp: 開集合言語誘導巧みな把持のための汎化可能な指示的アフォーダンスマニピュレーション2025/3/1
言語指示から未知カテゴリの物体を巧みに把持するため、汎化可能なアフォーダンス表現を介して言語と把持動作を結びつけるフレームワークを提案し、開集合での汎化性能を実世界で示した。
- TacCap: 人間からロボットへの技能転移を可能にするウェアラブルFBG触覚センサ触覚2025/3/1
Fiber Bragg Gratingを用いた軽量・耐久性のあるウェアラブル触覚センサTacCapを開発し、人間の把持データをロボットへ転移できることを把持安定性予測で示した論文。
- 両腕ロボット操作の再考:分離型インタラクションフレームワークによる学習マニピュレーション2025/3/1
両腕ロボット操作において、各腕に独立したモデルを割り当てつつ選択的インタラクションモジュールで協調動作も学習する分離型フレームワークを提案し、RoboTwinデータセットの7タスクでSOTAを23.5%上回る性能を達成した。
- 雑然環境におけるタスク指向6自由度把持姿勢検出マニピュレーション2025/2/1
雑然とした多物体環境で、特定のタスクに適した6自由度の把持姿勢を検出する問題を扱い、大規模データセット6DTGとベースライン手法OSTGを提案した。
- Real-to-Sim把持:把持検出におけるシミュレーションと実世界のギャップの再考マニピュレーション2024/10/1
6-DoF把持検出において、実世界の深度画像を推論時にシミュレーション空間へ適応させるReal-to-SimフレームワークR2SGraspを提案し、カメラノイズの影響を回避して高精度な把持検出を実現した。
- 6自由度把持検出のための経済的フレームワークマニピュレーション2024/7/1
高密度な教師信号が訓練コストのボトルネックであることを見出し、曖昧さの少ないラベルを選ぶ監督選択戦略と焦点表現モジュールにより、訓練時間・メモリ・ストレージを大幅に削減しつつ把持検出精度を向上させた。
- 言われたとおりに掴む:言語誘導による巧みな把持生成マニピュレーション2024/5/1
自然言語の指示に従ってロボットが巧みに把持を行うためのデータセットDexGYSNetと、意図に沿った高品質で多様な把持を生成するDexGYSGraspフレームワークを提案した。
- 巧みな把持のためのTransformerマニピュレーション2024/4/1
物体の点群から多様で実行可能な巧みな把持姿勢を1回の順伝播で予測するTransformerベースの枠組みを提案し、訓練とテストの段階的な工夫で把持の品質と多様性を向上させた。