Zhi Wang
Tsinghua University
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Text-to-3D Policy: 未見仕様への汎化のための細粒度言語-行動アラインメントVLA2026/9/30
言語指示と行動の対応をトークン単位で双方向に結びつけ、未見の細かい仕様変化にも対応できる3D拡散方策を実現した研究。
- ChunkTrust: 行動専門家の証拠に基づくロボット政策の実行ホライズン適応マニピュレーション2026/9/30
ロボット基盤政策が予測する行動チャンクの実行長を、固定値ではなく行動専門家の証拠から推論する潜在変数として扱い、訓練不要のセレクタと軽量アダプタで適応的に決定する手法を提案。
- CoDimRecon: 変形可能な曲線・曲面・体積を含むシミュレーション可能な3Dシーンのエージェント的再構成シーン再構成/sim2real2026/9/28
多視点RGB画像から、剛体・関節物体・変形物体を含む編集可能な3Dシーンをエージェント的に再構成し、ロッド・シェル・ソリッドの物理シミュレーションにそのまま使えるアセットを生成するフレームワーク。
- 実演不要の成功率報酬学習による汎用ロボット方策強化学習/報酬学習2026/9/27
専門家の実演なしに、方策の試行錯誤から成功率をブートストラップで学習し、汎用ロボット方策の強化学習を効率化する手法を提案。
- HarnessPAI:物理AIのための進化するハーネスVLA2026/9/24
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
- ChainVLA: 統一実行状態による長期的操作のためのビジョン・言語・行動クエリの連鎖VLA/操作2026/8/3
長期的な操作タスクにおいて、過去の行動の結果と現在の動作を連鎖させる新しいVLAポリシーを提案。進行状況コンテキストとモーションテールを統合し、高い成功率を達成。
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/1
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストなゼロショット汎化を実現するインタラクティブワールドモデルを提案した。
- 跳ぶ前に見よ:凍結VLAモデルのためのツリー探索を行動評価へ蒸留するVLA2026/7/1
凍結したVision-Language-Actionモデルの出力分布から有望な行動を選ぶため、シミュレーションでのモンテカルロ木探索で得た知識を軽量なQ値モデルに蒸留し、不確実性を考慮した評価で行動を選択するフレームワークSVAを提案した。
- 動く前に見る:動的3Dストーリーワールドにおける物語に基づく視覚的注意カメラプランニング2026/6/25
動的3D環境でのカメラプランニングにおいて、観察すべき視覚情報を能動的に決定するフレームワークを提案し、物語意図と物理的制約を満たす視点選択と軌道生成を行う。
- ForceBand: sEMGを用いた力強い操作の学習マニピュレーション2026/6/1
筋電位センサを搭載したリストバンドで人間の指先の力を推定し、力情報を含むデモンストレーションを生成してロボットの力制御を学習する手法を提案した。
- HumanEgo: 人間の一人称視点動画数分からのゼロショットロボット学習模倣学習2026/5/1
人間の一人称視点動画からロボット操作スキルをゼロショットで転移するフレームワークを提案。手と物体の相互作用をエンティティレベルで表現し、フローマッチングポリシーと補助損失で学習することで、ロボットデータ不要で高効率な学習を実現した。
- ElegantVLA: 効率的な視覚言語行動モデルのための思考タイミング学習VLA2026/5/1
VLAモデルの計算コストを削減するため、制御ステップごとに計算量を動的に調整するプラグイン型の位相適応推論フレームワークを提案。
- DuetHOI: 言語ガイドによる両手・物体動作生成と関節動作計画・接触精緻化マニピュレーション2026/3/1
言語指示から両手で関節物体を操作する動作を生成するフレームワークDuetHOIを提案し、接触意図予測・関節軌道計画・両手動作生成・接触精緻化を組み合わせて高精度な相互作用を実現した。
- RoboStream: 視覚言語モデルに時空間推論と記憶を統合したロボット操作フレームワークVLA2026/3/1
視覚言語モデルに時空間融合トークンと因果時空間グラフを導入し、長期ロボット操作における幾何学的定位と行動による状態変化の記憶を訓練なしで実現する。
- 電動義足膝の近位配置:ケーススタディ義足・リハビリ2026/2/1
電動義足膝の駆動部を膝上に配置する構成を試作し、膝下配置と比較して歩行速度とケイデンスが改善する可能性を示した探索的研究。
- Sparse ActionGen: リアルタイム枝刈りによる拡散ポリシーの高速化拡散ポリシー2026/1/1
拡散ポリシーの多段ノイズ除去を、観測に応じて動的に枝刈り・キャッシュ再利用することで最大4倍高速化し、リアルタイム制御を可能にした手法。
- IGen: オープンワールド画像からのロボット学習のためのスケーラブルなデータ生成データ生成2025/12/1
オープンワールド画像から3Dシーン表現とVLM推論を用いてロボットの視覚運動データを生成し、実世界データに匹敵する性能のポリシー学習を可能にするフレームワークを提案。
- VGGT-DP: 視覚基盤モデルによる汎化可能なロボット制御模倣学習/視覚運動ポリシー2025/9/1
3D知覚モデルVGGTを視覚エンコーダに用い、固有感覚フィードバックと組み合わせた視覚運動ポリシーを提案。トークン再利用とランダム枝刈りで推論を高速化し、MetaWorldタスクで高精度・長期的タスクの性能を向上させた。
- 空間ポリシー:空間認識モデリングと推論による視覚運動ロボット操作の誘導マニピュレーション2025/8/1
空間認識能力を欠く既存の視覚中心階層型モデルを改善するため、空間条件付き動画生成とフロー型行動予測、空間推論フィードバックを統合した操作フレームワークを提案し、23タスクで大幅な性能向上を達成した。
- 拡散ポリシー高速化のためのブロック単位適応キャッシュVLA2025/6/1
拡散ポリシーの推論を、ブロック単位で中間特徴を適応的にキャッシュ・再利用することで、学習不要で高速化する手法を提案。
- DoorBot: 触覚フィードバックを用いた実環境でのドア開けのための閉ループタスク計画と操作マニピュレーション2025/4/1
触覚フィードバックを活用した閉ループ階層制御により、未知の多様なドアを実環境で開けるロボットシステムを提案し、20種類の未知ドアで90%の成功率を達成した。
- 単峰確率分布による連続行動空間の離散化:オンポリシー強化学習のための手法強化学習2024/8/1
連続行動空間をポアソン分布で単峰的に離散化する方策を提案し、オンポリシー強化学習の収束速度と性能を向上させた。
- Rule-Based Reinforcement Learning for Efficient Robot Navigation with Space Reduction2021/4/1