Jiyao Zhang
Peking University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WorldLine: ロボットマニピュレーションのための行動駆動型視覚シミュレーションsim2real2026/9/29
行動なしのロボット動画1万時間以上から操作ダイナミクスを学習し、10種類以上の実機の行動軌跡で接地することで、異なる機体間で共有可能な行動駆動型視覚シミュレータを構築した研究。
- EVO-WAM: 映像と行動の検証による世界行動モデルの進化VLA2026/9/29
世界行動モデルが生成した映像と行動の軌跡を自己検証しながら反復学習し、追加の実演データなしで未知タスクへの適応を可能にしたフレームワーク。
- HIL-UMI: ユニバーサルマニピュレーションインターフェースへのVLAモデルのヒューマン・イン・ザ・ループ事後学習の導入VLA2026/9/17
ロボットを使わずにハンドヘルドUMIデモ中に方策を照会し、Energy Scoreで分布外状態を検出してデータ収集を促し、アドバンテージ推定器を更新してVLAモデルを事後学習する枠組みを提案。
- OpenDexGrasp: オープン語彙のタスク指向巧み把持マニピュレーション2026/9/16
自由形式の言語指示から機能意図を推論し、多視点視覚と物体形状に基づいて高自由度の巧みな把持を生成する統合フレームワークを提案。
- ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化VLA2026/8/31
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
- データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング操作プランニング2026/8/16
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
- Embodied3DBench: 視覚言語モデルの低水準身体化空間知能のベンチマークVLA/ベンチマーク2026/5/1
視覚言語モデルの身体化3D環境における低水準空間知能を評価するベンチマークを提案し、13モデルの評価と大規模データセットによる改善を示した。
- HiPolicy: 階層型マルチ周波数アクションチャンキングによるポリシー学習模倣学習2026/4/1
ロボットの模倣学習において、長期的な依存関係のモデリングと細かい閉ループ制御のトレードオフを解決するため、異なる周波数でアクション系列を予測する階層型マルチ周波数アクションチャンキングフレームワークを提案した。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- FreeArtGS: 自由移動シナリオにおける関節物体のガウシアンスプラッティング再構成3D再構成2026/3/1
単眼RGB-Dビデオから自由に動く関節物体を再構成する新しい手法を提案。部品分割と関節推定を組み合わせ、エンドツーエンドで最適化する。
- CADGrasp: 混雑環境における接触・衝突を考慮した汎用巧みな把持の学習マニピュレーション2026/1/1
単視点点群から、接触と衝突を考慮したスパースIBS表現を拡散モデルで予測し、それを用いて混雑環境でも衝突を避けつつ安定した巧みな把持姿勢を生成する二段階手法を提案。
- RealAppliance: 実マニュアルに整合した高忠実度家電アセットの制御可能化と実用化sim2real2025/12/1
実マニュアルと整合する物理・電子機構・プログラムロジックを備えた100種の高忠実度家電アセットデータセットと、家電操作計画を評価するベンチマークを提案した論文。
- TwinAligner: 視覚・動的アライメントによる物理認識Real2Sim2Realでロボットマニピュレーションを実現sim2real2025/12/1
シミュレーションと実世界の視覚・動的ギャップをSDF再構成と3DGSレンダリング、剛体物理同定で埋め、シミュレーションで訓練した方策を実世界へゼロショット転移させるReal2Sim2Realシステムを提案。
- SpikeGrasp: ステレオスパイクストリームからの6自由度把持姿勢検出ベンチマークマニピュレーション2025/10/1
ステレオスパイクカメラの生イベントから点群復元なしで直接6自由度把持姿勢を推定する、神経模倣型リカレントスパイキングニューラルネットワークを提案し、大規模合成ベンチマークで従来手法を上回る性能とデータ効率を示した。
- CorrectNav: 自己修正フライホイールによる視覚言語行動ナビゲーションモデルの強化VLAナビゲーション2025/8/1
訓練中の誤り軌道を自己修正データに自動変換して再学習を繰り返す「自己修正フライホイール」を提案し、単眼RGBベースのVLAナビゲーションモデルCorrectNavでR2R-CEとRxR-CEの成功率を大幅に更新した。
- CheckManual: マニュアルに基づく家電操作の新たな挑戦とベンチマークマニピュレーション2025/6/1
家電のマニュアルを読み取り、その指示に従ってロボットが操作を行うためのベンチマークCheckManualを提案し、マニュアルに基づく操作計画モデルManualPlanを構築した。
- ClutterDexGrasp:散らかった環境での汎用器用把持のためのSim-to-Realシステムマニピュレーション2025/6/1
散らかったシーンで目標物体を把持するため、シミュレーションで教師方策を訓練し、3D拡散方策の生徒モデルに蒸留して実機にゼロショット転移する閉ループシステムを提案した。
- 予測力注意を伴う適応的視触覚融合による巧みなマニピュレーションマニピュレーション2025/5/1
力誘導注意融合モジュールと自己教師あり未来力予測を導入し、操作段階に応じて視覚と触覚の重みを適応的に調整することで、接触の多い3つの実世界タスクで平均93%の成功率を達成した。
- 基盤モデル特徴駆動によるオンラインエンドエフェクタ姿勢推定:マーカーフリー・学習フリー手法姿勢推定2025/3/1
事前学習済み視覚特徴とCADモデルから2D-3D対応を求め、PnPと時系列最適化でエンドエフェクタの6D姿勢を学習なし・マーカーなしでオンライン推定する手法を提案。
- OmniManip: 物体中心のインタラクションプリミティブを空間制約として用いた汎用ロボットマニピュレーションマニピュレーション2025/1/1
物体の機能的アフォーダンスに基づく正準空間でインタラクションプリミティブを表現し、VLMの常識推論を3D空間制約に変換する二重閉ループ型のオープンボキャブラリなロボットマニピュレーションシステムを提案した。
- 巧みな視触覚ポリシー学習のための3D触覚の正準表現と力に基づく事前学習触覚2024/9/1
3D触覚データを正準表現に変換し、力に基づく自己教師あり事前学習を行うことで、巧みな手による接触の多い操作タスクの成功率を向上させた研究。
- 人間中心の屋内 embodied 配送ベンチマークembodied AI/配送2024/6/1
極地研究基地を模した多層建物内で、人間キャラクターと把持・移動可能なロボットによる配送タスクを再現する仮想環境と、13kの言語指示を含むデータセットを構築し、大規模マルチモーダルモデルを基盤としたベースライン手法を提案した。
- RoboKeyGen: 拡散モデルによる3Dキーポイント生成を用いたロボット姿勢と関節角度の推定姿勢推定2024/3/1
2Dキーポイント検出と拡散モデルによる3Dキーポイント生成に分けてロボットの姿勢と関節角度を推定し、従来法より高精度・高速に実現するフレームワークを提案。
- LVDiffusor: Distilling Functional Rearrangement Priors from Large Models into Diffusor2023/12/1
- RGBGrasp: Image-based Object Grasping by Capturing Multiple Views during Robot Arm Movement with Neural Radiance Fields2023/11/1
- GraspGF: Learning Score-based Grasping Primitive for Human-assisting Dexterous Grasping2023/9/1
- Robot Structure Prior Guided Temporal Attention for Camera-to-Robot Pose Estimation from Image Sequence2023/7/1