Zhengrong Xue
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MemoryWAM: 持続的メモリによる効率的な世界行動モデリングマニピュレーション2026/6/1
ロボット操作のための世界行動モデルに、最近のフレーム、イベント境界アンカーフレーム、長期履歴を要約するコンパクトなgistトークンを組み合わせたハイブリッドメモリ設計を導入し、長期的な記憶依存タスクを効率的に処理する手法を提案した。
- AffordGen: アフォーダンス対応による汎用物体操作のための多様なデモ生成模倣学習/データ生成2026/4/1
3D生成モデルと視覚基盤モデルを用いて、物体の意味的キーポイント対応に基づき多様な操作軌道を自動生成し、閉ループ視覚運動ポリシーの訓練データとして活用することで、未見物体へのゼロショット汎化を実現するフレームワークを提案した。
- ArrayTac:形状・硬さ・摩擦を連続的に提示する閉ループ圧電触覚ディスプレイ触覚2026/3/1
圧電アクチュエータアレイと閉ループ制御により、形状・硬さ・摩擦の3次元触覚を連続的に提示する触覚ディスプレイを開発し、遠隔腫瘍触診などへの応用を示した。
- MoE-DP:専門家混合で強化した拡散ポリシーによる長期的ロボット操作の堅牢化とスキル分解・失敗回復マニピュレーション2025/11/1
視覚エンコーダと拡散モデルの間に専門家混合層を挿入し、タスク段階ごとに専門家を動的に活性化することで、長期的操作の失敗回復と解釈可能なスキル分解を実現した。
- DemoSpeedup:エントロピー誘導によるデモンストレーション加速で視覚運動ポリシーを高速化模倣学習2025/6/1
人間が収集した遅いデモを、フレームごとの行動エントロピーに基づいて間引き、精度が必要な区間はそのままに余裕のある区間を加速して学習させることで、成功率を保ちつつ最大3倍速く動く視覚運動ポリシーを実現した自己教師あり手法。
- 三重階層拡散方策による視覚運動学習VLA2025/5/1
RGB-D入力・多スケール視覚表現・階層的条件付き拡散を組み合わせ、視覚特徴と行動生成の統合を強化した視覚運動方策を提案。44のシミュレーションタスクで平均27.5%改善し、実機双腕タスクでも高性能を示した。
- DemoGen: データ効率の良い視覚運動方策学習のための合成デモンストレーション生成模倣学習2025/2/1
タスクごとに1回の人間デモから、3D点群編集と行動軌道の適応により空間的に多様な合成デモを自動生成し、実世界のマニピュレーション方策の性能を大幅に向上させる手法を提案。
- MENTOR: タスク指向摂動を備えた視覚強化学習のためのMixture-of-Expertsネットワーク視覚強化学習2024/10/1
視覚強化学習のサンプル効率を改善するため、MLPをMixture-of-Expertsバックボーンに置き換え、タスク指向の摂動機構を導入した手法MENTORを提案。実機のマニピュレーションタスクで平均83%の成功率を達成した。
- AToM-Bot: 感情的心の理論で語られない人間のニーズを具現化するロボットVLA2024/6/1
視覚言語モデルと感情的心の理論を組み合わせ、明示的な指示なしに人間の状態を推測して必要なタスクを自発的に生成・実行するロボットフレームワークを提案し、人間による評価で高い満足度を得た。
- RiEMann: 点群セグメンテーション不要の準リアルタイムSE(3)同変ロボットマニピュレーションマニピュレーション2024/3/1
シーン点群から対象物をセグメンテーションせずに直接操作目標姿勢を予測するSE(3)同変な模倣学習フレームワークを提案し、5〜10回のデモで学習して未知のSE(3)変換や妨害物体に頑健、準リアルタイムで動作することを示した。
- ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch2023/6/1
- USEEK: Unsupervised SE(3)-Equivariant 3D Keypoints for Generalizable Manipulation2022/9/1