Yuhang Zheng
National University of Singapore
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GIFT: 行動指向の構造的監督による誘導中間特徴学習を用いたロボット操作マニピュレーション2026/9/3
視覚と言語の事前学習で得られる特徴と制御に必要な情報の乖離(行動十分性ギャップ)を埋めるため、中間特徴に幾何・アフォーダンス・目標領域の3つの制御関連構造を学習させるフレームワークGIFTを提案し、複数のポリシーで性能向上を確認した。
- WALA: 行動ラベル付きデモと行動フリー動画から実行可能な潜在行動を学習するロボット学習2026/7/1
行動ラベル付きデモと行動フリー動画の両方から実行可能な潜在行動を学習するフレームワークWALAを提案し、ロボットポリシーの性能と汎化性を向上させた。
- VT-WAM: 接触を伴う操作のための視覚-触覚ワールドアクションモデルマニピュレーション2026/7/1
接触を伴う操作タスク向けに、視覚予測・触覚変形予測・行動予測を統合したフレームワークを提案し、実世界6タスクで高い成功率を達成した。
- TouchThinker:大規模データと行動認識表現による触覚常識推論のオープンワールドへの拡張触覚2026/6/10
触覚常識推論をオープンワールドに拡張するため、大規模データセットと行動認識表現を備えた触覚言語フレームワークTouchThinkerを提案した。
- TacForeSight: 接触豊富な操作のための力誘導型触覚ワールドモデル触覚/操作2026/6/1
接触を伴う操作タスクにおいて、力覚と触覚の非対称な時空間的役割を考慮し、触覚潜在ダイナミクスを予測する軽量な触覚ワールドモデルと、予測結果を活用するポリシーを提案。実機実験で動的接触外乱下での優位性を示した。
- 動的環境におけるハイブリッド位置推定を用いた弾力的な時空間セマンティックメモリによる移動操作移動操作2026/6/1
事前地図なしの未知屋内環境で、RGB-D観測とLiDAR-慣性-視覚SLAMを統合し、オンラインで時空間セマンティックボクセルメモリを構築する移動操作フレームワークDREAMを提案。ポーズ補正後の冗長性を考慮したメモリ刈り込みと、言語条件付き3D検索・オープン語彙検出・MLLM検証による対象物の再獲得を実現し、実ロボット実験で成功率を向上させた。
- 潜在空間での高周波連続アクションチャンク学習ロボット制御2026/5/1
高周波(60Hzなど)のロボット制御において、アクション空間ではなくVAEによる潜在空間でアクション学習を行うことで、時間的・空間的一貫性を向上させ、さらにチャンク間の連続性を改善する手法を提案した。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作マニピュレーション2026/4/1
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- その手の中の世界:実環境での人間中心マニピュレーション学習のための大規模オープンソースエコシステムマニピュレーション2025/12/1
実環境で収集した1000時間超の人間のマニピュレーションデータとウェアラブル収集キット、ベンチマークをオープンソースで提供し、ロボットのマニピュレーション成功率を8%から60%に向上させた。
- ShapeForce:接触の多いマニピュレーションのための低コスト柔軟ロボット手首触覚2025/11/1
人間が接触時の相対的な力変化を利用することに着想を得て、柔軟コアの変形をマーカー追跡で推定し力覚信号を生成する低コストでプラグアンドプレイな柔軟手首を提案。6軸力覚センサに匹敵する性能を接触の多いタスクで実現した。
- 模倣学習ベースのエンドツーエンド自動運転におけるデータスケーリング則自動運転2024/12/1
400万件の運転デモデータを用いて、模倣学習ベースのエンドツーエンド自動運転モデルの性能がデータ量に対してべき乗則に従うことを示し、長尾データの重要性や組み合わせ汎化を明らかにした。
- PlanAgent: マルチモーダル大規模言語モデルによる閉ループ車両運動計画自動運転計画2024/6/1
マルチモーダルLLMを認知エージェントとして用い、BEV地図とテキスト記述から階層的推論でプランナコードを生成し、反省モジュールで評価する閉ループ車両運動計画システムを提案。nuPlanで評価。
- GaussianGrasper: オープンボキャブラリなロボット把持のための3D言語ガウシアンスプラッティングマニピュレーション2024/3/1
3Dガウシアンスプラッティングでシーンを明示的に表現し、言語埋め込みを蒸留することで、言語指示に基づくオープンボキャブラリな物体把持を実現した。