Siyuan Huang
HappyWorld-Bench
収録論文 66本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間の実演からの視覚・触覚・行動の統合モデリングによる巧みなマニピュレーションマニピュレーション2026/9/28
人間の触覚データを活用し、視覚・触覚・行動を統合的に学習するモデルを構築して、巧みなロボットマニピュレーションの性能を向上させた。
- HappyWorld-Bench:世界モデルの信頼性を評価する総合ベンチマーク世界モデル評価2026/9/21
生成世界モデルがエージェントの相互作用下でどれだけ信頼できるかを、動画・空間・身体性の3トラックで評価するベンチマークを提案し、14の動画モデル、9の空間システム、8の身体性モデルを評価した。
- ArtManip: カテゴリレベルの関節物体ハンド内操作ハンド内操作2026/9/11
関節物体をロボットハンドで把持したまま操作するカテゴリレベル手法を提案し、シミュレーションで未見物体や多様な初期把持に汎化、実世界12物体へのゼロショット転移を実現した。
- DreamHand: ビデオ拡散モデルを転用した、遮蔽に頑健な自己中心視点3D手動作復元手動作復元2026/8/20
ビデオ拡散モデルを決定的な幾何エンコーダとして転用し、遮蔽やフレーム外の手の動きを復元する新しい手法を提案。5つのベンチマークでSOTAを達成し、特に遮蔽の多いデータで誤差を大幅に削減した。
- 不整地での脚式移動のための軌跡レベル自動カリキュラム学習歩行2026/8/17
不整地での脚式移動ポリシー学習において、地形マップから直接タスクを生成する軌跡レベルの自動カリキュラム学習フレームワークを提案し、成功率を大幅に向上させた。
- 人間レベルの巧みな遠隔操作を目指して遠隔操作2026/7/1
手と物体の同時追跡制御を用いて、人間の操作意図を学習済みの接触実行にマッピングし、物体の回転や長時間の道具使用など7つの難易度の高い遠隔操作タスクで高い成功率を達成した。
- ビデオ拡散モデルの手の動き再構築における驚くべき有効性手の動き再構築2026/6/29
事前学習済みのビデオ拡散モデルの表現を活用し、自己中心視点のビデオから4Dの両手のポーズを再構築する手法を提案。検出器やテスト時最適化を不要とし、既存手法を大幅に上回る性能を達成した。
- テスト時敵対的乗っ取り:ロボット拡散ポリシーに対するリアルタイムハイジャックインターフェースセキュリティ/拡散ポリシー2026/6/9
拡散ベースのロボットポリシーを攻撃者がリアルタイムに遠隔操作できるようにする手法TAKOを提案し、複数のタスクと環境で100%の成功率を達成した。
- EgoGuide: 効率的なロボット不要のデモ収集と学習のための自己中心視点ガイド模倣学習/データ収集2026/6/1
手首と頭部の自己中心視点を同期記録し、オンラインの視覚・幾何学的品質ガイドを提供するデモ収集インターフェースを提案。さらに、視点変動に頑健なゲート付き自己中心残差ポリシーを導入し、データ効率と遮蔽耐性を向上させた。
- 階層的アドバンテージ重み付けによるスパースなエピソード結果からのVLAオンラインRL微調整VLA/強化学習2026/6/1
事前学習済みVLAポリシーをオンライン強化学習で微調整する際、エピソードごとの成功/失敗のみのスパースな報酬を、生存性と効率性の2つの目的に分離し、状態適応的に重み付けして遷移レベルの学習信号を生成する手法を提案した。
- LARA: 視覚言語行動モデルのための潜在行動表現の整合VLA2026/6/1
本論文は、視覚言語行動モデルと潜在行動モデルを同時に最適化するプラグアンドプレイフレームワークを提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- AetheRock: 力誘導型視覚触覚学習のための腕装着型ロボット教示システム触覚/ロボット学習2026/6/1
腕に装着する触覚・力覚センサ付きデバイスと、力と視覚で触覚学習を誘導するフレームワークを提案し、接触を伴う操作タスクのデータ収集と学習効率を向上させた。
- ACE-Ego-0: 自己中心視点の人間とロボットデータを統合したVLA事前学習VLA2026/6/1
ロボットの軌跡データ収集のコストを抑えるため、大規模な自己中心視点の人間ビデオを擬似行動ラベルに変換し、ロボットデータと統合してVLAモデルを事前学習するフレームワークを提案した。
- VLA初期化のためのVLM表現の再考VLA2026/5/25
VLAモデルの初期化に使う事前学習済みVLM表現の設計を、能力別のVQA教師信号・パラメータ更新戦略・ロボットデータ事前学習の3軸で分析し、元のVLM表現の保持が重要で、LoRAベースの段階的学習が最良であることを示した。
- EgoProx: 認知階層にわたる自己中心3D近接推論におけるMLLMの評価VQA/ベンチマーク2026/5/23
自己中心視点での3D近接推論を評価するベンチマークEgoProxを提案し、多様なQAペアを生成するデータエンジンを設計。既存のMLLMの性能を分析し、空間知識はあるものの推論には課題があることを示した。
- DexJoCo: MuJoCo上でのタスク指向巧みな操作のためのベンチマークとツールキット巧みな操作2026/5/1
巧みなロボットハンドの操作能力を評価するための、11の機能ベースのタスクとデータ収集システムを含むベンチマークとツールキットを提案し、現代のモデルの性能を分析した。
- OmniClone: 頑健で万能な全身ヒューマノイド遠隔操作システムの構築遠隔操作2026/3/1
全身ヒューマノイド遠隔操作システムOmniCloneを提案し、診断ベンチマークOmniBenchを用いて従来手法の弱点を特定し、データレシピとシステム改良によりMPJPEを66%以上削減し、計算資源を大幅に削減した。
- OmniTrack: 物理的に整合した参照動作による汎用モーショントラッキングモーショントラッキング2026/2/1
人間の動作データをロボットで追従させる際、体格差やノイズによる物理的に不可能な参照動作を、シミュレーション上の特権方策で実行可能な動作に変換してから追従方策を学習する枠組みを提案。実機で長時間安定した追従やアクロバティック動作を実現。
- OmniXtreme:高ダイナミックヒューマノイド制御における汎用性の壁を突破ヒューマノイド制御2026/2/1
多様なモーションの学習と実機向けの物理的調整を分離したフレームワークを提案し、ヒューマノイドが多様で高難度な動きを実機で高精度に追従できるようにした。
- LessMimic: 統一距離場表現による長期的ヒューマノイドインタラクションヒューマノイド2026/2/1
距離場(DF)を統一表現として用い、参照動作なしで物体形状に汎化し、長期的な全身インタラクションを単一ポリシーで実現する手法を提案。
- UniAct:ヒューマノイドロボットのための統合動作生成とアクションストリーミングヒューマノイド制御2025/12/1
微調整したMLLMと因果的ストリーミングパイプラインを組み合わせ、言語・音楽・軌道などのマルチモーダル指示を500ms未満の遅延でヒューマノイドの全身動作に変換する二段階フレームワークを提案。
- 触覚と視覚の同時知覚によるマルチモーダルロボットマニピュレーション学習マニピュレーション2025/12/1
透明な弾性体と新規マーカーを備えた触覚・視覚同時センサTacThruと、Transformerベースの拡散方策を用いた模倣学習フレームワークTacThru-UMIを提案し、実世界の5タスクで平均85.5%の成功率を達成した。
- VacuumVLA: 吸引と把持を統合したエンドエフェクタでVLAの能力を強化する複雑ロボットマニピュレーションマニピュレーション2025/11/1
2本指グリッパと真空吸引ユニットを組み合わせた低コストなハイブリッドエンドエフェクタを開発し、DexVLAやPi0といったVLAフレームワークに組み込むことで、従来困難だった複雑な操作タスクを実現した。
- SafeFall: ヒューマノイドロボットのための保護制御学習ヒューマノイド/転倒保護2025/11/1
転倒が避けられないと予測した際に、強化学習で損傷を最小化する保護動作を実行するフレームワークを提案し、実機で接触力や関節トルクを大幅に低減した。
- 人間とヒューマノイドの協調による協働物体運搬の学習協働マニピュレーション2025/10/1
固有感覚のみを用いた強化学習で、リーダーとフォロワーの行動を単一ポリシーに統合し、人間とヒューマノイドが協調して物体を運ぶ手法を提案。シミュレーションと実機実験で有効性を検証した。
- VideoArtGS: 単眼動画から関節物体のデジタルツインを構築3D再構成2025/9/1
単眼動画から関節物体の形状・部位分割・関節パラメータを同時に復元し、高精度なデジタルツインを構築する手法を提案。
- SceneWeaver: 拡張可能な自己反省型エージェントによるオールインワン3Dシーン合成3Dシーン生成2025/9/1
言語モデルベースのプランナーが多様なシーン生成ツールを選択し、自己評価と反復的な改善を通じて物理的・視覚的・意味的に整合した3D屋内シーンを合成するフレームワークを提案。
- Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォームVLA2025/8/1
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
- GWM: ロボットマニピュレーションのためのスケーラブルなガウス世界モデルマニピュレーション2025/8/1
ロボット操作のためのガウス世界モデル(GWM)を提案し、ガウスプリミティブの伝播を予測して将来状態を再構成することで、模倣学習とモデルベース強化学習を支援する。
- Ag2x2: ゼロショット両手操作のためのロバストなエージェント非依存視覚表現両手操作2025/7/1
物体状態と手の動きを協調的にエンコードする視覚表現を提案し、人間の動画から両手操作スキルをゼロショット学習。13タスクで73.5%の成功率を達成。
- CLONE: 長時間タスクのための閉ループ全身ヒューマノイド遠隔操作遠隔操作2025/6/1
MRヘッドセットによる頭と手のトラッキングのみから、閉ループ誤差補正とMoEベースの学習で全身ヒューマノイドの遠隔操作を実現し、長時間の軌道でも位置ドリフトを抑えて複雑な協調動作を可能にした研究。
- ControlVLA: 事前学習済み視覚言語行動モデルのための少数ショット物体中心適応VLA2025/6/1
ControlNet風のアーキテクチャで物体中心表現を導入し、10〜20回のデモンストレーションだけで多様な実世界操作タスクに適応できるフレームワークを提案。
- RoboCerebra:長期的ロボットマニピュレーション評価のための大規模ベンチマークマニピュレーション2025/6/1
家庭環境での長期的なロボット操作タスクを評価する大規模ベンチマークを提案し、VLMによる高レベル計画とVLAによる低レベル制御を組み合わせた階層的フレームワークと評価プロトコルを構築した。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- EWMBench:身体性世界モデルのシーン・動作・意味品質を評価するベンチマーク身体性世界モデル評価2025/5/1
言語指示から物理的に妥当なシーンを生成する身体性世界モデル(EWM)を、視覚的一貫性・動作正確性・意味整合性の3軸で評価するベンチマークを提案した論文。
- EnerVerse-AC: 行動条件付きで身体性環境を想像する世界モデル世界モデル2025/5/1
エージェントの予測行動から将来の視覚観測を生成する行動条件付き世界モデルを提案し、実機や複雑なシミュレーションなしでロボット模倣学習のデータ拡張と評価を可能にした。
- 脚式ロコマニピュレーションにおける位置・力制御の統合ポリシー学習ロコマニピュレーション2025/5/1
力センサーなしで位置と力の制御を統合的に学習する脚式ロボット向けポリシーを提案し、四足マニピュレータとヒューマノイドで接触を伴う操作タスクの成功率を約39.5%向上させた。
- MetaScenes: 実世界3Dスキャンからの自動レプリカ生成に向けてsim2real2025/5/1
実世界スキャンから構築した大規模シミュラブル3DシーンデータセットMetaScenesと、アセットを自動置換するマルチモーダル整合モデルScan2Simを提案し、ロボット操作とVLNのベンチマークで有効性を示した。
- GROVE: オープン語彙の身体スキルを学習するための汎用報酬強化学習報酬設計2025/4/1
LLMとVLMを組み合わせて報酬を自動生成し、手設計や実演なしで多様な身体スキルを学習できる汎用報酬フレームワークを提案。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- Taccel: 高性能GPUシミュレーションによる視覚ベース触覚ロボティクスのスケールアップ触覚2025/4/1
視覚ベース触覚センサ(VBTS)を高精度かつ高速にシミュレーションするGPUプラットフォームTaccelを提案し、実時間の18倍の速度で数千並列環境を実現、sim-to-real転移も検証した。
- StyleLoco: 生成的敵対的蒸留による自然なヒューマノイドロボット歩行歩行2025/3/1
強化学習で俊敏な教師方策を訓練し、複数の識別器でモーションキャプチャデータと蒸留することで、俊敏さと自然な動きを両立させたヒューマノイド歩行フレームワークを提案。
- ManipTrans: 残差学習による効率的な両手巧み操作の転移マニピュレーション2025/3/1
人間の両手操作スキルをシミュレーション上のロボットハンドへ効率的に転移する二段階手法を提案し、大規模データセットDexManipNetを構築した。
- 敵対的データ収集:効率的でロバストなロボット模倣学習のための人間協調型摂動模倣学習2025/3/1
人間がリアルタイムで環境や指示を攪乱するHiL型データ収集法を提案し、少ないデモ数で模倣学習の汎化・ロバスト性・回復能力を大幅に向上させた。
- ArtGS: ガウシアンスプラッティングによる複雑な関節物体の操作可能なレプリカ構築3D再構成/関節物体2025/2/1
3Dガウシアンを用いて複数パーツの関節物体を異なる状態間で統合し、パーツメッシュ再構成と関節パラメータ推定を高精度・高効率で行う手法を提案。
- EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像VLA2025/1/1
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。
- 汎用ロボットマニピュレーションポリシーの効果的なファインチューニング戦略マニピュレーション2024/10/1
汎用マニピュレーションポリシーのファインチューニングにおいて、行動空間やポリシーヘッド、監督信号、調整可能パラメータの選択が性能に与える影響を大規模実験で調査し、低データ領域での有効な設計指針を提示した。
- SKT: 状態認識キーポイント軌道と視覚言語モデルを統合したロボット衣類操作衣類操作/VLA2024/9/1
視覚言語モデル(VLM)を用いて、多様な衣類の状態を単一モデルで認識しキーポイントを予測することで、ロボットによる衣類操作を汎用的に実現する手法を提案した。大規模合成データで学習し、キーポイント検出精度とタスク成功率を向上させた。
- SYNERGAI: 人間とロボットの協調のための知覚アライメントHuman-Robot Collaboration2024/9/1
3Dシーングラフを介して人間とロボットの知覚のずれをオンライン対話で自動修正し、協調作業を実現するLLMベースのシステムを提案した。
- 3Dシーンにおけるマルチモーダル状況推論VLA2024/9/1
3Dシーン内の状況理解のための大規模マルチモーダル質問応答データセットMSQAとナビゲーション評価ベンチマークMSNNを提案し、既存モデルの限界とマルチモーダル入力の重要性を示した。
- UniAff:視覚言語モデルによる道具使用と関節物体操作のためのアフォーダンス統合表現マニピュレーション2024/9/1
道具と関節物体の操作を統一的に扱うため、アフォーダンス認識と3D運動制約の推論を視覚言語モデルで行う手法UniAffを提案し、シミュレーションと実世界で汎化性能を向上させた。
- PhysPart: 操作可能物体の物理的に妥当な部品補完3D生成2024/8/1
操作可能な物体の欠けた部品を、形状だけでなく物理的な安定性と可動性を考慮して拡散モデルで生成する手法を提案。
- SlotLifter: スロット誘導特徴リフティングによるオブジェクト中心放射輝度場の学習オブジェクト中心学習/3D再構成2024/8/1
スロット誘導特徴リフティングを用いて、3Dシーンの再構成とオブジェクト分解を同時に行うオブジェクト中心の放射輝度モデルを提案し、合成・実世界データセットで高い性能を示した。
- A3VLM: 動作可能な関節構造を理解する視覚言語モデルVLA2024/6/1
物体の関節構造と操作可能性を理解する視覚言語モデルを提案し、ロボットに依存しない表現から簡単な動作プリミティブでロボット動作に変換できることを示した。
- GPT-4Vを用いた閉ループ型オープンボキャブラリ移動マニピュレーションVLA2024/4/1
GPT-4Vを活用し、未知環境での物体探索と操作を閉ループで行うロボットシステムを提案。実世界の8タスクで成功率を約35%向上させた。
- PhyScene: 身体性AIのための物理的に操作可能な3Dシーン合成シーン生成2024/4/1
拡散モデルと物理・操作可能性に基づくガイダンスを組み合わせ、身体性エージェントが実際に操作できる3D屋内シーンを生成する手法を提案。
- Ag2Manip: エージェント非依存の視覚・行動表現による新規マニピュレーションスキルの学習マニピュレーション2024/4/1
人間の操作動画からエージェント非依存の視覚表現と、ロボットの運動学を汎用エージェント代理に抽象化した行動表現を学習し、ドメイン固有のデモなしで新規マニピュレーションタスクの性能を大幅に向上させた。
- ManipVQA: マルチモーダル大規模言語モデルへのロボットアフォーダンスと物理的知識の注入VLA2024/3/1
ロボット操作に必要な道具検出・アフォーダンス認識・物理概念理解をVQA形式で学習させ、MLLMに操作中心の知識を注入するフレームワークを提案した。
- AnySkill: 対話型エージェントのためのオープン語彙物理スキル学習VLA2024/3/1
模倣学習で獲得した原子動作を、CLIP類似度を報酬とする高レベル方策で組み合わせ、未知のテキスト指示に応じた物理的に自然な人間動作を生成する階層的手法を提案。
- SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding2024/1/1
- An Embodied Generalist Agent in 3D World2023/11/18
- Grasp Multiple Objects with One Hand2023/10/1
- Bridging Zero-shot Object Navigation and Foundation Models through Pixel-Guided Navigation Skill2023/9/1
- Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model2023/5/1
- ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes2023/4/1
- GenDexGrasp: Generalizable Dexterous Grasping2022/10/1