Haotian Zhang
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ARDY: ハイブリッド表現を用いた対話型人体動作生成のための自己回帰拡散モデル動作生成2026/7/1
リアルタイムでテキストや運動学的制約に従う高品質な3D人体動作を生成する、ストリーミング生成フレームワークARDYを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- GRAIL: 3Dアセットとビデオ事前知識から人型ロコ操作を生成ロコ操作2026/6/1
物理環境や遠隔操作を必要とせず、3Dアセットとビデオ基盤モデルの事前知識を用いて、人型ロボットの全身操作デモを仮想的に生成するパイプラインを提案した。
- AgentChemist: 化学認識と精密制御を統合したマルチエージェント実験ロボットプラットフォーム実験自動化2026/3/1
化学実験の自動化における長尾分布問題に対処するため、マルチエージェントロボットプラットフォームを提案。化学認識とフィードバック駆動制御を統合し、酸塩基滴定の検証で自律的な進行追跡と適応的な分注制御を実証した。
- Kimodo: 制御可能な人間動作生成のスケーリング動作生成2026/3/1
700時間の光学モーションキャプチャデータで訓練した、テキストやキネマティック制約で制御可能な高品質な人間動作生成モデルを提案した論文。
- Audio-VLA: 接触音知覚を視覚-言語-行動モデルに統合したロボットマニピュレーションVLA2025/11/1
接触音を入力に加えたマルチモーダルVLAモデルを提案し、視覚のみの制約を克服。シミュレーションに衝突音生成を追加し、動的プロセス評価指標TCRを導入して実験的に有効性を示した。
- GENMO: 人間の動作のための汎用モデル動作生成・推定2025/5/1
動作生成と動作推定を単一の枠組みに統合した汎用モデルGENMOを提案。動作推定を制約付き動作生成として再定式化し、回帰と拡散の相乗効果で高精度な推定と多様な生成を両立する。
- SMPLOlympics:物理シミュレーションされたヒューマノイドのためのスポーツ環境ヒューマノイド制御2024/7/1
人間の動作データと互換性のあるヒューマノイドモデルを用いて、ゴルフやテニスなど多様なオリンピック競技を物理シミュレーションで再現する環境群を構築し、強力な動作事前分布と単純な報酬の組み合わせで人間らしいスポーツ行動が学習できることを示した。
- ハイブリッド行動深層強化学習によるドローンと移動充電器のスケジューリング群制御2024/3/1
ドローンと移動充電器の協調スケジューリング問題に対し、離散・連続が混在する行動空間を扱うハイブリッド行動強化学習フレームワークHaDMCを提案した。