Wen Huang
Tsinghua University
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LAWM-3D: 人間のビデオから3D認識潜在アクションを学習し、汎用ロボット世界モデルを実現世界モデル2026/8/6
人間のビデオから自己教師ありで3D認識可能な潜在アクションを学習し、ロボットの世界モデルを構築する手法を提案。マルチビュー入力の課題を解決するため、幾何学的整合性とRGB-D再構成を導入。
- 文脈内VLA:文脈内ポストトレーニングとエージェント的ツール使用による視覚言語行動モデルへの言語能力の付与VLA2026/8/1
視覚言語行動(VLA)モデルに、自由形式の思考連鎖ではなく、構造化された文脈情報とツール使用を通じて接地された言語を消費する能力を与えるフレームワークを提案し、シミュレーション環境でその有効性を示した。
- MathCoPilot: 数学研究のための人間とAIの共生パラダイムを実現する対話型システム定理証明2026/7/16
数学者が高レベルの方向性を指示し、AIエージェントが詳細な形式化と証明を実行する、人間参加型の数学研究支援システムMathCoPilotを提案した。
- AdaptiveLoad: 効率的なビデオ拡散トランスフォーマー学習に向けて学習最適化2026/5/18
ビデオ生成モデルの学習におけるGPU負荷不均衡を解消するため、メモリと計算量の二重制約による適応的負荷分散と、融合LayerNorm-Modulate CUDAカーネルを提案し、スループットを27.2%向上させた。
- D-VLA: 視覚言語行動モデルのための高並列分散非同期強化学習フレームワーク強化学習2026/5/1
大規模VLAモデルへの強化学習適用時のリソース競合を解決するため、物理分離と非同期パイプラインを備えた分散RLフレームワークD-VLAを提案し、スループットとサンプリング効率を大幅に向上させた。
- NoiseGate: ワールドアクションモデルにおける情報ゲーティングとしての潜在変数毎タイムステップスケジュール学習VLA2026/5/1
ロボットの行動生成と未来観測の予測を統合するワールドアクションモデルにおいて、各潜在フレームのノイズレベル(タイムステップ)を学習可能な情報ゲートとして扱い、行動生成に寄与する信頼性を動的に調整する手法NoiseGateを提案した。
- AIネイティブクラウド具身知能基盤のための千GPU大規模訓練と最適化レシピ基盤技術2026/3/1
具身知能の大規模訓練を実現するため、クラウド上に千GPU分散訓練プラットフォームを構築し、データパイプラインやモデル最適化、インフラ連携により訓練時間を40倍短縮した。