Dongdong Weng
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA/操作/sim2real3Dシーン生成ジェスチャー生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 実世界からシミュレーションへ、そして再び実世界へ:AMD ROCmベースの視覚言語行動操作パイプラインVLA/操作/sim2real2026/7/1
AMDのROCmソフトウェアスタックのみを用いて、視覚言語行動(VLA)モデルの訓練から実機のFrankaアームへの展開までを一貫して行うパイプラインを構築し、CUDA非依存で物理AI操作が可能であることを示した。
- HOG-Layout: 視覚言語モデルによる階層的3Dシーン生成・最適化・編集3Dシーン生成2026/4/12
大規模言語モデルと視覚言語モデルを用いて、テキストから階層的に3Dシーンを生成・最適化・編集する手法を提案した。物理的整合性と意味的一貫性を向上させ、リアルタイム編集を実現する。
- SARGes: 意図チェーンによる意味的に整合した信頼性の高いジェスチャー生成ジェスチャー生成2025/3/1
大規模言語モデルで発話内容を解析し、意図チェーン推論で意味的なジェスチャーラベルを生成して、発話に同期した意味のあるジェスチャー合成を実現するフレームワークを提案した。