Jia-Bin Huang
収録論文 9本 ・ フィジカルAI/ロボット学習
世界モデル操作画像生成VLA/表現学習マニピュレーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- グアバ:身体的操作のための効果的で普遍的なハーネス操作2026/6/16
言語モデルを外部モジュールと組み合わせるハーネスフレームワーク「Guava」を提案し、反復的な知覚-推論-行動ループ、意味的アクション抽象化、マルチモーダル観測が重要であることを示した。シミュレーションで収集した少数の軌道から4Bモデルへの蒸留を行い、実世界でも高い性能と汎化を達成した。
- μ0: スケーラブルな3Dインタラクショントレース世界モデル世界モデル2026/6/11
ロボット学習のための、物体や手などの相互作用点の3D軌跡を予測する世界モデルを提案。多様なビデオから自動で3D教師信号を抽出し、行動ラベルなしで事前学習可能。
- UniVerse: セグメンテーション不要で多概念を分離可能な統一変調フレームワーク画像生成2026/5/29
複数物体を含む画像から、セグメンテーションマスクなしで特定の概念を正確に抽出・操作できる拡散トランスフォーマー向けの統一フレームワークを提案した。
- DynaFLIP:三モーダル動力学誘導表現によるロボット知覚の再考VLA/表現学習2026/5/1
画像と言語と3Dフローを組み合わせた動力学認識の事前学習フレームワークを提案し、ロボット操作のための視覚表現を向上させた。
- SIMPACT: 視覚言語モデルによるシミュレーション活用型行動計画マニピュレーション2025/12/1
視覚言語モデルにテスト時に物理シミュレーションを組み合わせ、追加学習なしで接触を伴う細かいマニピュレーションの行動計画を可能にした手法。
- TraceGen: 3Dトレース空間での世界モデリングによる異なる身体性の動画からの学習VLA2025/11/1
人間や他ロボットの動画を3Dトレース空間に変換し、少ない実機動画で新タスクを学習できる世界モデルTraceGenを提案。
- 想像・検証・実行:視覚言語モデルによる記憶誘導型エージェント探索VLA2025/5/1
視覚言語モデルでシーンを想像し物理的妥当性を検証してから行動する探索フレームワークIVEを提案し、多様な探索と下流学習の性能向上を実現した。
- Towards Computational Awareness in Autonomous Robots: An Empirical Study of Computational Kernels2021/12/1