Tiejun Huang
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- OmniUMI:人間に合わせたマルチモーダルインタラクションによる物理的基盤を持つロボット学習マニピュレーション2026/4/1
UMI型インターフェースに触覚・把持力・外力などの物理的接触信号を統合し、拡散ポリシーで学習するシステムを提案。力に敏感な操作タスクで有効性を示した。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- π_RL: フローベース視覚言語行動モデルのオンライン強化学習ファインチューニングVLA2025/10/29
フローマッチングに基づく大規模VLAモデルに強化学習を適用するため、Flow-NoiseとFlow-SDEの2手法を提案し、分布内外で性能を向上させた。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- SpikeGrasp: ステレオスパイクストリームからの6自由度把持姿勢検出ベンチマークマニピュレーション2025/10/1
ステレオスパイクカメラの生イベントから点群復元なしで直接6自由度把持姿勢を推定する、神経模倣型リカレントスパイキングニューラルネットワークを提案し、大規模合成ベンチマークで従来手法を上回る性能とデータ効率を示した。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- SpikePingpong:スパイク視覚を用いた高速・低速卓球ロボットシステムマニピュレーション2025/6/1
スパイク視覚と模倣学習を組み合わせ、高速な球検出と軌道予測を行うファスト・スローシステムで高精度なロボット卓球を実現した。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出VLA2024/12/1
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。