Wenlong Huang
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- SaiVLA-0: 大脳・橋・小脳の三部門構成による計算量を意識した視覚-言語-行動モデルVLA2026/3/1
脳の大脳・橋・小脳の役割分担に着想を得て、凍結した視覚言語基盤と適応層、高速な並列カテゴリカル制御を組み合わせたVLAアーキテクチャを提案し、特徴キャッシュにより学習時間短縮と成功率向上を示した。
- ROI駆動フォビエーション注意による視覚-言語-行動システムの統一エゴセントリック表現VLA2026/3/1
エンドエフェクタの姿勢を前方運動学で外部カメラに投影し、手中心の関心領域(ROI)を切り出すことで、手首カメラなしに高解像度の局所情報と全体文脈を両立するデータ表現を提案した。
- PointWorld: 実世界ロボット操作のための3D世界モデルのスケーリングマニピュレーション2026/1/1
RGB-D画像とロボットの行動コマンドから3D点群の動きを予測する大規模事前学習済み3D世界モデルを提案し、実機ロボットのモデル予測制御に応用した。
- Dream2Flow: 3Dオブジェクトフローで動画生成とオープンワールド操作をつなぐマニピュレーション2025/12/1
生成動画から3Dオブジェクトの動きを再構成し、それを中間表現として軌道追跡問題に変換することで、実演なしに多様な物体を操作できるフレームワークを提案。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- UAD: ロボットマニピュレーションの汎化のための教師なしアフォーダンス蒸留マニピュレーション2025/6/1
大規模視覚モデルと視覚言語モデルを組み合わせて、手動アノテーションなしでタスク条件付きアフォーダンスモデルを学習し、ロボット操作の汎化性能を向上させる手法を提案。
- VLM生成の反復キーポイント報酬による実機-シミュレーション-実機のロボットマニピュレーションマニピュレーション2025/2/1
VLMが言語指示とRGB-D観測からキーポイント間の関係に基づく報酬関数を生成・反復改善し、実世界シーンをシミュレーションで再構築してRL方策を訓練、実機へ展開する枠組みを提案。
- ReKep: ロボットマニピュレーションのための関係的キーポイント制約の時空間推論マニピュレーション2024/9/1
環境中の3Dキーポイント間の関係をPython関数で表す制約(ReKep)を導入し、大規模視覚モデルと言語モデルを用いて自由形式の指示から自動生成することで、多様なマニピュレーションタスクをリアルタイムに実行する手法を提案。
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Grounded Decoding: Guiding Text Generation with Grounded Models for Embodied Agents2023/3/1
- Code as Policies: Language Model Programs for Embodied Control2022/9/1
- Inner Monologue: Embodied Reasoning through Planning with Language Models2022/7/1
- Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents2022/1/1
- Generalization in Dexterous Manipulation via Geometry-Aware Multi-Task Learning2021/11/1