Yining Hong
収録論文 10本 ・ フィジカルAI/ロボット学習
VLA身体化空間知能動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- T²Mem: ロボティクスのためのテスト時メモリ学習VLA2026/9/29
事前学習済み視覚言語行動ポリシーに、テスト時訓練で観測履歴を圧縮した高速重みとして記憶させ、記憶不要なベース方策を大きく上回る成功率を達成した手法。
- ESI-Bench:知覚と行動のループを閉じる身体化空間知能のベンチマーク身体化空間知能2026/5/1
受動的な観察ではなく、能動的な探索を通じて空間理解を行う身体化空間知能のベンチマークを提案し、能動的探索が受動的観察より優れていることを示した。
- 試行錯誤からの学習:身体性LLMのための内省的テスト時計画VLA2026/2/1
実行前の内省で行動候補を生成・評価し、実行後の内省でモデルと方針を更新する内省的テスト時計画を提案し、長期的な家庭内タスクやロボット実験で性能向上を実証した。
- 身体性ウェブエージェント:物理世界とデジタル世界を統合するエージェント知能VLA2025/6/1
3Dシミュレーション環境とウェブインターフェースを統合したプラットフォームを構築し、料理・ナビゲーション・買い物など物理とデジタルの協調推論を要するタスクのベンチマークを提案した。
- SlowFast-VGen:行動駆動型長尺動画生成のための低速・高速学習動画生成2024/10/1
人間の補完的学習システムに着想を得て、低速学習(世界動態の拡散モデル)と高速学習(時間LoRAによるエピソード記憶)を組み合わせ、行動に基づく長尺動画生成の一貫性を向上させる手法を提案。
- 3D-VLA:3D視覚・言語・行動の生成的ワールドモデルVLA2024/3/1
3D知覚・推論・行動を生成的ワールドモデルで結びつけた基盤モデルを提案し、拡散モデルによる将来の画像・点群生成を通じて行動計画能力を向上させた。
- MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World2024/1/1
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1
- 3D Concept Learning and Reasoning from Multi-View Images2023/3/1
- Fixing Malfunctional Objects With Learned Physical Simulation and Functional Prediction2022/5/1