Bowen Ping
収録論文 4本 ・ フィジカルAI/ロボット学習
視覚グラウンディングVLA画像編集VLA/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーションVLA2026/9/16
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
- CameraEditor: ビデオ事前分布の逐次モデリングによるカメラ制御画像編集画像編集2026/9/1
カメラパラメータを明示的に制御できる画像編集フレームワークを提案し、大きな視点変化を時間的なフレーム遷移に分解することで、構造破綻を防ぎつつ高精度なカメラ制御を実現した。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。