Wenming Yang
収録論文 7本 ・ フィジカルAI/ロボット学習
視覚グラウンディング触覚推定触覚推定/拡散モデルマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 必要なときだけ集中:適応的ルーティングと協調グラウンディングによる学習不要の視覚グラウンディング視覚グラウンディング2026/6/15
複雑な高解像度画像中の細部認識が苦手なMLLMに対し、サンプルの難易度に応じて処理を適応的に割り当てる学習不要のフレームワークLazyMCoTを提案。簡単なクエリは高速に処理し、難しいケースにはモデルの注意機構と外部視覚専門家を組み合わせた2段階精緻化で正確な局所領域を生成する。
- EgoTactile: 一人称視点ビデオから日常物体の把持圧力を学習する触覚推定2026/6/8
一人称視点ビデオと全手の圧力データを組み合わせたベンチマークを構築し、拡散モデルを用いて視覚情報から把持圧力を推定する手法を提案した。
- EgoPressDiff: 自己中心視点のUV領域手圧力推定のためのマルチモーダルビデオ拡散触覚推定/拡散モデル2026/6/5
自己中心視点の映像から手の表面圧力を推定する新しいビデオ拡散フレームワークを提案。手のポーズと3Dメッシュ頂点、深度情報を組み合わせて圧力場を生成し、従来手法より精度を大幅に向上させた。
- TGM-VLA: タスク誘導ミックスアップによるサンプリング効率とロバスト性を高めたロボット操作マニピュレーション2026/3/1
ロボットの模倣学習において、キーフレームサンプリングの冗長性と時間分布の不均衡を解消し、暗い物体の視認性を高める色反転投影と、タスク指示に応じて点群とアクションヒートマップを融合するタスク誘導ミックスアップを導入し、RLBenchとCOLOSSEUMで高い成功率を達成した。
- 6自由度把持検出の再考:高品質把持のための柔軟なフレームワークマニピュレーション2024/3/1
把持中心の視点から、シーン全体と特定対象の両方の把持に対応するFlexLoGを提案し、GraspNet-1Billionで大幅な精度向上と実環境で95%の成功率を達成した。
- ヒートマップ誘導による混雑環境での効率的な6自由度把持検出マニピュレーション2024/3/1
把持ヒートマップをガイダンスとして用い、局所領域に注目することで混雑環境でもリアルタイムに高精度な6自由度把持検出を実現した手法を提案。
- Explicit3D: Graph Network with Spatial Inference for Single Image 3D Object Detection2023/2/1