Yan Shen
Peking University
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- リアルタイムVLAに向けて:段階認識型2ステップフローデノイジングとシステムレベル評価VLA2026/9/30
VLAモデルの推論とロボット実行の速度ギャップを分析し、フローデノイジングを2段階に削減する手法と分散リアルタイム実行フレームワークを提案、衣類折り畳みタスクで評価した。
- BiRoAD: 双腕マニピュレーションのための共有・役割適応表現学習マニピュレーション2026/9/20
双腕ロボットの動作を「腕交換で不変な協調構造」と「役割に応じて変化する成分」に分解し、役割の偏りに頑健な模倣学習を可能にする特徴変換フレームワークを提案。
- 1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング両腕操作/VLA/データセット2026/9/3
家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。
- AT-VLA: 適応的触覚注入による視覚言語行動モデルのフィードバック反応向上VLA/触覚/操作2026/5/1
接触を伴う操作タスクで視覚言語行動モデルの性能を高めるため、適応的に触覚情報を注入する仕組みと、高速な触覚反応を可能にする二重ストリーム構造を提案した。
- LeHome: 家庭環境における変形物体操作のためのシミュレーション環境シミュレーション/変形物体操作2026/4/1
家庭内の変形物体(衣類や食品など)を高忠実度で操作できるシミュレーション環境を提案し、低コストロボットでの評価を可能にした。
- BiPreManip: 予期的協調によるアフォーダンスに基づく両腕準備的操作の学習両腕操作2026/3/1
直接掴みにくい物体や機能的操作が難しい物体に対して、一方の腕が準備的操作を行い他方の腕の目標動作を可能にする両腕協調タスクを扱い、視覚アフォーダンスに基づくフレームワークを提案した。
- A3D: 双腕マニピュレーションによる適応的アフォーダンス組立マニピュレーション2026/1/1
家具組立のための双腕ロボットフレームワークA3Dを提案し、点群ベースの適応的アフォーダンス学習により多様な部品形状に対応した支持・安定化位置を特定する。
- Imagine2Act: 想像上の目標を用いた物体-動作の運動整合性によるロボットマニピュレーションマニピュレーション2025/9/1
言語指示から想像した目標画像と3D点群を生成し、物体の変形とエンドエフェクタ動作を整合させることで、高精度な物体再配置タスクを実現する模倣学習フレームワークを提案した。
- BiAssemble: 両手協調アフォーダンス学習による幾何学的組み立てマニピュレーション2025/6/1
破片の点群から両手協調に必要なアフォーダンスを学習し、割れた器などの幾何学的組み立てを実現する手法を提案。実世界ベンチマークで従来法を上回る性能を示した。
- SR3D: 単視点3D再構成で透明・鏡面物体の把持を実現マニピュレーション2025/5/1
単視点のRGB-D画像から外部の視覚モデルで物体メッシュを再構成し、視点・キーポイントマッチングで元のシーンに位置合わせすることで、透明・鏡面物体の把持を可能にする学習不要のフレームワークを提案。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- AdaManip: 適応的な関節物体操作環境と方策学習マニピュレーション2025/2/1
鍵やドアなど内部状態が見えない関節物体を試行錯誤で操作するための新しいシミュレーション環境と、3D視覚拡散を用いた模倣学習による適応方策を提案した。
- GarmentLab:衣服操作のための統合シミュレーションとベンチマーク変形物体操作2024/11/1
衣服や布の操作を学習・評価するための多様なタスクとリアルなシミュレーションを備えたベンチマークを提案し、sim-to-realギャップの縮小を目指す。
- 局所ダイナミクスの再帰的伝播による散乱物体の支持関係推定と対象物取り出しマニピュレーション2024/6/1
散乱した物体群の局所的な力学情報を再帰的に伝播させて支持関係グラフを構築し、対象物を安全に取り出すための操作順序計画を可能にする手法を提案した。
- NaturalVLM: 細粒度自然言語を用いたアフォーダンス誘導型視覚マニピュレーションマニピュレーション2024/3/1
家庭用ロボット向けに、細かい自然言語指示を段階的に解釈して物体操作を行う学習フレームワークと、15タスク・4500エピソード超のベンチマークNrVLMを提案した論文。
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1
- ImageManip: Image-based Robotic Manipulation with Affordance-guided Next View Selection2023/10/1
- Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions2023/9/1