Yansong Tang
Tsinghua University
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 受動的実行から能動的探索へ:実環境におけるエージェント型身体性マニピュレーションマニピュレーション2026/9/24
ロボットが指示をただ実行するのではなく、計画・知覚・実行の3モジュールを連携させて環境と動的に相互作用し、隠れた対象物を能動的に探索して操作するフレームワークを提案した。
- SkillMemo: 専門家ガイドによるスキル記憶フレームワークを用いた構成的手操作操作2026/8/1
長期的なデモンストレーションを潜在的な原子スキルに分解し、動的エピソード記憶バンクに統合することで、構成的一般化を向上させるフレームワークを提案。
- 物理ベースのロボット操作のための遮蔽に頑健な多物体分離3D再構成/物体分離/ロボット操作2026/6/28
遮蔽や視点不足による物体の結合を、スパースビューからの3D再構成問題として捉え、マスク不要で複数物体を分離・再構成する手法を提案。3Dガウシアンスプラッティングと拡散モデルを組み合わせ、シミュレーション可能な物体を生成する。
- StableVLA: 追加データなしで堅牢な視覚言語行動モデルを実現VLA2026/5/1
視覚障害に対するVLAモデルの脆弱性を調査し、情報理論に基づく軽量アダプタ(IB-Adapter)を提案。追加データや拡張なしで平均30%の性能向上を達成し、パラメータ増加は10M未満。
- SAFE-Pruner: 意味的注意に基づく未来予測型トークンプルーニングによる効率的な視覚言語行動操作VLA/効率化2026/5/1
視覚言語行動モデルの推論を高速化するため、将来の層の注意情報を予測して重要でない視覚トークンを刈り込むプラグアンドプレイ手法を提案した。
- TAIHRI: 近接ヒューマンロボットインタラクションのためのタスク認識型3D人体キーポイント位置推定ヒューマンロボットインタラクション2026/4/10
ロボットがユーザーの動作指示を理解し、タスクに関連する身体部位の3D座標を正確に推定する、初の視覚言語モデルを提案した。
- BiDexGrasp: 物体の形状とサイズを考慮した協調的な両手巧みな把持マニピュレーション2026/4/1
両手ロボットハンドによる巧みな把持のための大規模データセットと生成モデルを提案し、効率的なデータ合成パイプラインと協調・適応的な把持生成フレームワークを構築した。
- CLAP: 人間の動画から視覚-言語-行動モデルを学習するための対照的潜在行動事前学習VLA2026/1/1
人間の動画からロボットの行動スキルを抽出し、視覚-言語-行動モデルを事前学習するフレームワークCLAPを提案。対照学習で人間の動画をロボットの行動語彙に整合させ、効率的なスキル転移を実現した。
- ロボットマニピュレーションのための人間参加型オンライン棄却サンプリングマニピュレーション2025/10/1
オンライン棄却サンプリングと人間による修正を組み合わせ、VLAモデルを安定かつ高精度に微調整する手法Hi-ORSを提案し、実機で接触の多い操作を短時間で習得させた。
- RoDyn: ロボット操作のための対話型ロボット・ダイナミック2.5D世界モデルの構築世界モデル2025/10/1
ロボット操作のための幾何学的・運動学的推論を組み込んだ2.5D世界モデルを提案し、実世界模倣学習の成功率を42%向上させた。
- DSPv2: 全身移動マニピュレーションのための効果的で汎化可能な高密度ポリシーの改良移動マニピュレーション2025/9/1
3D空間特徴と多視点2D意味特徴を融合する新たなエンコーディングとDense Policyの拡張により、全身移動マニピュレーションの模倣学習における汎化性能と動作生成精度を向上させた。
- VLA-Reasoner: オンラインMCTSによる推論で視覚言語行動モデルを強化VLA2025/9/1
VLAモデルにテスト時スケーリングを適用し、ワールドモデルとMCTSで将来状態を予測・探索することで長期的な操作タスクの性能を向上させるプラグイン手法を提案。
- GWM: ロボットマニピュレーションのためのスケーラブルなガウス世界モデルマニピュレーション2025/8/1
ロボット操作のためのガウス世界モデル(GWM)を提案し、ガウスプリミティブの伝播を予測して将来状態を再構成することで、模倣学習とモデルベース強化学習を支援する。
- ManiGaussian++:階層的ガウス世界モデルによる汎用ロボット両腕マニピュレーションマニピュレーション2025/6/1
両腕ロボットのマルチタスク操作のため、役割の異なる腕を区別するガウス表現とリーダー・フォロワー型の階層的世界モデルを導入し、時空間ダイナミクスを予測して性能を向上させた。
- VLA-RL:スケーラブルな強化学習による汎用ロボットマニピュレーションの習得VLA2025/5/1
事前学習済みVLAモデルをオンライン強化学習で改善し、スパース報酬をVLMベースの報酬モデルで補うことで、LIBEROの40タスクで最高性能を達成した。
- AnyBimanual:単腕ポリシーを汎用両腕マニピュレーションへ転移マニピュレーション2024/12/1
事前学習済みの単腕ポリシーをスキルマネージャと視覚アライナで両腕タスクに転移し、少ない実演で汎用両腕マニピュレーションを実現する手法を提案。
- ManiCM: ロボットマニピュレーションのための一貫性モデルによるリアルタイム3D拡散ポリシーマニピュレーション2024/6/1
拡散モデルに一貫性制約を課すことで、点群入力からロボットの行動を1ステップで生成するリアルタイムマニピュレーションモデルを提案し、従来手法を平均10倍高速化した。
- ManiGaussian: マルチタスクロボット操作のための動的ガウシアンスプラッティングマニピュレーション2024/3/1
将来のシーン再構成を通じてシーンの動きを捉える動的ガウシアンスプラッティング手法を提案し、言語条件付きロボット操作タスクの成功率を向上させた。