Di Zhang
Tongji University
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリングVLA2026/8/1
視覚言語行動モデルの堅牢性を向上させるため、幾何情報を考慮した多視点状態符号化と潜在世界モデルを導入し、手首視点の予測と共有潜在行動表現によりロボット操作性能を高めた。
- HiFi-UMI: 高忠実度UMIデータのみから展開可能な操作ポリシーを学習する操作学習2026/7/1
ロボットフリーのUMIデータ収集システムの忠実度を高めることで、実ロボットデータを使わずに直接展開可能な操作ポリシーを学習できることを示した論文。
- PhysInOne: 一つのスイートで実現する視覚物理の学習と推論データセット/物理推論2026/4/1
物理現象を捉えた大規模合成動画データセットPhysInOneを構築し、物理に基づく映像生成や将来予測、物理特性推定などの性能向上を示した。
- アクションチャンキングフローポリシーのためのネイティブ継続学習VLA2026/2/1
フローベースVLAポリシーのアクションチャンク境界の不連続を訓練時に滑らかにするLegatoを提案し、実機マニピュレーションでRTCを上回る性能を示した。
- 視点汎化可能なロボットマニピュレーションのための幾何学的3D視覚表現学習マニピュレーション2026/1/1
単視点の3D事前学習とマルチステップ蒸留により、多様なカメラ視点に汎化するマニピュレーション方策を学習するフレームワークを提案。
- 指し示す場所を意図せよ:視覚的根拠に基づく指示ポリシーVLA2025/12/1
言語指示にバウンディングボックスなどの視覚的手がかりを追加することで、混雑環境や未知物体でも対象を正確に特定できるVLAポリシー「Point-VLA」を提案し、自動データ注釈パイプラインで効率的に学習した。
- 視覚運動ポリシーに固有感覚状態は必要か?VLA2025/9/1
固有感覚入力を排除し視覚のみで動作を予測するState-free Policyを提案し、空間汎化性能が大幅に向上することを示した。
- KineDex: 触覚情報を取り入れた視覚運動ポリシーを運動感覚教示で学習する巧みな操作マニピュレーション2025/5/1
人間の手の動きを直接ロボットハンドに転送する運動感覚教示で触覚付きの実演データを収集し、触覚を統合した視覚運動ポリシーと力制御により接触の多い巧みな操作を実現した。
- SARGes: 意図チェーンによる意味的に整合した信頼性の高いジェスチャー生成ジェスチャー生成2025/3/1
大規模言語モデルで発話内容を解析し、意図チェーン推論で意味的なジェスチャーラベルを生成して、発話に同期した意味のあるジェスチャー合成を実現するフレームワークを提案した。
- 重要なものに集中:視覚ベース強化学習の汎化のための分離モデル強化学習/汎化2024/10/1
画像再構成を活用しつつ、タスク関連・無関連の表現を分離する2分岐モデルと一貫性損失で、未知環境への汎化性能を高める手法SMGを提案。