Boxin Shi
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexPolicy: 軌道誘導型巧みな操作のためのスケジュール探索マニピュレーション2026/9/30
強化学習による巧みな操作において、探索ノイズを訓練ステップに応じて徐々に減衰させるスケジュールを導入し、PPO・GRPO・FPOの3手法で成功率を大幅に向上させた。
- DeltaWAM: 双腕マニピュレーションのためのデルタ世界行動モデルマニピュレーション2026/9/23
映像の変化分(デルタ)と行動を同時に予測する世界行動モデルを提案し、双腕ロボット操作の成功率と推論速度を向上させた。
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- TACO: 触覚を考慮した世界モデルによるスケーラブルなVLAポストトレーニングの自己修正VLA/触覚/操作2026/7/1
接触を伴う操作タスクで失敗するVLAモデルに対し、触覚を考慮した世界モデルを用いて失敗状態を認識し、修正動作を想像・ラベル付けすることで、人間の介入なしにポリシーを改善するフレームワークを提案した。
- GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画VLA2026/6/16
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
- MotionVLA: ヒューマノイド動作のための視覚・言語・行動モデル動作生成2026/6/1
シーン画像とテキストから現実的なヒューマノイド動作を生成するため、動作を基本ストリームと物理ストリームに分離し、DCTとBPEで独立に圧縮する二重ストリーム周波数トークナイザを提案し、軽量な2Bバックボーンで多様性と一貫性を向上させた。
- 指示に基づく音声・映像同時編集フレームワークInstructAV2AV音声・映像編集2026/5/18
指示文に従って音声と映像を同時に編集する初のエンドツーエンドフレームワークを提案し、大規模データセットと新しい注意機構で高品質な編集を実現した。
- Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシーVLA2025/12/1
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
- SymmeTac: 対称カラーLED駆動によるカメラベース触覚センサ向け高効率フォトメトリックスステレオ再構成法触覚2024/11/1
対称に配置した赤青LEDとCMOSチャンネル分離を利用し、2ショットで表面法線を推定する高効率なフォトメトリックスステレオ法を提案。演算を加算のみに最適化し、カメラベース触覚センサの高精度・高速な形状再構成を実現した。