Jing Wang
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MeRoPE: カメラ制御ビデオ生成のためのメトリック回転位置埋め込みビデオ生成2026/9/1
カメラ制御ビデオ生成において、実世界のメトリックカメラ軌道でスケール依存の失敗を起こさない、ノルム保存型の相対カメラエンコーディングMeRoPEを提案した。
- EgoNav: 学習されたウェイポイントと幾何学認識型ローカル制御を橋渡しする堅牢な屋内ナビゲーションナビゲーション2026/8/26
画像ゴールナビゲーションのための階層型システムで、学習済みウェイポイント予測を幾何学的安全性と方向整合性で補正し、適応型ローカルプランナーで実行する。シミュレーションと実機ヒューマノイドで成功率と経路効率を向上させた。
- ST-Topo GAN:手首運動の複雑さに対応した脳波-筋電図デコーディングモデルBMI/脳波-筋電図デコーディング2026/8/23
脳波から筋電図への連続デコーディングにおいて、手首運動の複雑な神経筋活動に対応するため、時空間トポロジーを考慮したGANモデルを提案し、従来手法を上回る精度を達成した。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- 認知症関連日常生活動作のための対話型LLMベースシミュレータヘルスケアAI2026/3/1
大規模言語モデルを用いて、認知症の重症度やケア環境に応じた患者の行動を模擬するウェブシミュレータを開発し、専門家による評価でその妥当性を検証した。
- EgoScale:多様な一人称視点ヒューマンデータによる器用なマニピュレーションのスケーリングマニピュレーション2026/2/1
2万時間超の一人称視点ヒューマン動画でVLAモデルを事前学習し、人間データ量と検証損失の対数線形則を発見。軽量な人間-ロボット中間学習により、22自由度ハンドの器用な操作成功率を54%向上させた。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- NanoVLA:軽量汎用ロボットポリシーのための視覚言語理解を分離したルーティングVLA2025/10/1
視覚と言語の融合を後段に分離し、長短アクションチャンキングと動的ルーティングを組み合わせることで、エッジデバイス上で最大52倍高速かつ98%少ないパラメータで動作する軽量VLAモデルを提案した。
- 見るために動き、動くために見る:拡散駆動の知覚-行動相互作用による適応的方策VLA2025/9/1
拡散方策のノイズ予測勾配を行動誘導SDEに組み込み、知覚と行動を循環的に学習させるDP-AGを提案。シミュレーションと実機UR5で既存手法を上回った。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- 社会的意図推定による自動運転の安全な車線変更自動運転/意思決定2025/4/1
周囲の人間運転車の譲る/通過する意図をDAGで推定し、深層強化学習で自動運転車の安全な車線変更判断を実現する手法を提案した。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- 接触条件誘導拡散モデルによる視覚ベース触覚画像生成触覚2024/12/1
物体のRGB画像と接触力データから、高忠実度な視覚ベース触覚センサ画像を生成する拡散モデルを提案し、従来手法より誤差を大幅に削減した。
- Ensemble diverse hypotheses and knowledge distillation for unsupervised cross-subject adaptation2022/4/1
- Learning to Socially Navigate in Pedestrian-rich Environments with Interaction Capacity2022/3/1
- A Relation Spectrum Inheriting Taylor Series: Muscle Synergy and Coupling for Hand2020/4/1
- Surface Following using Deep Reinforcement Learning and a GelSightTactile Sensor2019/12/1
- Temporal Logic Motion Control using Actor-Critic Methods2012/2/1
- Least Squares Temporal Difference Actor-Critic Methods with Applications to Robot Motion Control2011/8/1