Xi Wang
Tsinghua University
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- 協調型マルチロボット建設のためのスキル系列計画群制御2026/9/22
建設作業を複数の多機能ロボットが協調して行うため、再利用可能なスキル(把持、穴あけ、締結など)を組み合わせた系列を自動計画する手法を提案。デジタルツイン上で人間が確認・承認できる。
- 免疫世界モデル:マルチスケール予測と治療仮説生成免疫モデリング2026/9/13
AI科学者が構築した免疫世界モデルで、介入が細胞・組織・個体レベルの免疫状態をどう変えるかを予測し、新たな治療仮説を提案した。
- EgoTrack3D: 自己中心視点3D物体追跡のためのモジュラーフレームワーク3D追跡2026/8/8
自己中心視点のRGBビデオから動的な3Dシーン表現を再構築・維持するモジュラーフレームワークを提案し、静的・動的物体の持続的な3D追跡を実現した。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測操作2026/8/1
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
- EgoHTR: 人間の地形移動の自己中心視点4Dデモンストレーション歩行2026/7/1
自己中心視点のウェアラブルと3Dスキャナを用いて、複雑な環境での人間の移動シーンを再構成するパイプラインとデータセットを構築し、これを活用して人型ロボットの移動ポリシーを訓練し実機で検証した。
- ATOM-Bench: 操作ポリシーにおける原子スキルと構成的一般化のための実世界ベンチマークマニピュレーション2026/6/1
実世界の操作ポリシーを評価するためのベンチマークATOM-Benchを提案し、原子スキルと構成的一般化を分離して評価する。
- 環境条件が異なる接触を伴う物理的ヒューマンロボットインタラクションにおけるマルチモーダル生理評価pHRI/生理計測2026/6/1
接触を伴う作業中の物理的ヒューマンロボットインタラクションにおいて、温度・騒音・照度の異なる18条件で生理信号を計測し、作業成績は安定する一方で温度上昇時に自律神経負荷が増加する補償メカニズムを発見した論文。
- MV-Actor: 両腕操作のためのマルチビュー意味論と空間認識の整合マニピュレーション2026/6/1
両腕ロボット操作のためのマルチビュー認識フレームワークを提案し、視点間の意味共有と空間認識を強化して、シミュレーションと実機で高い成功率を達成した。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- EgoVerse:世界各地から収集したロボット学習用の自己中心視点人間データセットデータセット/模倣学習2026/4/1
人間の自己中心視点のデモデータを大規模に収集・共有するプラットフォームとデータセットを構築し、人間データからロボットへの転移学習の大規模実験を行った。
- EgoFlow: 勾配誘導フローマッチングによる自己中心視6DoF物体動作生成動作生成2026/4/1
自己中心視映像から物体の6DoF動作を生成するフローマッチングフレームワークを提案し、物理的制約を勾配として組み込むことで衝突回避と滑らかな動作を実現した。
- GMT: 3Dシーンにおける6自由度物体軌道合成のための目標条件付きマルチモーダルトランスフォーマー操作計画2026/3/1
3Dシーン内で物体の6自由度操作軌道を生成するマルチモーダルトランスフォーマーモデルを提案し、3Dバウンディングボックス、点群、意味カテゴリ、目標姿勢を統合して高精度な軌道合成を実現した。
- 無線駆動する薄型誘電エラストマーアクチュエータ搭載ソフトロボットソフトロボティクス2025/12/1
薄型誘電エラストマーアクチュエータとオンボード電子回路を統合し、220Vの低電圧で無線駆動する小型ソフトロボットを開発した。
- 微分可能シミュレーションを用いた探索による自動運転の経路計画経路計画2025/11/1
微分可能シミュレータWaymaxを次状態予測器と評価器として活用し、勾配降下と確率的探索を組み合わせて行動系列を最適化する経路計画手法DSSを提案した。
- GaussianVLM: 言語対応ガウシアンスプラットによるシーン中心3D視覚言語モデルVLA2025/7/1
3Dガウシアンスプラットに言語特徴を直接埋め込み、物体検出器に依存せずに3Dシーン理解と身体性推論を行う視覚言語モデルを提案した。
- 建設現場におけるLLMとデジタルツインを統合した適応型マルチロボットタスク割り当て群制御2025/6/1
建設現場のような動的環境で、デジタルツイン・整数計画法・大規模言語モデルを組み合わせ、自然言語による指示で再計画できるマルチロボットの適応的タスク割り当てフレームワークを提案した。
- MAPLE: 一人称視点動画から学習した器用なロボット操作の事前知識のエンコードマニピュレーション2025/4/1
一人称視点の大規模動画から物体との接触点と手の姿勢を予測する特徴を学習し、それを用いて器用なロボット操作の政策を訓練する手法を提案。シミュレーションと実機の17自由度ハンドで有効性を示した。
- 微振動吸着システムの設計と特性評価吸着・壁面移動2025/4/1
柔軟な円盤を振動させて非接触で強い吸着力を生み出すVBA技術を提案し、自重の51倍以上の吸着力を実現した。
- Articulate3D: 3Dシーンを汎用シーン記述として包括的に理解する3Dシーン理解2024/12/1
関節物体の高品質アノテーションを備えた3D屋内シーンデータセットArticulate3Dと、部位分割と運動属性を同時予測する統一フレームワークUSDNetを提案した論文。
- 建設ロボットの作業を支える適応型視覚認識:マルチロボット協調フレームワークマルチロボット協調2024/12/1
建設現場で作業するロボットを複数の監視ロボットがカメラ視点を適応的に調整して見守る協調システムを提案し、木造フレーム設置の事例で有効性を検証した。
- SAM2ベースのトラッキングとオンライン軸推定による関節物体マニピュレーションマニピュレーション2024/9/1
SAM2で動的部分を追跡しながら3D点群から関節軸をオンライン推定し、関節物体を閉ループで操作する手法を提案した論文。
- 誘電エラストマーアクチュエータで駆動するソフトパラレルロボットの設計・製造・逆動力学モデリングソフトロボティクス2024/9/1
誘電エラストマーアクチュエータで駆動するデルタ型ソフトパラレルロボットを設計・試作し、高安定な電極形成法と拡張Bergstrom-Boyceモデルによる逆動力学モデルを構築して出力力予測を行った研究。
- 狭所を面内移動する双安定薄型ソフトロボットソフトロボティクス2024/9/1
双安定機構と誘電エラストマーアクチュエータを組み合わせた薄型ソフトロボットを開発し、静電吸着パッドで壁面を這い、4mmの隙間を通過できることを示した。
- Natural Language Instructions for Intuitive Human Interaction with Robotic Assistants in Field Construction Work2023/7/1
- Enabling Building Information Model-Driven Human-Robot Collaborative Construction Workflows with Closed-Loop Digital Twins2023/6/1