Tsun-Hsuan Wang
Genesis AI
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 自己適応型VLA:ロボット実運用のための堅牢な展開手法VLA2026/9/24
ハードウェアのずれに自己適応するVLAモデルを提案し、展開時のキャリブレーションなしで精度が要求される双腕・巧緻マニピュレーションタスクの性能を80%以上回復させた。
- TapeSim: ロボットマニピュレーションのための粘着テープ分配の効率的シミュレーションsim2real2026/9/23
粘着テープの巻き出し・貼付・切断を効率的にシミュレーションする手法を提案し、剛体クラスタと変形カラーで計算を高速化しつつ、実動作の再現精度を向上させた。
- GS-Agent: 生成シミュレーションによる4D物理世界の構築生成モデル2026/7/1
自然言語の記述から、物理的に妥当で動的な4D世界を自動生成するマルチエージェントフレームワークを提案した論文。
- アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習VLA2026/4/1
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
- PhyScensis: 物理エンジンで拡張されたLLMエージェントによる複雑な物理シーン配置シーン生成/LLMエージェント2026/2/1
LLMエージェントと物理エンジンを組み合わせ、接触や支持・収納といった物理関係を考慮した複雑な3Dシーンを自動生成するフレームワークを提案。
- 見るものを減らして運転を改善:基盤モデルの確率的パッチ選択による汎化可能なEnd-to-End自動運転End-to-End自動運転2026/1/1
基盤モデルから抽出したパッチ特徴の冗長性を削減するため、ランダムに一部のパッチをマスクして学習するStochastic-Patch-Selectionを提案し、分布外シナリオでの自動運転性能を平均6.2%向上させた。
- ReGen: 逆設計による生成的ロボットシミュレーションsim2real2025/11/1
ロボットの行動とテキスト記述から、その行動を引き起こしうるシナリオや環境を大規模言語モデルで推論し、シミュレーションを自動生成するフレームワーク。
- RobotSmith: 複雑な操作スキル獲得のための生成的ロボットツール設計マニピュレーション2025/6/1
視覚言語モデルと物理シミュレーションを組み合わせ、ロボットが操作しやすいツールを自動設計し、その使い方まで最適化する手法を提案。
- 任意メッシュの関節構造化:オープンボキャブラリ3D関節物体モデリング3Dモデリング2025/2/1
視覚言語モデルと視覚プロンプトを用いて、任意の剛体3Dメッシュを部品分割と関節構造を持つ関節物体に自動変換するフレームワークを提案し、生成物をロボット操作スキル学習に活用できることを示した。
- ロボット基盤モデル監査のための身体性レッドチーミングVLA2024/11/1
視覚言語モデルを使って文脈に即した難易度の高い指示を自動生成し、言語条件付きロボットモデルの性能と安全性を評価する手法を提案した。
- UBSoft: 非有界軟質環境におけるロボットスキル学習のためのシミュレーションプラットフォームsim2real2024/11/1
軟質材料を含む広大な環境でロボットのスキル学習を可能にするため、ロボット近傍に応じて解像度を動的に変える空間適応型シミュレーションプラットフォームUBSoftを開発し、移動・操作タスクのベンチマークを構築した。
- Flex: 基盤モデル特徴量によるエンドツーエンドのテキスト指示視覚ナビゲーションVLA2024/10/1
事前学習済みVLMを凍結したパッチ単位の特徴抽出器として使い、少量のシミュレーションデータで訓練したドローンの視覚ナビゲーション方策が、未知のテキスト指示や実世界の視覚変化に汎化できることを示した。
- ABNet: 安全でスケーラブルなロボット学習のための注意バリアネットワーク安全学習2024/6/1
バリア関数ベースの安全学習をスケーラブルにするため、複数のバリアヘッドが異なる特徴に注目するAttention BarrierNetを提案し、安全性を理論保証しつつ障害物回避や操作、自動運転で堅牢性を示した。
- テキストから運転へ:大規模言語モデルによる多様な運転行動の合成自動運転シミュレーション2024/6/1
大規模言語モデルを活用し、自然言語の記述から多様な運転行動をシミュレーション上で生成する二段階の知識駆動型手法を提案した。
- 運転世界モデルとしてのマルチモーダルLLMの検証VLA2024/5/1
GPT-4oなどのマルチモーダルLLMが運転シーンをどの程度理解できるかを検証し、単一画像は得意でもフレーム間の一貫した理解や軌道計画は苦手であることを示した研究。
- 反事実的摂動による実演からの言語プランの接地VLA2024/3/1
LLMの言語プランをロボットの実演に基づくモード族で接地し、反事実的摂動を加えた実演から成功・失敗を学習して解釈可能な反応的方策を生成する手法を提案。
- RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation2023/11/1
- DiffuseBot: Breeding Soft Robots With Physics-Augmented Generative Diffusion Models2023/11/1
- Drive Anywhere: Generalizable End-to-end Autonomous Driving with Multi-modal Foundation Models2023/10/1
- SafeDiffuser: Safe Planning with Diffusion Probabilistic Models2023/6/1
- Towards Generalist Robots: A Promising Paradigm via Generative Simulation2023/5/1
- Learning Stability Attention in Vision-based End-to-end Driving Policies2023/4/1
- SoftZoo: A Soft Robot Co-design Benchmark For Locomotion In Diverse Environments2023/3/1
- Towards Cooperative Flight Control Using Visual-Attention2022/12/1
- Interpreting Neural Policies with Disentangled Tree Representations2022/10/1
- Are All Vision Models Created Equal? A Study of the Open-Loop to Closed-Loop Causality Gap2022/10/1
- On the Forward Invariance of Neural ODEs2022/10/1
- Differentiable Control Barrier Functions for Vision-based End-to-End Autonomous Driving2022/3/1
- VISTA 2.0: An Open, Data-driven Simulator for Multimodal Sensing and Policy Learning for Autonomous Vehicles2021/11/1
- Learning Interactive Driving Policies via Data-driven Simulation2021/11/1