Zihan Wang
AI Open Source Foundation
収録論文 38本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ENCORE: 少数の実演から操作戦略を発見するエージェントマニピュレーション2026/9/29
少数の実演を証拠として与え、コーディングエージェントが知覚・行動APIに対するポリシープログラムを書いて反復改善し、言語指示だけでは不明な操作戦略を発見する手法。
- 反実仮想動画生成によるスケーラブルなヒューマノイドの移動操作移動操作2026/9/29
少数の実動画から反実仮想の人間-物体インタラクション動画を大量生成し、実→シミュ→実のパイプラインで物理的に妥当な軌道に変換して、多様な物体の運搬を実機で実現する方策を学習した。
- NeuralParker: 不規則な駐車環境のための強化学習プランナー駐車計画/強化学習2026/8/25
配送車両などが不規則な環境で任意の姿勢に駐車するための強化学習ベースのハイブリッドプランナーを提案。環境全体の障害物と境界を目標相対表現で符号化し、長距離の経路計画を可能にした。
- ニューラルプリミティブ:プリミティブベース模倣学習による効率的なエンドツーエンドローカルプランナー自律飛行2026/8/21
未知の障害物環境での自律飛行において、模倣学習を用いたエンドツーエンドのローカルプランナーを提案し、センサ入力を多項式係数に直接マッピングすることで、リアルタイムで滑らかで衝突のない軌道を生成する。
- 見ずして先を見通す:ワールドアクションモデルのための潜在的未来VLA2026/8/12
未来のビデオを生成せずに、潜在的な未来の状態をアクション生成に活用する新しいワールドアクションモデル「ForeWAM」を提案し、LIBEROベンチマークで高い成功率を達成した。
- Image2Sim: 生成的ニューラルシミュレータによる身体化ナビゲーションのスケーリングナビゲーション2026/7/1
実画像列から高品質なインタラクティブ環境を生成するニューラルシミュレータを提案し、大規模なナビゲーション訓練データを合成して実世界性能を向上させた。
- 強化学習のための段階遷移型高密度報酬モデリング強化学習/報酬設計2026/6/1
専門家のデモ動画からタスクの段階構造を推論し、段階遷移と段階内進捗の2つの報酬信号を生成することで、長期的なロボット操作タスクの強化学習を効率化する手法を提案した。
- 異種AAV物流タスク割り当て:強化学習強化オーバーラップ連合形成ゲームアプローチ群制御2026/5/1
動的な都市物流において、時間制約のあるタスクがランダムに発生する問題に対し、強化学習とオーバーラップ連合形成ゲームを組み合わせたタスク割り当て手法を提案した。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- センサモータポリシーによる精密なアグレッシブ空中機動ドローン制御2026/4/1
ドローンの狭い隙間を高速で通過するアグレッシブな機動を、視覚と自己受容感覚から直接制御指令を出力するセンサモータポリシーを強化学習で訓練して実現した。
- PhaForce: 位相スケジュール型視覚・力覚ポリシー学習による低速計画と高速補正の接触リッチ操作マニピュレーション2026/3/1
接触を伴う操作タスク向けに、低頻度のチャンク計画と高頻度の力覚補正を位相スケジュールで統合した視覚・力覚ポリシーを提案し、実ロボットで成功率と接触品質を大幅に向上させた。
- 反実仮想失敗合成による実行可能な操作リカバリの学習マニピュレーション2026/3/1
実世界の成功デモから生成モデルで反実仮想的な失敗ロールアウトを合成し、失敗診断と回復軌道を予測するフレームワークを提案。実機実験で補正精度を大幅に向上させた。
- CRISP: 平面プリミティブを用いた単眼動画からの接触誘導型Real2Simsim2real2025/12/1
単眼動画から人間とシーンの接触を手がかりに平面プリミティブでシーン形状を復元し、物理的に妥当な人間動作とシミュレーション可能な環境を生成する手法。
- D3D-VLP: 動的3D視覚言語計画モデルによる身体性グラウンディングとナビゲーションVLA2025/12/1
単一の3D視覚言語モデルとChain-of-Thoughtで計画・グラウンディング・ナビゲーション・質問応答を統合し、断片的な教師信号から相互補強的に学習する手法を提案。複数ベンチマークで最先端を達成。
- 人間参加型選好アライメントによる展開可能な視覚駆動UAV河川航行VLA2025/11/1
人間が介入して選好を提供するHITL学習手法SPAR-Hを提案し、視覚駆動UAVの河川追従をシミュレーションと実機で実現した。
- HL-IK:ヒューマノイド腕における人間らしい逆運動学の軽量実装マニピュレーション2025/9/1
大規模人間動作データから学習した肘の事前分布を数値IKに組み込み、エンドエフェクタ追従を保ちながら腕全体の姿勢を人間らしくする軽量な逆運動学フレームワークを提案。
- HDMI: 人間の動画から対話型ヒューマノイド全身制御を学習全身操作2025/9/1
単眼RGB動画から人間と物体の軌道を抽出・再ターゲットし、強化学習でヒューマノイドの全身物体操作スキルを学習、実機にゼロショット展開するフレームワーク。
- セマンティックダイナミクスモデルを用いた安全強化学習によるUAVの視覚駆動型河川追従安全強化学習2025/8/1
UAVが視覚情報のみで河川を追従するため、非マルコフ的報酬と安全制約に対応した新しい安全強化学習手法を提案し、シミュレーションで有効性を示した。
- PUB:2自由度ベクトル推力を持つプラズマ推進超静音飛行船飛行ロボット2025/8/1
機械式プロペラを使わずプラズマによるイオン風推力と2自由度ベクトル制御で超静音飛行を実現する飛行船型ロボットを開発し、離着陸・ホバリング等の飛行実験で有効性を示した。
- InstructPart: 指示に基づくタスク指向型パーツセグメンテーションパーツセグメンテーション2025/5/1
物体を構成する部品ごとに分割し、指示されたタスクに応じて適切な部品を切り出すベンチマークInstructPartを提案し、既存の視覚言語モデルでも難しいことを示した上で、データセットでの微調整により性能を倍増させるベースラインを提示した。
- Dynam3D: 動的階層型3Dトークンによる視覚言語ナビゲーションのためのVLM強化VLA2025/5/1
RGB-D画像からCLIP特徴を3D空間に投影し、動的で階層的な3D表現を構築することで、視覚言語ナビゲーションにおける3D理解と長期記憶を向上させるモデルを提案した。
- フック型ローバーホイールスポークを用いた物理リザバーコンピューティングによるリアルタイム地形識別地形識別2025/4/1
ローバーのホイールスポークに圧電センサを埋め込み、物理リザバーコンピューティングを活用して振動から地形をリアルタイムに識別する手法を提案し、90%の分類精度を達成した。
- 点群で飛ぶ:強化学習による自律ドローン飛行sim2real2025/3/1
機載3D LiDARとsim-to-real強化学習を組み合わせ、生の点群を軽量に扱う代理表現を用いて、狭い空間や薄い障害物を避けながら50Hzの低レベル制御でドローンを自律飛行させる手法を提案した。
- ロボットの経験を実世界の自然言語で接地するRONARVLA2024/11/1
マルチモーダルなロボット経験をLLMで自然言語ナレーションに変換し、行動説明や失敗分析、人間との対話による復旧を支援するシステムを提案。
- g3D-LF: 具現化タスクのための汎化可能な3D言語特徴フィールドVLA2024/11/1
大規模3D言語データセットで事前学習した3D表現モデルで、RGB-D画像から新規視点表現やBEVマップを生成し、多粒度言語でターゲットをクエリできる。未見環境への汎化とリアルタイム更新を実現し、VLNや物体ナビゲーション、状況付きQAで有効性を示した。
- 視覚駆動型UAV河川追従:安全強化学習によるベンチマーク安全強化学習2024/9/1
Unityの写実的シミュレーション環境で、視覚駆動型UAVの河川追従タスクに対する安全強化学習アルゴリズムのベンチマークを実施し、意味拡張画像エンコーディングの有効性と最適なアルゴリズムを明らかにした。
- 3D特徴フィールドによる視覚言語ナビゲーションのSim-to-Real転移VLA2024/6/1
単眼カメラしか持たないロボットでも、3D特徴フィールドを用いて全周囲の走行可能領域と意味理解を推定し、高性能な全周囲VLNモデルを実機に転移できる手法を提案した。
- 視覚と触覚の融合:信号処理の観点から見た視触覚センサの最新レビュー触覚2024/6/1
視触覚センサを信号処理の観点から包括的にレビューし、ハードウェアだけでなく処理手法の重要性を示して今後の研究方向を展望した。
- ニューラル放射表現を用いた先読み探索による連続視覚言語ナビゲーションVLA2024/4/1
将来環境をRGB画像ではなく階層的ニューラル放射表現で予測し、先読み探索を効率化した視覚言語ナビゲーション手法を提案した論文。
- Synergistic Reinforcement and Imitation Learning for Vision-driven Autonomous Flight of UAV Along River2024/1/1
- Autonomous Robotic Reinforcement Learning with Asynchronous Human Feedback2023/10/1
- Neural Network-PSO-based Velocity Control Algorithm for Landing UAVs on a Boat2023/9/1
- PyPose v0.6: The Imperative Programming Interface for Robotics2023/9/1
- Breadcrumbs to the Goal: Goal-Conditioned Exploration from Human-in-the-Loop Feedback2023/7/1
- Masked Imitation Learning: Discovering Environment-Invariant Modalities in Multimodal Demonstrations2022/9/1
- Weakly Supervised Correspondence Learning2022/3/1
- Learning from Imperfect Demonstrations via Adversarial Confidence Transfer2022/2/1
- A Data-Efficient Framework for Training and Sim-to-Real Transfer of Navigation Policies2018/10/1