Yu-Chiang Frank Wang
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 現在のシーンを超えて:イベント参照型把持と能動的視点選択マニピュレーション2026/9/30
過去のイベントで物体が果たした役割に基づいて把持対象を指定する要求に対し、対象が隠れていてもイベント履歴と現在のシーンから視点を選んで把持するゼロショットシステムを提案。
- PhysCaP: 物理情報に基づく探索によるコード駆動ポリシーエージェントの接地操作/能動的知覚2026/8/21
ロボット操作における能動的知覚のため、物理特性を推定し探索行動を計画するコード駆動ポリシーエージェントを提案。
- SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考空間推論2026/6/11
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
- Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論VLA2026/1/1
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
- V2V-GoT: マルチモーダル大規模言語モデルと思考グラフによる車車間協調自動運転VLA2025/9/1
車車間通信とマルチモーダル大規模言語モデルを組み合わせ、思考グラフ推論を用いて遮蔽物がある状況でも協調的な知覚・予測・計画を行う手法を提案した。
- ThinkAct: 強化学習された視覚潜在計画による視覚-言語-行動推論VLA2025/7/1
マルチモーダルLLMで行動整合的な視覚報酬を用いて推論計画を生成し、それを視覚潜在に圧縮して行動モデルを条件付ける二重システムフレームワークを提案。複雑な身体性AIタスクでの少数ショット適応や長期計画、自己修正を実現した。
- V2V-LLM: マルチモーダル大規模言語モデルによる車車間協調自動運転VLA2025/2/1
車車間通信で複数車両の知覚情報をマルチモーダルLLMで統合し、物体特定や計画などの運転タスクに答えるV2V-QAデータセットとベースライン手法を提案した論文。
- 拡散報酬による敵対的模倣学習模倣学習2024/5/1
拡散モデルをGAILに統合し、より安定で滑らかな報酬を生成する模倣学習手法DRAILを提案。ナビゲーション・マニピュレーション・歩行で有効性を検証した。