Min-Hung Chen
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhysCaP: 物理情報に基づく探索によるコード駆動ポリシーエージェントの接地操作/能動的知覚2026/8/21
ロボット操作における能動的知覚のため、物理特性を推定し探索行動を計画するコード駆動ポリシーエージェントを提案。
- SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考空間推論2026/6/11
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
- FineBench:細粒度な人間活動理解のための視覚言語モデルのベンチマークと性能向上VQA/ベンチマーク2026/5/19
長時間動画における細かい人間の動きや相互作用を評価する新しいベンチマークFineBenchを構築し、既存のオープンソースVLMの弱点を特定。さらにモジュール型フレームワークFineAgentを提案して性能を改善した。
- Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論VLA2026/1/1
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
- 行動なし動画からスキルを学ぶVLA2025/12/1
オプティカルフローを中間表現として用い、行動なし動画から潜在スキルを抽出し、ロボットの長期タスク計画と行動生成を可能にするフレームワークSOFを提案。
- V2V-GoT: マルチモーダル大規模言語モデルと思考グラフによる車車間協調自動運転VLA2025/9/1
車車間通信とマルチモーダル大規模言語モデルを組み合わせ、思考グラフ推論を用いて遮蔽物がある状況でも協調的な知覚・予測・計画を行う手法を提案した。
- ThinkAct: 強化学習された視覚潜在計画による視覚-言語-行動推論VLA2025/7/1
マルチモーダルLLMで行動整合的な視覚報酬を用いて推論計画を生成し、それを視覚潜在に圧縮して行動モデルを条件付ける二重システムフレームワークを提案。複雑な身体性AIタスクでの少数ショット適応や長期計画、自己修正を実現した。
- V2V-LLM: マルチモーダル大規模言語モデルによる車車間協調自動運転VLA2025/2/1
車車間通信で複数車両の知覚情報をマルチモーダルLLMで統合し、物体特定や計画などの運転タスクに答えるV2V-QAデータセットとベースライン手法を提案した論文。
- 拡散報酬による敵対的模倣学習模倣学習2024/5/1
拡散モデルをGAILに統合し、より安定で滑らかな報酬を生成する模倣学習手法DRAILを提案。ナビゲーション・マニピュレーション・歩行で有効性を検証した。
- Probabilistic 3D Multi-Object Cooperative Tracking for Autonomous Driving via Differentiable Multi-Sensor Kalman Filter2023/9/1