Ming-Hsuan Yang
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Chat-Edit-3D++: 大規模言語モデルによる対話型3D・4Dシーン編集3D編集2026/8/29
大規模言語モデルを中心に対話で3D/4Dシーンを編集する手法を提案。2Dアトラス画像への変換で編集と再構成を分離し、多様な視覚ツールを自動的に呼び出す。
- SimWorlds: 動的3Dシーン生成のためのマルチエージェントシステム3Dシーン生成2026/7/2
テキストから動的で編集可能な4Dシーンを生成するマルチエージェントフレームワークを提案し、物理整合性を検証するベンチマークも導入した。
- 自動運転システムのための設計・スケジューリングエージェント「DrivingAgent」自動運転2026/6/1
自動運転システムの設計とリアルタイムスケジューリングを自動化するLLMベースのエージェントフレームワークを提案。設計フェーズではモジュール開発を自動化し、スケジューリングフェーズでは強化学習で訓練した軽量LLMが動的にモジュールを調整する。
- KnowVal: 知識拡張と価値誘導による自動運転システム自動運転2025/12/1
交通法規や倫理規範を知識グラフとして取り込み、LLM検索と価値モデルで軌道評価を行う自動運転システムを提案。nuScenesで最低衝突率、Bench2DriveとNVISIMで最先端性能を達成。
- マスクから世界へ:世界モデル構築のための実践ガイド世界モデル2025/10/23
初期のマスクモデルから統一アーキテクチャ、対話型生成モデル、記憶拡張システムへと至る世界モデル構築の道筋を、生成・対話・記憶の3要素に焦点を当てて解説する。
- RAPID Hand:汎用ロボット自律性のための堅牢・低コスト・知覚統合型巧みな操作プラットフォームマニピュレーション2025/6/1
低コストで高自由度な多指ハンドと、触覚・視覚・固有感覚を統合した知覚系、高自由度テレオペレーションを共同設計し、高品質な操作データを収集できるプラットフォームを提案。
- 自動運転のための生成AI:フロンティアと機会自動運転2025/5/1
生成AI(VAE・GAN・拡散モデル・LLM)を自動運転スタック全体にどう応用するかを体系的に整理したサーベイ。データ生成からEnd-to-End運転、デジタルツイン、評価・安全・規制まで課題と研究方向をまとめる。
- 関節故障に耐える脚式ロボットの統合型レジリエント制御歩行2025/2/1
脚式ロボットの関節故障やセンサ故障に適応するため、マスキング機構を用いた2段階学習のモデルフリー制御フレームワークUMCを提案し、故障時のタスク達成率を平均36〜39%向上させた。
- VinT-6D:視覚・触覚・固有感覚を統合した大規模物体把持データセットマニピュレーション2025/1/1
ロボットの手先操作のための、視覚・触覚・固有感覚を統合した大規模データセットVinT-6Dを構築し、シミュレーションと実環境の両方で200万件以上のデータを収集した。