Dahua Lin
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Skel-WAM: 人間からロボットへの操作スキル転移を実現する手骨格条件付きワールドアクションモデル模倣学習/人間からロボットへの転移2026/9/18
人間とロボットの手の骨格を共通インターフェースとして用い、人間の動画とロボットの実演を統合学習することで、実機の双腕操作タスクの成功率を大幅に向上させた研究。
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- CameraAnything: 任意のカメラ制御による映像の再撮影映像編集2026/7/27
カメラの内部・外部パラメータを同時に制御できる映像編集の統一フレームワークを提案し、焦点距離や解像度の変更を伴う再撮影を単一の生成プロセスで実現した。
- KAI: データ効率的な関節物体操作のための運動学的認識インターフェースマニピュレーション2026/7/1
関節物体の運動学的構造を捉えた中間表現KAIを導入し、ポリシー学習に組み込むことで、少ないデモデータでも高い成功率を達成する手法を提案した。
- 人型ロボットのためのスケーリング行動基盤モデル人型ロボット制御2026/7/1
人型ロボットの制御を大規模行動データで学習する行動基盤モデル(BFM)のスケーリング手法を提案し、学習パラダイム、データ、モデル構造の協調により性能が向上することを示した。
- MemoryWAM: 持続的メモリによる効率的な世界行動モデリングマニピュレーション2026/6/1
ロボット操作のための世界行動モデルに、最近のフレーム、イベント境界アンカーフレーム、長期履歴を要約するコンパクトなgistトークンを組み合わせたハイブリッドメモリ設計を導入し、長期的な記憶依存タスクを効率的に処理する手法を提案した。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- UltraDexGrasp: 合成データによる双腕ロボットの汎用器用把持の学習把持2026/3/1
双腕ロボットのための多戦略・器用な把持を実現するフレームワークを提案し、大規模合成データセットと単純なポリシーでゼロショットの実機転送に成功した。
- Robo3R: 高精度フィードフォワード3D再構成によるロボットマニピュレーションの強化マニピュレーション2026/2/1
RGB画像とロボット状態から実時間でメートルスケールの3Dシーンを再構成するフィードフォワードモデルを提案し、模倣学習や把持生成などの操作タスクで性能を向上させた。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- Gallant: ボクセルグリッドによる3次元制約地形でのヒューマノイド歩行と局所ナビゲーション歩行2025/11/1
LiDARをボクセル化してzグループ化2D CNNで制御方策に写像し、3D制約地形でのヒューマノイド歩行・局所ナビゲーションを単一方策で実現した研究。
- マルチモーダル基盤モデルによる空間知能のスケーリングVLA2025/11/1
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
- マルチモーダルLLMの空間知能を包括的に評価するEASI空間知能評価2025/8/1
GPT-5など最先端マルチモーダルモデルの空間理解・推論能力を、統一的なタスク分類に基づく8つのベンチマークで大規模に評価し、人間との差や限界を明らかにした。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- ガウススプラッティングによる新規デモ生成で実現するロバストなワンショットマニピュレーションマニピュレーション2025/4/1
3Dガウススプラッティングで再構成したシーンを直接編集し、多様で視覚的にリアルなデモを生成することで、ワンショット設定での視覚運動政策の汎化性能を大幅に向上させる手法RoboSplatを提案。
- HOMIE: 同型外骨格コックピットによるヒューマノイドの移動・操作遠隔操作2025/2/1
ペダル・同型外骨格アーム・モーションセンシンググローブを統合した半自律遠隔操作システムで、ヒューマノイドの全身移動と器用な物体操作を低コストかつ効率的に実現する。
- 予測的逆動力学モデルによるロボットマニピュレーションのスケーラブル学習マニピュレーション2024/12/1
ロボットの予測視覚状態に基づく逆動力学モデルで行動を予測するPIDMを提案し、大規模データで事前学習したSeerがシミュレーションと実世界で大幅な性能向上を達成した。
- VLM-Grounder: ゼロショット3D視覚グラウンディングのためのVLMエージェント3D視覚グラウンディング2024/10/1
2D画像のみを用いた視覚言語モデルにより、3D点群や物体事前情報なしで自然言語指示に基づく3D物体の位置推定をゼロショットで実現したフレームワーク。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。
- H∞ロコモーション制御の学習歩行2024/4/1
四足歩行ロボットの頑健な歩行制御を、状態に依存した学習可能な外乱との敵対的相互作用として定式化し、H∞制約で安定に最適化する手法を提案した。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Scene as Occupancy2023/6/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Monocular 3D Object Detection with Depth from Motion2022/7/1
- FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection2021/4/1
- FLAVA: Find, Localize, Adjust and Verify to Annotate LiDAR-Based Point Clouds2020/11/1
- Learning a Decision Module by Imitating Driver's Control Behaviors2019/12/1