Tao Lin
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- 焦点可能な単眼深度推定深度推定2026/5/12
指定された対象領域に焦点を当てて深度推定を行う新しいタスクと、プロンプト条件付きのフレームワークを提案した論文。
- Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニングVLA2026/5/1
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- 視点汎化を超えて:多視点デモがもたらすものとロボット操作のためのその合成方法マニピュレーション2026/3/1
多視点デモデータがロボット操作の性能と汎化に与える影響を体系的に分析し、単眼入力から新視点ビデオを合成する自己教師ありフレームワークRoboNVSを提案した。
- 人間を考慮したマルチロボットハンドオーバーのためのLLMに基づく階層的時間論理を用いた動的タスク計画タスク計画2026/2/1
大規模言語モデルで人間の指示を階層的なLTLf仕様に変換し、再cedingホライズン計画で動的に再計画することで、マルチロボットのハンドオーバータスクを実現するニューロシンボリックフレームワークを提案した。
- 動的構造を考慮した3D視覚表現の自己教師あり事前学習フレームワークAFRO3D視覚表現学習2025/12/1
ロボット操作向けに、行動や再構成の教師なしで状態間の動的構造を捉える3D視覚表現を学習する自己教師あり手法を提案し、拡散ポリシーと組み合わせて操作成功率を向上させた。
- Evo-1: 意味的整合性を保つ軽量Vision-Language-ActionモデルVLA2025/11/1
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
- Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデルVLA2025/7/1
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。
- RoboFAC: ロボット失敗分析と修正のための包括的フレームワークVLA2025/5/1
ロボット操作の失敗を診断・修正するための大規模データセットと軽量マルチモーダルモデルを構築し、VLA制御の回復性能を向上させた。
- Modular Multi-Level Replanning TAMP Framework for Dynamic Environment2023/10/1