Chao Tang
KTH Royal Institute of Technology
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- eRLT: 行動に関連するトークンルーティングによる効率的なVLA強化学習VLA2026/10/1
凍結したVLAモデルからタスク固有の行動関連特徴をトークンと層をまたいで抽出し、強化学習のサンプル効率を向上させる手法を提案。
- 形を超えた機能:異種ハンド間の機能的対応による器用把持生成マニピュレーション2026/9/30
異なる構造のロボットハンド間で把持の機能的役割を対応付け、未見のハンドでも把持データや再学習なしに器用な把持を生成する手法を提案。
- RoboICL: GPT-6 Astraによる身体性を備えたインコンテキスト学習VLA2026/9/28
ロボット制御のためのインコンテキスト学習フレームワークRoboICLを提案し、GPT-6 Astraのゼロショット性能を大幅に向上させた。
- 行動表現の方向・スケール分解:VLAモデルで何をトークン化すべきかの再考VLA2026/9/24
VLAモデルの行動トークン化において、並進・回転の増分を方向とスケールに分解するDSD表現を提案し、シミュレーションと実機で成功率の向上を実証した。
- ActGaze: 反事実的視覚介入による行動に基づく注視学習で高精度マニピュレーションを実現VLA2026/9/24
VLAモデルの視覚的注意をタスクに関連する領域に集中させるため、反事実的視覚介入によって行動予測に重要な領域を特定し、注視を学習させる手法を提案。実機実験で高精度マニピュレーションタスクにおいて既存手法を上回る性能を示した。
- 不完全データを活用した高精度ロボットマニピュレーションマニピュレーション2026/9/22
低精度なタスク固有データと高精度なタスク不一致データをフローマッチングのノイズレベルに応じて使い分け、高精度マニピュレーションのVLAモデルを効率的に訓練する手法を提案。
- World Action Modelの設計で重要な要素とは:実証研究VLA2026/9/21
World Action Modelの設計選択(因果構造、潜在空間、学習目的)を制御実験で分離し、ロボット制御性能への影響を体系的に分析した研究。
- 腱駆動柔軟アームの規定時間収束境界制御柔軟マニピュレーション2026/9/19
3対の拮抗腱で駆動される単節柔軟アームの曲率追従に対し、曲率の直交座標表現と立方性能境界を用いて、規定時間内に終端精度領域へ収束させる制御手法を開発し、数値・実験で検証した。
- PSR: 接触の多いマニピュレーションのための予測的感覚運動表現学習マニピュレーション2026/9/18
マルチモーダルな感覚運動信号から将来の接触ダイナミクスを予測する表現を事前学習し、VLAモデルの行動生成に組み込むことで、力覚を要する接触の多い操作タスクの成功率を大幅に向上させた研究。
- 夢のように掴む:生成された人間デモから機能的把持を模倣する把持2026/4/1
ビデオ生成モデルなどの視覚生成モデルで合成した人間のデモを使って、ロボットの機能的把持をゼロショットで学習する手法GraspDreamerを提案。データ収集の手間を省きつつ、多様な物体・タスクへの汎化を実現した。
- Easy-IIL: アシスタント専門家による対話型模倣学習の人間の操作負担軽減模倣学習2026/3/1
対話型模倣学習において、モデルベースの模倣手法をアシスタント専門家として活用し、人間の介入を最小限に抑えつつ性能を維持するフレームワークを提案した。
- MimicFunc: 単一の人間動画から機能対応を介して道具操作を模倣する模倣学習2025/8/1
機能中心の局所座標系「ファンクションフレーム」を構築し、1本のRGB-D人間動画から新しい道具への操作スキルを汎化するフレームワークを提案。
- CLASP: セマンティックキーポイントによる汎用衣服操作マニピュレーション2025/7/1
衣服のセマンティックキーポイントを中間表現として用い、VLMによるタスク計画とキーポイント条件付き操作スキルを組み合わせることで、多様な衣服の折り畳み・吊り下げ等の汎用操作を実現した。
- 模倣学習による巧みなマニピュレーション:サーベイマニピュレーション2025/4/1
ロボットハンドの巧みな操作を模倣学習で実現する手法を体系的にまとめ、課題と今後の研究方向を論じたサーベイ論文。
- HGDiffuser: 人間誘導型把持拡散モデルによる効率的なタスク指向把持生成マニピュレーション2025/3/1
人間の把持実演を拡散モデルの誘導サンプリングに組み込み、6自由度のタスク指向把持を一段階で直接生成する手法を提案し、従来の二段階手法より高効率・高品質を実現した。
- FlowPlan: LLMフローエンジニアリングによるロボット指示追従のゼロショットタスク計画タスク計画2025/3/1
LLMを多段階ワークフローで活用し、ラベル付きデータなしでロボットの指示追従タスクを計画するゼロショット手法を提案。ALFREDベンチマークと実環境でデータ駆動型手法に匹敵する性能を示した。
- FUNCTO: 機能中心のワンショット模倣学習による道具操作模倣学習2025/2/1
人間の1回のデモ動画から、同じ機能を持つ形状の異なる道具へ操作スキルを汎化できる、3D機能キーポイント表現を用いたワンショット模倣学習手法を提案。
- RTAGrasp: 人間の動画からの検索・転移・整合によるタスク指向把持の学習マニピュレーション2024/9/1
人間の把持動画から把持位置と方向の制約を抽出し、視覚基盤モデルで対象物に転移してロボットの動作に整合させる、訓練不要のタスク指向把持フレームワークを提案。
- FoundationGrasp: 基盤モデルによる汎化可能なタスク指向把持マニピュレーション2024/4/1
基盤モデルのオープンエンドな知識を活用し、未知の物体やタスクにも汎化できるタスク指向把持フレームワークを提案。実機実験で有効性を検証。
- 常識シーングラフに基づく物体探索のための目標位置推定物体探索2024/4/1
LLMで生成した常識知識と部屋レベルの知識を統合した常識シーングラフ(CSG)を構築し、家庭内ロボットが対象物体を効率的に探索できる目標位置推定手法を提案した。
- Efficient Object Rearrangement via Multi-view Fusion2023/9/1
- GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping2023/7/1
- Task-Oriented Grasp Prediction with Visual-Language Inputs2023/2/1
- Primitive Shape Recognition for Object Grasping2022/1/1
- Relationship Oriented Affordance Learning through Manipulation Graph Construction2021/10/1
- Recognizing Object Affordances to Support Scene Reasoning for Manipulation Tasks2019/9/1
- Using Synthetic Data and Deep Networks to Recognize Primitive Shapes for Object Grasping2019/9/1