Cheng Qian
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マルチモーダルメモリ圧縮による長期的身体化意思決定意思決定/ベンチマーク2026/8/2
長期的な身体化意思決定のためのベンチマークDunphyBenchを提案し、VLMエージェントの性能が人間に及ばないこと、メモリ管理がボトルネックであることを示した。さらに、ユーザー嗜好に基づいて情報を圧縮するMeMentoを設計し、精度向上とメモリ削減を実現した。
- ACCORD: 言語エージェントのための行動条件付き文脈接地LLMエージェント2026/6/15
ユーザー指示は暗黙の前提を含むため、LLMエージェントが環境情報を能動的に取得・統合して行動するフレームワークACCORDを提案し、タスク成功率を大幅に向上させた。
- Instant-Fold: 変形物操作のための文脈内模倣学習変形物操作/模倣学習2026/6/2
単一の人間デモから変形物の多様な操作モードを推論・実行する文脈内模倣学習フレームワークを提案し、シミュレーションのみで訓練し実世界へゼロショット転移する。
- SynthICL: 合成データによるスケーラブルな文脈内模倣学習模倣学習2026/6/1
RGBのみの合成データで文脈内模倣学習ポリシーを訓練し、実世界の未見タスクで高い成功率を達成した。
- 現在のエージェントは世界モデルを先見のツールとして活用できていないVLA2026/1/7
視覚言語モデルベースのエージェントが生成的世界モデルを外部シミュレータとして使えるかを検証し、シミュレーションの起動判断や予測結果の解釈・統合がボトルネックで性能が向上しないことを示した実証研究。
- 大規模な器用なロボットピアノ演奏マニピュレーション2025/11/1
人間の実演なしに強化学習と模倣学習を組み合わせ、約1000曲を演奏できるロボットハンドを実現した。
- Observer-Actor: スパースビューガウシアンスプラッティングを用いた能動視覚模倣学習模倣学習2025/11/1
腕の一方を観測役として最適視点に動かし、3Dガウシアンスプラッティングで遮蔽の少ない視点から他方の腕の模倣学習ポリシーを実行する枠組みを提案。
- VITA-E:見る・聞く・話す・行動するを同時に実現する身体的インタラクションVLA2025/10/1
2つのVLAモデルを並列に動かす二重モデル構成と「モデル・アズ・コントローラ」により、ロボットが環境を見ながらユーザーの音声を聞き、発話し、行動を同時並行で実行し、割り込みにも即応できる身体的対話フレームワークを提案した。
- PianoMime: インターネットのデモンストレーションから汎用器用なピアノ演奏エージェントを学習マニピュレーション2024/7/1
YouTubeのプロピアニストの演奏動画を活用し、任意の曲を演奏できる汎用ピアノ演奏エージェントを訓練するフレームワークを提案。データ準備、曲別エキスパート方策学習、汎用エージェントへの蒸留の3段階で構成され、未見曲で最大56%のF1スコアを達成。
- 強化学習による肋間ロボット超音波撮像の自律経路計画医療ロボティクス2024/4/1
CTテンプレートで構築した仮想環境で強化学習エージェントを訓練し、肋骨の影を避けて臓器を撮像する肋間スキャン経路を計画する手法を提案した。
- Deep Reinforcement Learning in Surgical Robotics: Enhancing the Automation Level2023/9/1
- Learning Barrier Functions with Memory for Robust Safe Navigation2020/11/1