Haonan Chen
Harvard University
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GlowTact:高感度・高空間分解能を実現するシンプルでコンパクトな視覚ベース触覚センシング触覚2026/9/26
接触圧力を直接可視化する新しい視覚ベース触覚センサGlowTactを提案し、単色照明と簡素な光学系でグラムスケールの検出や微細なネジ山の再構成を実現した。
- 脳に着想を得たゼロショットロボットタスク推論と実行のための階層的フレームワークタスク計画2026/9/5
オープンな言語指示に従うロボットのための、脳の役割分担に着想を得たゼロショット階層的フレームワークを提案し、視覚認識、言語接地、コストベースの計画、実行検証を統合して、長期的なタスク分解と物理的検証を実現した。
- ARGUS: 大規模3Dビジョンモデルによる視点変化下でのロボットシーン幾何学の位置合わせVLA2026/8/1
視点に依存しない観測前処理パイプラインARGUSを提案し、任意のカメラ視点からの画像を大規模3Dビジョンモデルで正準視点に変換することで、視点多様なデータセットからの学習効率と汎化性能を向上させた。
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- 視覚運動ポリシー学習のための順序付きアクショントークンVLA2026/7/1
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
- Bスプライン方策:Bスプライン行動表現による操作方策の高速化マニピュレーション2026/7/1
離散時刻の行動チャンクの代わりにBスプライン曲線で行動を表現し、操作方策の実行を高速化する手法を提案した論文。
- DriftWorld: ドリフトによる高速ワールドモデリングワールドモデル2026/7/1
拡散ベースのワールドモデルは推論時の反復サンプリングが遅いため、ロボットの行動計画に必要な多数のロールアウト生成がボトルネックとなる。本論文では、訓練中に行動条件付きドリフトを学習し、単一の順伝播で未来フレームを生成できるDriftWorldを提案し、拡散ベースのベースラインより平均17倍高速で、複数の操作ベンチマークで最先端の意思決定性能を達成した。
- IMPACT: 力強いロボット操作のための内部モデル予測制御の学習マニピュレーション2026/6/9
力強い操作タスクをタスク計画と内部モデル予測制御に分離するフレームワークを提案し、シミュレーションと実世界で成功率と汎化性を向上させた。
- 一度触れるだけ:単一触覚接触からの6自由度物体姿勢推定触覚/姿勢推定2026/6/1
視覚が使えない状況でも、2点の同時触覚接触から物体の6自由度姿勢を推定するシステムYOTOを提案。接触を点群として物体表面に位置合わせし、閉形式解法で姿勢を復元する。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- RoTri-Diff: 空間的なロボット-物体三者間相互作用に基づく両腕操作のための拡散モデル両腕操作/拡散モデル/模倣学習2026/3/1
両腕と操作対象物の間の相対的な6D姿勢を符号化した三者間相互作用表現を導入し、階層的拡散過程で軌道生成する模倣学習フレームワークを提案。シミュレーションと実機で高い性能を実証した。
- 順序付き行動トークン化(OAT)VLA2026/2/1
連続的なロボット行動を、自己回帰生成に適した順序付きトークン列に変換する学習型トークナイザを提案し、シミュレーションと実機の20以上のタスクで従来手法を上回る性能と推論時の柔軟性を示した。
- 因子分解拡散ポリシーによる柔軟なマルチタスク学習マニピュレーション2025/12/1
複雑な行動分布を専門化した拡散モデルの合成に分解するモジュラー拡散ポリシーを提案し、マルチタスク操作で性能と適応性を向上させた。
- SIMPACT: 視覚言語モデルによるシミュレーション活用型行動計画マニピュレーション2025/12/1
視覚言語モデルにテスト時に物理シミュレーションを組み合わせ、追加学習なしで接触を伴う細かいマニピュレーションの行動計画を可能にした手法。
- AdaptPNP: 把持・非把持スキルを統合した適応的ロボットマニピュレーションマニピュレーション2025/11/1
VLMを用いて把持と非把持(押す・つつく等)の動作を組み合わせた計画を生成し、デジタルツインで予測しながら実環境でも適応的に再計画するマニピュレーション枠組みを提案した論文。
- Manual2Skill++: コネクタを考慮した指示書からの汎用ロボット組立組立/マニピュレーション2025/10/1
組立指示書から視覚言語モデルで接続情報を抽出し、部品と接続関係を階層グラフで表現してロボット組立を実行するフレームワークを提案。
- マルチモーダル政策コンセンサスによるマルチモーダルマニピュレーションマニピュレーション2025/9/1
視覚や触覚など複数の感覚モダリティを、それぞれに特化した拡散モデルと適応的な重み付けを行うルータネットワークで統合し、接触の多いタスクや遮蔽された物体の操作を可能にする手法を提案。
- Goal-VLA: 画像生成VLMを物体中心の世界モデルとして活用するゼロショットロボットマニピュレーションVLA2025/6/1
画像生成型VLMを世界モデルとして使い、目標状態の画像を生成して物体姿勢を導出することで、追加学習なしに多様な操作タスクを実現するフレームワークを提案。
- 道具をインターフェースとして:人間の道具使用観察からのロボット方策学習模倣学習2025/4/1
人間の道具使用動画から3D再構成と道具中心のタスク空間行動を用いてロボット方策を学習し、視点変化や身体差を克服するフレームワークを提案した。
- 不確かさの統合に向けて:選好学習のケーススタディ選好学習2025/3/1
人間とロボットの不確かさを統合する枠組みUUPLを提案し、ガウス過程ベースの選好学習の精度と信頼性を向上させた。
- MetaFold: 軌道生成と基盤モデルによる言語誘導型多カテゴリ衣類折り畳みフレームワークマニピュレーション2025/3/1
衣類折り畳みタスクにおいて、タスク計画と言語誘導の点群軌道生成、低レベル基盤モデルによる行動予測を分離して学習し、多カテゴリの衣類や多様な指示に適応できるフレームワークを提案した。
- 状態拡散と逆動力学モデルを用いた協調的双腕マニピュレーション方策の学習マニピュレーション2025/3/1
拡散モデルで将来の状態を予測し、逆動力学モデルで行動を生成することで、双腕ロボットの協調マニピュレーションを模倣学習する手法を提案。
- Manual2Skill: 視覚言語モデルを用いた家具組立のための説明書読解とロボットスキル獲得マニピュレーション2025/2/1
VLMで説明書画像から組立情報を抽出し、階層的な組立グラフと6D姿勢推定・動作計画を組み合わせて、ロボットがIKEA家具を組み立てられるようにしたフレームワーク。
- TieBot: 実世界-シミュレーション-実世界アプローチによる視覚デモンストレーションからのネクタイ結び学習変形物体マニピュレーション2024/7/1
ネクタイの変形と長期的な操作が難しいネクタイ結びを、実演動画からメッシュ列を推定し、教師方策と生徒方策を学習して実機に転移するReal-to-Sim-to-Realシステムを提案。実機で双腕ロボットが10回中5回成功。
- LLMマルチエージェントによるデジタルツインのシミュレーションモデルパラメータ自動設定LLMエージェント2024/5/1
観測・推論・意思決定・要約を担うLLMエージェント群でデジタルツインのシミュレーションパラメータを自律的に探索・設定するフレームワークを提案した。
- Predicting Object Interactions with Behavior Primitives: An Application in Stowing Tasks2023/9/1
- Learning Task Skills and Goals Simultaneously from Physical Interaction2023/9/1
- PeRP: Personalized Residual Policies For Congestion Mitigation Through Co-operative Advisory Systems2023/8/1
- ClothesNet: An Information-Rich 3D Garment Model Repository with Simulated Clothes Environment2023/8/1
- Towards Safe Multi-Level Human-Robot Interaction in Industrial Tasks2023/8/1
- User-Friendly Safety Monitoring System for Manufacturing Cobots2023/7/1
- Learning to Navigate Intersections with Unsupervised Driver Trait Inference2021/9/1
- Robot Sound Interpretation: Combining Sight and Sound in Learning-Based Control2019/9/1
- Enabling Robots to Understand Incomplete Natural Language Instructions Using Commonsense Reasoning2019/4/1