Tianxing Chen
RoboDojo
収録論文 36本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- MM-ABC: 見て、協調し、想像する汎用モバイルマニピュレーションモバイルマニピュレーション2026/9/28
移動とマニピュレーションを別々のストリームとして扱い、マスク付きジョイントアテンションと未来予測の追加監督で協調させる基盤モデルを提案。
- 予想外のロボットポリシー:GPT-6 AstraのRoboDojoとその先における初期評価VLA2026/9/21
大規模言語モデルをロボット操作のポリシーとして直接使えるかを検証し、GPT-6 Astraが公開ポリシーを上回る成功率を示す一方、精度や動的制御を要するタスクは苦手であることを明らかにした。
- BiView-Touch: クロスハンド補完による両手触覚表現学習触覚2026/9/20
一方の手の触覚潜在表現を、同期したもう一方の手の触覚情報から補完する自己教師あり学習フレームワークを提案し、少ないラベルで両手動作や力の認識精度を向上させた。
- DexTouch-WM: 人間の触覚から器用なロボット操作のための行動条件付き触覚ワールドモデルを学習触覚/ワールドモデル2026/9/17
人間とロボットの手に同じ触覚センサ配置を装着し、人間の触覚データからロボットの視覚・触覚の未来を予測するワールドモデルを学習。人間のデータを増やすほどロボット領域の予測精度が向上し、政策評価や合成データ生成にも使えることを示した。
- TouchSight: 一人称視野映像からの素手触覚予測触覚2026/9/17
手袋型圧力センサの記録を生成AIで素手映像に変換し、一人称視野の動画から手全体の接触力を予測する手法を提案。触覚センサなしで密な触覚情報を推定できる。
- MoPA: サブシステム特化型知覚アラインメントによる協調的移動マニピュレーション移動マニピュレーション2026/9/10
移動とマニピュレーションで異なる知覚表現を二重ストリームで抽出し、行動レベルで協調させるフレームワークを提案。ManiSkill-HABで最高性能、実機でも成功率76.3%を達成。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- SynManDex: 合成人間プレグラスプからの人間らしい器用な把持の合成器用な把持/シミュレーション2026/6/1
人間のプレグラスプを生成し、それをロボットハンドにリターゲットして力閉ループ接触を最適化することで、人間らしく安定した器用な把持を合成するパイプラインを提案。
- InfBaGel: 動的知覚と反復的洗練による人-物体-シーン相互作用生成相互作用生成2026/4/6
人-物体-シーン相互作用の生成を、動的なシーン変化を考慮しつつ、粗から精への反復的生成フレームワークで実現した。データ不足は疑似データ生成で補い、衝突回避のガイダンスも導入した。
- LeHome: 家庭環境における変形物体操作のためのシミュレーション環境シミュレーション/変形物体操作2026/4/1
家庭内の変形物体(衣類や食品など)を高忠実度で操作できるシミュレーション環境を提案し、低コストロボットでの評価を可能にした。
- GarmentPile++: 視覚言語推論によるアフォーダンス駆動の乱雑な衣類取り出しマニピュレーション2026/3/1
衣類の山から言語指示に従って安全かつ正確に1枚だけを取り出すパイプラインを提案。視覚言語モデルと視覚アフォーダンスを統合し、SAM2によるセグメンテーションとマスク微調整、さらに大型衣類向けの双腕協調を導入した。
- ManiTwin: データ生成対応デジタルオブジェクトデータセットを10万点に拡張データセット/シミュレーション2026/3/1
単一画像からシミュレーション対応の3Dアセットを自動生成するパイプラインを構築し、10万点の高品質アセットデータセットを提供する論文。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- HyCodePolicy:身体性エージェントにおけるマルチモーダル監視と意思決定のためのハイブリッド言語コントローラVLA2025/8/1
自然言語指示からコードを生成し、視覚言語モデルによる実行監視とコード修復を組み合わせて、ロボット操作タスクを自己修正しながら遂行するハイブリッド制御フレームワークを提案。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- AutoBio:デジタル生物学実験室におけるロボット自動化のためのシミュレーションとベンチマークsim2real2025/5/1
生物学実験室でのロボット自動化を評価するためのシミュレーションフレームワークとベンチマークAutoBioを提案し、言語誘導型マニピュレーションの課題を明らかにした。
- RoboTwin: 生成デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2025/4/1
3D生成基盤モデルと大規模言語モデルを活用し、多様な専門家データセットと実世界に即した評価プラットフォームを提供する双腕ロボットタスク向けの生成デジタルツインフレームワークを提案。
- AVR: 視点と焦点距離の最適化による能動視覚駆動型精密ロボットマニピュレーションマニピュレーション2025/3/1
頭部追跡による視点制御と電動ズームを組み合わせた両腕遠隔操作・学習フレームワークAVRを提案し、シミュレーションと実機で成功率を大幅に向上させた。
- CordViP: 実世界での巧みな操作のための対応関係に基づく視覚運動ポリシーマニピュレーション2025/2/1
物体の6D姿勢推定とロボット固有感覚を活用し、物体と手の対応関係を捉えるインタラクション認識点群を構築することで、実世界の巧みな操作を高精度に実現する視覚運動ポリシーを提案した。
- G3Flow: 姿勢を考慮した汎化可能な物体操作のための生成的3Dセマンティックフローマニピュレーション2024/11/1
基盤モデルを活用して物体中心の動的な3Dセマンティック表現をリアルタイムに構築し、拡散ポリシーに組み込むことで、遮蔽下でも意味理解を可能にし、操作と物体間汎化を改善した。
- DexHandDiff: 適応的巧みな操作のための相互作用を考慮した拡散計画マニピュレーション2024/11/1
接触を伴う巧みな操作のための拡散計画フレームワーク。接触前後の二段階拡散とLLMによるガイダンス生成で、訓練分布外の目標にも適応できる。
- SAM2ベースのトラッキングとオンライン軸推定による関節物体マニピュレーションマニピュレーション2024/9/1
SAM2で動的部分を追跡しながら3D点群から関節軸をオンライン推定し、関節物体を閉ループで操作する手法を提案した論文。
- RoboTwin: 生成的デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2024/9/1
3D生成モデルと大規模言語モデルを活用し、単一の2D画像から多様な物体のデジタルツインを生成して双腕ロボットの専門家データセットと実世界に即した評価ベンチマークを提供するフレームワークを提案。
- HiAgent: 大規模言語モデルによる長期タスク解決のための階層的ワーキングメモリ管理LLMエージェント2024/8/1
サブゴールを記憶のチャンクとして用い、LLMエージェントのワーキングメモリを階層的に管理することで、長期タスクの成功率を2倍に向上させた。
- ManiCM: ロボットマニピュレーションのための一貫性モデルによるリアルタイム3D拡散ポリシーマニピュレーション2024/6/1
拡散モデルに一貫性制約を課すことで、点群入力からロボットの行動を1ステップで生成するリアルタイムマニピュレーションモデルを提案し、従来手法を平均10倍高速化した。