Yang Tian
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VidAct: 物体中心の3D認識で野生動画からマニピュレーションを学習マニピュレーション2026/9/29
単眼の実世界動画から物体メッシュと運動を再構成し、残差軌道転移と物体中心の3D点群予測を組み合わせて、ゼロショットで実機展開可能なマニピュレーションポリシーを学習するフレームワーク。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- 変形ツール操作における文脈認識型力推定:数ショット連続適応によるロボット環境拭き取り力推定2026/7/1
変形するツールを使ったロボットの拭き取り作業で、手首の力センサーから実際の接触力を推定するデータ駆動フレームワークを提案。LSTMと数ショット適応で環境変化に強く、誤差を最大63%削減した。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- SIM1: 物理整合シミュレータによる変形物体世界でのゼロショットデータ拡張シミュレーション/変形物体操作2026/4/1
変形物体操作のための物理整合型シミュレータを提案し、少数の実デモから合成データを生成してポリシー学習を効率化する。実機で90%のゼロショット成功率を達成した。
- UltraDexGrasp: 合成データによる双腕ロボットの汎用器用把持の学習把持2026/3/1
双腕ロボットのための多戦略・器用な把持を実現するフレームワークを提案し、大規模合成データセットと単純なポリシーでゼロショットの実機転送に成功した。
- 接触角ガイドによる運動学的デカップリングを備えた管内ロボットの設計:クロストーク抑制 locomotion管内ロボット2026/3/1
V字型管内ロボットにおいて、車輪と関節軸を分離し、2つのモータで全輪駆動と転回姿勢補正を独立に実現する機構を提案。接触角をゼロに近づける設計指針でクロストークを抑制し、垂直管内での安定性を実験で検証した。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- InternData-A1:汎用ポリシー事前学習のための高忠実度合成データVLA2025/11/1
大規模シミュレーションで生成した63万軌道超の合成データセットInternData-A1を構築し、合成データのみでVLAモデルを事前学習しても実データと同等の性能が得られることを示した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- 両手ロボット操作のためのインターフェースとしてのグリッパーキーポーズと物体点流マニピュレーション2025/4/1
グリッパーの目標姿勢と物体の点流を予測するインターフェースを連続行動推定と統合し、両手操作の精度と柔軟性を高めるフレームワークPPIを提案した。
- Re$^3$Sim: 3DフォトリアルなReal-to-Simによる高忠実度シミュレーションデータ生成sim2real2025/2/1
実世界の3D再構成とニューラルレンダリングでフォトリアルなシミュレーション環境を構築し、模倣学習でロボット操作方策を訓練、ゼロショットで実機転移を実現した研究。
- 予測的逆動力学モデルによるロボットマニピュレーションのスケーラブル学習マニピュレーション2024/12/1
ロボットの予測視覚状態に基づく逆動力学モデルで行動を予測するPIDMを提案し、大規模データで事前学習したSeerがシミュレーションと実世界で大幅な性能向上を達成した。
- PeriGuru: GUI画像理解とLLMプロンプティングに基づく周辺ロボット型モバイルアプリ操作アシスタントロボットアシスタント2024/9/1
スマホ操作が難しい高齢者や障害者を支援するため、GUIスクリーンショットを画像理解しLLMで操作判断を行いロボットアームで実行する周辺型アシスタントを開発し、81.94%の成功率を達成した。
- RoboKeyGen: 拡散モデルによる3Dキーポイント生成を用いたロボット姿勢と関節角度の推定姿勢推定2024/3/1
2Dキーポイント検出と拡散モデルによる3Dキーポイント生成に分けてロボットの姿勢と関節角度を推定し、従来法より高精度・高速に実現するフレームワークを提案。
- OriWheelBot: An origami-wheeled robot2023/10/1
- Robot Structure Prior Guided Temporal Attention for Camera-to-Robot Pose Estimation from Image Sequence2023/7/1