Tianyi Zhang
Knowin AI
収録論文 54本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboAware: 反事実的結果から身体スキルの協調を学習するVLA2026/10/8
コーディングエージェントが複数のロボットスキルを組み合わせる際に、状態に応じてどのポリシー系統が成功するかを反事実的結果から学習する調整器を提案し、100タスクで77%の成功率を達成した。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- RACaP: 進化可能なロボット学習のためのポリシーとしての推論・行動・コーディングVLA2026/9/24
コード生成を進化フェーズに移し、展開時は凍結された型付きポリシーAPIをReActループで呼び出すエージェント型フレームワークを提案。長期的タスクで成功率と速度を大幅に改善し、小型モデルへの蒸留で実機展開を効率化した。
- Robo-Harness K1: 知覚拡張によるロボット操作エージェントの活用VLA2026/9/24
VLMに深度や空間計測などの知覚ツールを提供し、追加学習なしでロボット操作を実現するエージェントフレームワークを提案。少ない実演データでも高い汎化性能を示す。
- World Action Agent:視覚的アクション空間でのロボット操作を可能にするVLM活用フレームワークVLA2026/9/24
VLMをマルチエージェント構成でロボット操作に活用し、接触ビュー・アクションリハーサル・ビュー内補正を組み合わせた視覚的アクション作業空間を提案。LIBERO-Proで75.6%の成功率を達成。
- Scalix: 不確実性を考慮したスケール一貫性のある単眼SLAMSLAM2026/8/18
単眼SLAMのスケール曖昧性を解決するため、学習された深度情報を確率的因子グラフに統合し、ピクセル単位とフレーム単位の不確実性を考慮してメートルスケールの状態推定を実現するフレームワークを提案した。
- RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム強化学習/ヒューマノイド2026/8/17
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
- OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作VLA2026/8/1
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
- HELP: ロールアウト分割による人間効率的な大規模ロボットポストトレーニングVLA/ポストトレーニング2026/7/1
VLAモデルのポストトレーニングにおいて、2人の専門オペレータが12台のロボットを同時監視し、ロールアウトを自動分割する手法を提案し、人間の労力あたりのポリシー改善とタスクスループットを最大化する。
- NeoMap: 単一画像・動画からの学習不要な新規視点合成新規視点合成2026/7/1
事前学習済み動画モデルから、学習や追加調整なしで高品質かつ視点一貫性のある新規視点映像を生成するフレームワークを提案した。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- RynnBrain 1.1:より高機能で汎用的な具現化基盤モデルを目指してVLA/基盤モデル2026/7/1
RynnBrain 1.1は、2Bから122B-A10Bまでの規模を持つ具現化基盤モデル群で、接触点予測や3Dグラウンディングを導入し、ロボット操作に直接対応する表現と出力を実現。実機実験では、Qwenベースや汎用VLAを上回る性能を示した。
- 自然勾配ベイズフィルタリング:力学系のための幾何認識フィルタ状態推定2026/5/1
ガウス分布の統計多様体上で自然勾配降下を用いて事後分布を更新する幾何認識型ガウスフィルタ(NANOフィルタ)を提案し、線形ガウス系ではカルマンフィルタと一致することを示した。衛星姿勢推定やロボットの状態推定などで有効性を実証している。
- フローマッチングVLAにおける保守的SFTによる基盤能力の保持VLA/ロボット学習2026/5/1
フローマッチング型VLAモデルのファインチューニング時に生じる破壊的忘却を防ぐため、モデルの信頼度に応じて学習信号を動的にスケーリングする保守的教師あり学習(ConSFT)を提案し、LIBEROやRoboTwinベンチマークで既存手法を上回る性能を確認した。
- リー群上の自然勾配ガウス近似フィルタによるロボット状態推定状態推定2026/4/1
リー群上で定義された非線形観測モデルを線形化せずに、ガウス分布の増分変数に対する最適化問題として再定式化し、自然勾配法を用いて解く新しいフィルタリング手法を提案した。実機の脚ロボット実験で有効性を実証した。
- ランジェバン誘導フローマッチングによる自動運転向けリアルタイム生成ポリシー自動運転/強化学習2026/3/1
フローマッチングをオンライン強化学習に導入し、ランジェバンダイナミクスで経験を動的に最適化することで、1回の推論で高品質な行動を生成する低遅延な自動運転ポリシーを実現した。
- RoboStriker: 自律ヒューマノイドボクシングのための階層的意思決定ヒューマノイド制御2026/1/1
人間のモーションキャプチャからボクシングスキルを学習し、潜在空間での自己対戦強化学習により、シミュレーションと実機で競技可能なヒューマノイドボクシングを実現した。
- ロボット実世界強化学習のための視覚-言語-行動-批評家モデルVLA2025/9/1
大規模データで学習したVLAベースのプロセス報酬モデルVLACを提案し、報酬設計を不要にするとともに、実世界のマニピュレーション4タスクで成功率を約30%から約90%へ向上させた。
- 単一画像から陰的表面モデルを効率的に構築するFINSsim2real2025/9/1
単一または少数のRGB画像から高精度な陰的表面とSDF場を数秒で再構築する軽量フレームワークFINSを提案し、ロボットの表面追従タスクへの応用を示した。
- カメラ空間で行動を接地する観測中心の視覚-言語-行動ポリシーVLA2025/8/1
ロボットの手先姿勢をロボット基準座標系ではなくカメラ座標系で予測するOC-VLAを提案し、視点変化への汎化とタスク成功率を改善した。
- 視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御をVLA2025/6/1
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
- 調和勾配を用いた分布型Soft Actor-Criticによるマルチレーン自動運転の安全かつ効率的な学習自動運転/安全強化学習2025/5/1
効率的な走行と安全制約の2つの方策勾配を調和させて衝突を抑える新しい安全強化学習手法DSAC-Hを提案し、マルチレーン自動運転でほぼ違反ゼロの効率的走行を実現した。
- 双腕ロボットのカメラキャリブレーションとシーン表現の同時推定キャリブレーション2025/5/1
複数のロボットアームに搭載されたカメラの外部キャリブレーションと腕間の相対姿勢、共有作業空間の3D表現を、マーカーなしで同時に推定するフレームワークを提案。
- 単一画像から動画生成環境表現を介した運動方策へナビゲーション2025/5/1
1枚のRGB画像から動画生成モデルで多視点映像を作り、3D基盤モデルで点群を再構成して衝突回避運動を生成する枠組みVGERを提案。
- NANO-SLAM:自然勾配ガウス近似による車両SLAMSLAM2025/4/1
車両SLAMにおいて、サンプリング分布をガウスパラメータ上の最適化問題として定式化し、自然勾配降下法で解くことで線形化誤差を回避し精度を向上させる手法を提案した論文。
- GraphSeg: グラフの辺追加と縮約によるセグメント化された3D表現3Dセグメンテーション2025/4/1
深度情報なしの少数の2D画像から、2Dの類似度と推定3D構造の二重対応グラフを構築し、辺の追加とグラフ縮約で一貫した3D物体セグメンテーションを生成する手法。
- 海の果てまで無限に続くリーグ:潜在フラクタル拡散モデルによるフォトリアルな3D海底地形生成3D生成/拡散モデル2025/3/1
海底探査ロボットの実画像から3D形状と意味情報を抽出し、フラクタル潜在表現で条件付けした拡散モデルでRGBD海底画像を生成、3DGSで統合することでフォトリアルな大規模海底シーンを生成する手法DreamSeaを提案。
- Dita: 汎用視覚言語行動ポリシーのための拡散TransformerのスケーリングVLA2025/3/1
Transformerで連続行動列を直接ノイズ除去するマルチモーダル拡散フレームワークを提案し、多様なロボットデータを統合して長期的タスクや実環境適応を実現した。
- SurgRAW: ロボット手術動画解析のための思考連鎖推論を用いたマルチエージェントワークフロー手術AI/マルチエージェント2025/3/1
手術シーン理解のための推論ベンチマークSurgCoTBenchを構築し、思考連鎖推論で専門エージェントが協調するゼロショット多タスク解析ワークフローSurgRAWを提案した論文。
- 曖昧さのない空間基盤モデルに向けて:深度曖昧性の再考と分離空間理解2025/3/1
透明シーンなどで生じる深度曖昧性に対処するため、単一予測ではなく複数仮説を扱う空間基盤モデルを提案し、学習不要のラプラシアン視覚プロンプトで多層深度を推定する手法を開発した。
- ノイズを含む動画からのロバストな自己運動推定と3D再構成のためのスケーラブルなベンチマークと学習3D再構成2025/1/1
ノイズの多い動画でも高精度な自己運動推定と3D再構成を実現するため、ノイズ合成パイプラインとベンチマークRobust-Ego3Dを構築し、テスト時適応手法CorrGSを提案した。
- 二重ベータカルマンフィルタによる脚式ロボットのロバスト状態推定状態推定2024/11/1
脚式ロボットの状態推定において、足の滑りと脚の長さ変化を考慮した測定モデルを提案し、脚長を推定するパラメータフィルタと状態フィルタを反復的に用いる二重推定フレームワークと、外れ値に頑健なベータカルマンフィルタを導入した。
- MambaXCTrack:SSM相互相関と運動プロンプトを用いた超音波針追跡医用画像追跡2024/11/1
超音波画像中の針先追跡にMambaを初めて応用し、SSM相互相関と暗黙的な運動プロンプトでノイズや針先の見えにくさに対処した追跡手法を提案した。
- SplaTraj: セマンティックGaussian Splattingによるカメラ軌道生成シーン表現/軌道生成2024/10/1
言語指示に基づき、Gaussian Splattingで再構成した環境内を映える形で巡るカメラ軌道を連続時間最適化で生成するフレームワーク。
- 拡散トランスフォーマーポリシーVLA2024/10/1
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
- PhotoReg: 3Dガウシアンスプラッティングモデルのフォトメトリック位置合わせ3DGS2024/10/1
複数の3Dガウシアンスプラッティングモデルを、3D基盤モデルとフォトメトリック損失を用いてスケールを揃えながら統合するフレームワークを提案。
- Embodied-RAG: 具現化エージェントのための汎用ノンパラメトリック記憶検索生成VLA2024/9/1
ロボットの探索で得たマルチモーダルな知識を階層的な「意味の森」として記憶し、ナビゲーションや言語生成に活用するRAGフレームワークを提案した。
- ModCube:モジュール式自己組み立て立方体型水中ロボット群制御2024/9/1
8つのスラスタで6自由度移動し、電磁石で他のロボットと剛結合できる低コストなモジュール型水中ロボットを開発し、その動特性の評価手法と4つのベンチマークを提案した。
- 3D基盤モデルによる把持物体の形状と姿勢の同時推定マニピュレーション2024/7/1
3D基盤モデルを活用し、外部カメラのキャリブレーションなしで、ロボットが把持した物体の形状と姿勢をRGB画像から同時に推定する手法を提案した。
- 完全からノイズ世界シミュレーションへ:SLAMロバスト性ベンチマークのためのカスタマイズ可能な身体性マルチモーダル摂動SLAM2024/6/1
RGB-D SLAMモデルのロバスト性評価のため、センサ・運動摂動を体系的に分類し合成するパイプラインと大規模ベンチマークNoisy-Replicaを提案した。
- 共有RGB-Dフィールドの学習:LiDAR-カメラ3D知覚のためのラベル効率の良い統一自己教師あり事前学習VLA2024/5/1
LiDARとカメラの3D知覚モデル向けに、NeRFを活用して両モダリティを統一的にマスク再構成する自己教師あり事前学習手法NS-MAEを提案し、ラベル効率の良いファインチューニングで従来手法を上回る性能を示した。
- 3D基盤モデルによるシーン表現とハンドアイキャリブレーションの統合キャリブレーション2024/4/1
マニピュレータ搭載RGBカメラの画像から、キャリブレーションマーカーなしで環境表現の構築とカメラ-エンドエフェクタ間のキャリブレーションを同時に行うJCR手法を提案。
- 人間のスケッチでロボットの行動場所と動作を教える:空間図式指示マニピュレーション2024/3/1
人間がカメラ画像上にスケッチした領域を3D空間に投影し、連続的な空間指示マップを学習してロボットの最適化問題に組み込む手法を提案。移動マニピュレータのベース配置問題に適用し、高品質な解と高速な実行を実現した。
- DarkGS: 暗闇でのロボット探査のためのニューラル照明学習と3Dガウシアン再照明3D再構成/再照明2024/3/1
移動する光源下の暗い環境で、カメラと光源の系をニューラルにモデル化し、再照明可能な3Dガウシアンシーンを構築して実時間で写実的な新視点画像を生成する手法を提案した。
- ロバストSLAMベンチマークのためのカスタマイズ可能な摂動合成SLAM2024/2/1
多様な摂動を加えたノイズ環境を合成するパイプラインを提案し、マルチモーダルSLAMモデルのロバスト性を評価するベンチマークを構築した。
- 基盤モデルによる汎用ロボットの実現に向けて:サーベイとメタ分析基盤モデル2023/12/1
NLPやCVの基盤モデルをロボットに応用する研究と、ロボット専用の基盤モデルの可能性を整理したサーベイ論文。
- 軌道安定系の学習による図式教示図式教示2023/9/1
ユーザーが与えた1枚の手描きスケッチから、ロボットが表面に接近し周期的な動きをする軌道安定な力学系を学習する枠組みを提案。
- スケッチでロボットに教える:確率的図式教示による模倣学習模倣学習2023/9/1
ユーザーが2D画像上にスケッチした軌跡から3D空間の動作軌道を生成する「図式教示」という新しい模倣学習パラダイムを提案し、レイトレーシングを用いた確率的軌道学習フレームワークで実現した。
- 見えないものを推論する効率的な屋外物体ナビゲーションナビゲーション2023/9/1
屋外環境での物体ゴールナビゲーションの新タスクOUTDOORを提案し、LLMが未来を幻視する仕組みと計算考慮型成功指標を導入、シミュレーションドローンと実機四足歩行ロボットで有効性を示した。
- Beyond NeRF Underwater: Learning Neural Reflectance Fields for True Color Correction of Marine Imagery2023/4/1
- Learning Cross-Scale Visual Representations for Real-Time Image Geo-Localization2021/9/1
- Generative Adversarial Network based Heuristics for Sampling-based Path Planning2020/12/1
- Design Paradigms Based on Spring Agonists for Underactuated Robot Hands: Concepts and Application2020/11/1
- Exploring home robot capabilities by medium fidelity prototyping2017/10/1