Yifan Zhang
Institute of Automation, Chinese Academy of Sciences
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 時間的強制:視覚・言語・行動モデルのための4D表現アライメントVLA2026/8/31
VLAモデルに履歴パスを導入し、4D基盤モデルの幾何特徴と整列させることで、時間情報を活用した操作性能を向上させた。
- Mind-VLA: 指示認識型空間表現アライメントによる視覚言語行動モデルVLA2026/8/1
言語指示で指定された対象物体の3D幾何に焦点を当て、VLAモデルの表現をアライメントする手法を提案。LIBEROやCALVINで高精度を達成し、実ロボットの遮蔽タスクでも大幅な性能向上を示した。
- 因果報酬ワールドモデル:自動スキル生成のためのゼロショット報酬設計強化学習2026/6/1
因果関係を明示的にモデル化した報酬ワールドモデルを提案し、LLMによる報酬生成を因果的制約で導くことで、環境フィードバックなしのゼロショット報酬設計を実現した。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- エレベータ-LIO: エレベータ起因の非慣性運動下での多階層ナビゲーションのための堅牢なLiDAR-慣性オドメトリ自己位置推定2026/5/1
エレベータ移動中の連続的なロボット自己位置推定を実現するため、非慣性フレームでの状態推定を分離モデル化し、モード依存の反復誤差状態カルマンフィルタに組み込んだLiDAR-慣性オドメトリフレームワークを提案した。
- 散らかった環境における動力学を考慮した方策学習による外在的器用さの創発マニピュレーション2026/3/1
散らかった環境での物体操作に向け、接触による物体動力学を明示的にモデル化して強化学習の方策を条件付けるDAPLフレームワークを提案し、シミュレーションと実世界で従来手法を上回る成功率を達成した。
- RE-SAC: バス群制御における偶然不確実性と認識不確実性の分離 — 安定でロバストなアンサンブル深層強化学習アプローチ強化学習/交通制御2026/3/1
バス運行の待機制御において、偶然不確実性と認識不確実性を明示的に分離するアンサンブルSACを提案し、Q値の不安定化を抑えて希少状態での推定誤差を最大62%削減した。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。
- エンジニアリングAGIへの道:LLMの設計能力を測るベンチマークベンチマーク2025/9/1
9つの工学分野にわたる実践的な設計課題を解かせるベンチマークEngDesignを提案し、LLMのドメイン知識統合や制約下推論、目的指向設計の能力を評価する。
- 触覚誘導ロボット超音波:肋間撮像のための事前計画スキャンパス写像医療ロボティクス2025/7/1
触覚センサで肋骨形状を取得し、事前計画したスキャンパスを肋間に合わせて写像するロボット超音波システムを提案。
- TOFG: A Unified and Fine-Grained Environment Representation in Autonomous Driving2023/5/1
- Not All Points Are Equal: Learning Highly Efficient Point-based Detectors for 3D LiDAR Point Clouds2022/3/1
- A Learning-based Discretionary Lane-Change Decision-Making Model with Driving Style Awareness2020/10/1
- Fabric Defect Detection Using Vision-Based Tactile Sensor2020/3/1