Chuan Li
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 文脈を考慮したインテリジェント車両自動運転2026/9/1
本論文は、インテリジェント車両の次世代システムにおいて、状況要因(文脈)を一級の設計原理として扱い、ソフトウェアスタック全体で共有状態として活用することを提案し、関連研究を体系的にレビューして技術的課題を特定する。
- 適応的敵対者:LLMエージェントセキュリティのためのマルチターン・マルチLLMベンチマークLLMセキュリティ2026/7/20
LLMエージェントのセキュリティを評価するため、適応的なマルチラウンド攻撃を可能にする21シナリオのベンチマークを提案し、攻撃成功率がターン数に応じて大幅に上昇することを示した。
- 3D-DLP: 自己教師あり3Dオブジェクト中心シーン表現学習表現学習2026/6/1
RGB-Dやボクセル観測を3D潜在粒子に分解し、解釈可能で制御可能なオブジェクト中心表現を自己教師ありで学習するモデルを提案。ロボット操作タスクでの性能向上も確認。
- 物理シミュレータ上での強化学習による物理オリンピック問題解決物理推論/LLM/強化学習2026/4/1
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
- 潜在粒子世界モデル:自己教師ありのオブジェクト中心確率動的モデリング世界モデル2026/3/4
ビデオデータから教師なしでキーポイントやオブジェクトマスクを発見し、確率的な粒子動力学を学習する世界モデルを提案。実世界のマルチオブジェクトデータセットで最先端の性能を達成し、意思決定タスクにも応用可能。
- 反復的な自己修正による構成的画像生成の改善画像生成2026/1/1
視覚言語モデルを批評役として用い、テキスト画像生成モデルが複数ステップで生成を反復的に洗練させる手法を提案し、構成的なプロンプトでの生成精度を向上させた。
- 視覚-言語-行動モデルの未来を導く10の未解決課題VLA2025/11/1
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
- NORA-1.5:世界モデルと行動に基づく選好報酬で訓練された視覚-言語-行動モデルVLA2025/11/1
事前学習済みNORAにフローマッチング行動エキスパートを追加し、世界モデルと正解からの逸脱を報酬とするDPOで事後学習することで、シミュレーションと実機の両方で信頼性と汎化性能を向上させたVLAモデル。
- AimBot: 視覚運動ポリシーの空間認識を高める簡易補助視覚キューVLA2025/8/1
多視点RGB画像に照準線とスコープを重ねてエンドエフェクタの状態を明示し、視覚運動ポリシーの性能を向上させる軽量な視覚拡張手法を提案。
- NORA: 実世界タスク向け小型オープンソース汎用視覚言語行動モデルVLA2025/4/1
3Bパラメータのマルチモーダルモデルを基盤に97万件の実ロボット実演で学習し、大規模VLAより低計算コストで高いタスク性能を実現した。