Shuai Liu
収録論文 11本 ・ フィジカルAI/ロボット学習
一人称視点/道具使用推論VLA評価ロボット制御自動運転/世界モデル歩行自動運転/マルチセンサフュージョン
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTools: 実世界の一人称視点動画における道具中心の推論に向けて一人称視点/道具使用推論2026/9/30
道具を使う一人称視点動画の大規模データセット(100時間)と、知覚・幾何・手順・因果推論を問う1,000問のベンチマークを構築し、既存の動画マルチモーダルモデルが道具使用の理解に苦戦することを示した。
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
- 視覚言語行動モデルと世界行動モデルのための透かしロボット制御2026/6/1
ロボット制御用の視覚言語行動モデルや世界行動モデルに、秘密の鍵付きノイズシードを埋め込むことで知的財産を保護する透かし手法を提案した。
- UniDWM: 多面的表現学習による統合運転世界モデル自動運転/世界モデル2026/2/1
運転環境の幾何・見た目・動きをまとめて学習し、知覚・予測・計画を一貫して行える統合的な世界モデルを提案した論文。
- 低次元モデル誘導強化学習によるデモンストレーション不要のヒューマノイド歩行歩行2025/9/1
4自由度の低次元モデルで生成した歩容テンプレートを強化学習で全身ポリシーに蒸留し、モーションキャプチャなしで自然なヒューマノイド歩行を実現した。
- GaussianFusion: ガウス表現によるマルチセンサフュージョンを用いたエンドツーエンド自動運転自動運転/マルチセンサフュージョン2025/6/1
自動運転向けに、シーン全体に配置した2Dガウシアンを中間表現として複数センサの情報を統合し、軌道計画まで一貫して行うエンドツーエンド手法を提案した論文。
- Octopus: Embodied Vision-Language Programmer from Environmental Feedback2023/10/1
- Origami-inspired Bi-directional Actuator with Orthogonal Actuation2023/10/1
- Vacuum Driven Auxetic Switching Structure and Its Application on a Gripper and Quadruped2020/8/1
- A Flexible Connector for Soft Modular Robots Based on Micropatterned Intersurface Jamming2020/4/1
- Multi-vehicle Flocking Control with Deep Deterministic Policy Gradient Method2018/6/1