Sheng Li
収録論文 7本 ・ フィジカルAI/ロボット学習
音声認識/HRI人間ロボット協調ヒューマノイドロボット/口唇動作生成マルチモーダル学習ナビゲーションソーシャルアシストロボティクス
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- すべてをオンラインAPIサービスに任せるのか?ロボットシステムにおけるローカル音声認識モデルの統合に関する調査音声認識/HRI2026/7/1
ロボットへの音声認識技術の統合方法を、ローカルモデルとオンラインAPIの比較を含めて体系的に調査した論文。ASRモデルの進化、ROSベースやクラウドベースの展開戦略、実ロボットプラットフォームを整理し、今後の課題と方向性を示している。
- PACT: 人間とロボットの協調作業における継続的タスク支援のためのプロアクティブな質問人間ロボット協調2026/5/1
ロボットが長期の人間との協調作業で、過去の対話履歴を活用しつつ、行動前に質問すべきか行動すべきかを判断する「ask-or-act」フレームワークを提案し、支援精度と質問頻度のトレードオフを評価した。
- ヒューマノイドロボットのための3D動的ビジームと調音結合モデリングに基づくリアルな口唇動作生成ヒューマノイドロボット/口唇動作生成2026/4/1
中国語の発音理論に基づき、3D動的ビジームライブラリと調音結合機構を構築し、14自由度の口唇駆動システムへのリターゲティングを経て、ヒューマノイドロボットの自然な口唇同期動作を生成する手法を提案した。
- VibraVerse: 物理的に整合したマルチモーダル学習のための大規模幾何学-音響アラインメントデータセットマルチモーダル学習2025/11/1
3D形状・物性・振動モード・音響信号を因果的に対応付けた大規模データセットVibraVerseと、形状・画像・音を統一表現空間で整合させる対照学習フレームワークCLASPを提案し、形状からの音予測や音からの形状復元などのベンチマークを構築した。
- IndustryNav: 動的産業環境における身体性エージェントの空間推論ベンチマークナビゲーション2025/11/1
動的な倉庫を再現したUnity環境で、視覚言語モデルによる能動的なナビゲーションと空間推論を評価する初の産業向けベンチマークを提案し、最先端モデルの安全性や計画能力の課題を明らかにした。
- LLM搭載ソーシャルアシストロボットによる親子の感情共調整支援:プロンプトとロボット行動の統合ソーシャルアシストロボティクス2025/7/1
発達障害児とその親の感情共調整を支援するため、LLMを活用したソーシャルロボットMiRo-Eを開発し、親子ペアでのパイロットテストを通じて有効性と課題を明らかにした。
- Optimizing Collision Avoidance in Dense Airspace using Deep Reinforcement Learning2019/12/1