Shaofeng Liang
収録論文 7本 ・ フィジカルAI/ロボット学習
3D視覚グラウンディング/自動運転/マルチセンサヒューマノイド制御触覚/サーベイVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Talk2Sensors: センサ適応型物理的手がかりマッチングによる自動運転の3D視覚グラウンディング3D視覚グラウンディング/自動運転/マルチセンサ2026/8/5
カメラ・LiDAR・4Dレーダーのマルチセンサデータを用いた自動運転向け3D視覚グラウンディングのデータセットと、言語クエリに応じてセンサ情報を動的に統合するTransformerベースのフレームワークを提案した。
- 身体が動く前に:言語条件付きヒューマノイド制御のための予測的関節意図の学習ヒューマノイド制御2026/5/1
言語指示に基づくヒューマノイドの全身制御において、将来の接触変化やバランス準備を明示的に予測する階層的フレームワークDAJIを提案し、予測的関節意図を学習することで追従性能と生成品質を向上させた。
- 身体化知能における触覚ベースのマルチモーダル融合:視覚・言語・接触駆動パラダイムのサーベイ触覚/サーベイ2026/5/1
触覚と視覚・言語を統合するマルチモーダル触覚融合の研究を包括的に調査し、データセットと手法の階層的分類法を提案した論文。
- WaterVideoQA:マルチモーダルエージェントによるASV中心の知覚と規則準拠推論VLA2026/2/1
水上航行環境に特化した大規模動画QAベンチマークWaterVideoQAと、マルチエージェント神経記号システムNaviMindを提案し、ASVの認知・推論能力を評価・向上させる。
- MMDrive: マルチ表現融合による視覚を超えた対話的シーン理解VLA2025/12/1
占有マップ・LiDAR点群・テキスト記述を統合し、質問に応じて適応的に融合する自動運転向けマルチモーダル視覚言語モデルを提案。DriveLMとNuScenes-QAで高精度を達成。
- AerialMind:UAVシナリオにおける参照マルチオブジェクト追跡に向けてVLA2025/11/1
UAV(ドローン)映像で自然言語指示に基づくマルチオブジェクト追跡を行うための大規模ベンチマークAerialMindと、半自動ラベリング手法COALA、追跡手法HawkEyeTrackを提案した論文。
- Da Yu:水上監視とシーン理解のためのUSV向け画像キャプショニングVLA2025/6/1
水上環境の画像キャプションデータセットWaterCaptionを構築し、USV向けのエッジ展開可能なマルチモーダル大規模言語モデルDa Yuを提案した。