Tat-Seng Chua
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HumanScale: 身体中心の人間ビデオは実ロボットデータを凌駕する身体化事前学習の可能性身体化事前学習2026/6/18
身体化基盤モデルの事前学習データとして、遠隔操作の実ロボット軌跡と身体中心の人間ビデオを比較し、適切なフィルタリングとラベリング処理を施した人間ビデオが実ロボットデータよりも優れた性能を示すことを発見した。
- 偽造特有の近道を抑制する汎用ディープフェイク検出ディープフェイク検出2026/6/1
ディープフェイク検出の汎化性能を高めるため、偽造手法特有のショートカットを部分空間モデリングで特定・抑制するフレームワークを提案した。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- Reasoning-VLA:自動運転向けの高速で汎用的な視覚-言語-行動推論モデルVLA2025/11/1
学習可能な行動クエリと推論強化された視覚言語特徴を並列に用いて連続行動軌道を生成するVLAフレームワークを提案し、8つの自動運転データセットを統合して学習・強化学習微調整を行い、最先端の性能と汎化性、高速推論を実現した。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- EQ-TAA: 拡散モデルによる事故動画合成を用いた同変交通事故予測事故予測2025/6/1
拡散モデルで通常映像から事故の因果部分を合成し、擬似的な事故・非事故映像ペアを用いた同変学習により、追加アノテーションなしで交通事故予測精度を向上させた研究。
- 3D-TAFS: 訓練不要の3Dアフォーダンスセグメンテーションフレームワークアフォーダンス2024/9/1
大規模マルチモーダルモデルと3D視覚ネットワークを組み合わせ、訓練なしで言語指示から3D物体のアフォーダンス領域を切り出す手法を提案し、屋内シーン向けベンチマークIndoorAfford-Benchも構築した。