Skip to main navigation Skip to search Skip to main content

Multimodal, Context-Aware, Feature Representation Learning for Classification and Localization

  • University of North Carolina at Charlotte
  • University of California at San Francisco

Research output: Chapter in Book/Report/Conference proceedingConference contributionpeer-review

Abstract

Automatic detection of malicious or provocative social media content is increasingly important to efforts leading to counteract illicit activities in the digital platform. This paper proposes a context-aware, regional feature representation learning framework that exploits multimodal cues to improve automatic detection by enhancing classification via accurate localization. Unlike most existing multimodal approaches, which evaluate category membership of multimedia web contents only at the image level, our approach leverages object proposals to identify potential interest regions within images in order to provide more precise localization performance that in turn, in a context-aware setting, also improves classification result. The proposed attention learning module estimates the domain specific cross-modal, fine-grained regional feature correspondence, conditioned on the classification categories, by evaluating mode relevance scores in a data-driven manner. The initial classification decision is further validated using a query adaptive decision fine-tuning for a more accurate final prediction. Experiments on publicly available datasets and on in-house datasets demonstrate superior classification performance as compared to monomodal and existing multimodal baselines.

Original languageEnglish
Title of host publicationProceedings - 2019 IEEE International Conference on Big Data, Big Data 2019
EditorsChaitanya Baru, Jun Huan, Latifur Khan, Xiaohua Tony Hu, Ronay Ak, Yuanyuan Tian, Roger Barga, Carlo Zaniolo, Kisung Lee, Yanfang Fanny Ye
PublisherInstitute of Electrical and Electronics Engineers Inc.
Pages1034-1039
Number of pages6
ISBN (Electronic)9781728108582
DOIs
StatePublished - Dec 2019
Event2019 IEEE International Conference on Big Data, Big Data 2019 - Los Angeles, United States
Duration: Dec 9 2019Dec 12 2019

Publication series

NameProceedings - 2019 IEEE International Conference on Big Data, Big Data 2019

Conference

Conference2019 IEEE International Conference on Big Data, Big Data 2019
Country/TerritoryUnited States
CityLos Angeles
Period12/9/1912/12/19

Keywords

  • Deep multimodal Learning
  • Feature Fusion
  • Multimodal Classification
  • Object Localization
  • Social Media

Fingerprint

Dive into the research topics of 'Multimodal, Context-Aware, Feature Representation Learning for Classification and Localization'. Together they form a unique fingerprint.

Cite this