Zero-shot Hateful Meme Detection via CLIP-guided Image Captioning

Jaegook You, Hyunsouk Cho · 정보과학회 컴퓨팅의 실제 논문지 · 2025

최근 멀티모달 대규모 언어 모델이 발전하면서 다양한 멀티모달 태스크에서 높은 성능을 발휘하고 있다. 하지만 이미지와 텍스트의 암묵적 연결성을 추론해야 하는 혐오 밈 탐지 태스크에서는 여전히 낮은 성능을 보여주고 있다. 따라서 본 연구에서는 기존 멀티모달 대규모 언어 모델이 어려움을 겪고 있는 혐오 밈 탐지 태스크를 수행하기 위해 CLIP 기반 이미지 캡션 방법론을 제안한다. 제안하고자 하는 방법론에서는 다양한 캡션의 생성 및 요약, 그리고 CLIP 임베딩 유사도 점수 기반 캡션 추출 과정을 통해 이미지 전체의 상황 및 문맥 정보를 담고 이미지와 텍스트의 암묵적 연결성에 대한 추론 성능을 높이고자한다. 해당 방법론을 적용한 결과, InstructBLIP-Flan-T5-xl, InstructBLIP-Flan-T5-xxl 모델이 각각 3.4%, 1.0%의 정확도 향상을 기록하여 본 연구에서 제안한 방법론이 효과 있었음을 보였다.

Read the paper · More papers on PaperTik