Video Retrieval System Using One-to-One Relation Between Clip-Sentence Sequence

Dooyoung Kim, Youngjoong Ko · Journal of KIISE · 2023

동영상 검색은 후보 동영상 중 텍스트 쿼리와 연관된 동영상을 찾는 연구 분야이다. 기존의 동영상 검색 모델은 비디오와 텍스트의 구조적 특징을 고려하지 않고 쌍을 이루는 임베딩이 서로 유사해지도록 학습하는 방식을 사용해왔다. 본 논문에서는 비디오와 텍스트의 구조적 특징 중 하나인 클립 시퀀스와 문장 시퀀스가 일대일대응 관계를 이룬다는 점을 활용하는 새로운 동영상 검색 모델 및 학습 기법을 제안한다. 실험 결과 본 논문에서 제안하는 최종 모델의 성능은 베이스라인 모델 대비 YouCook2 데이터셋에서 문장-클립 검색 R@1과 문단-동영상 검색 R@1에서 각각 0.3%p와 5.4%p의 향상된 성능을 보인다.

Read the paper · More papers on PaperTik