An efficient and accurate method for binary quantification
Waqar Ul Hassan · 2022
A quantificação é um tópico de pesquisa próspero que estima as prevalências de classe em uma amostra de teste.Quantificação e classificação compartilham várias semelhanças.Por exemplo, o método de quantificação mais simples (ainda que tendencioso), Classifica & Conta (CC), utiliza um classificador para prever a classe de cada instância em uma amostra e calcular as proporções das classes.No entanto, CC apresenta um erro sistemático que cresce à medida que a distribuição de classe se distancia de uma distribuição que ela quantifica de maneira ideal.Esta questão tem motivado pesquisadores em quantificação a propor métodos de contagem mais confiáveis.Tais propostas superam o método CC, mas são significativamente mais ineficientes durante a inferência.No entanto, o tempo de inferência rápido é vital para inúmeras aplicações.Por exemplo, dados de sensores, análise de tweets e feed de notícias precisam processar fluxos rápidos ou um grande volume de dados.Esta tese investiga e propõe um algoritmo de quantificação altamente eficiente capaz de processar grandes volumes de dados normalmente requeridos por aplicações de Big Data e fluxo de dados.Nossa principal contribuição técnica é o Sample Mean Matching (SMM), um quantificador capaz de contar um bilhão de instâncias por segundo com precisão similar ao estado-da-arte.Além disso, o desempenho dos métodos de quantificação varia com as mudanças no tamanho do conjunto de teste, mudança de distribuição e casos de dados de treinamento equilibrados ou desequilibrados.Portanto, integramos diferentes configurações da literatura e recomendamos uma configuração experimental abrangente para avaliar os desempenhos de quantificares.