The evaluation of binary classification tasks in economical prediction

Martin Pokorný · Acta Universitatis Agriculturae et Silviculturae Mendelianae Brunensis · 2014

V oblasti ekonomických klasifikačních úloh je maximalizace přesnosti často používanou metrikou pro hodnocení klasifikačního výkonu. Maximalizace přesnosti (resp. minimalizace chybovosti) trpí předpokladem rovných nákladů chyb typu falešná pozitivita a falešná negativita. Kromě toho není přesnost schopna vyjádřit pravý výkon klasifikátoru v situaci nerovnoměrného rozložení tříd. Vzhledem k těmto omezením je použití přesnosti v reálných úlohách diskutabilní. V reálné binární klasifikační úloze je rozdíl mezi náklady falešné pozitivity a falešné negativity obvykle kritický. K překonání tohoto problému je použita metoda ROC ve spojení s principy rozhodovací analýzy. Jednou z podstatných výhod této metody je možnost vizualizace klasifikačního výkonu prostřednictvím ROC grafu. Tato studie prezentuje konkrétní příklady binární klasifikace, kde je ukázána neadekvátnost přesnosti jako evaluační metriky, a na stejných příkladech je dále aplikována metoda ROC. Z množiny dostupných klasifikačních modelů je uvažován pravděpodobnostní klasifikátor se spojitým výstupem. Zejména jsou řešeny dvě otázky. Za prvé výběr nejlepšího klasifikátoru z množiny dostupných klasifikátorů. Například metrika přesnosti hodnotí dva klasifikátory téměř ekvivalentně (87,7 % a 89,3 %), zatímco rozhodovací analýza (prostřednictvím minimalizace nákladů) nebo ROC analýza odhalují rozdílný výkon podle cílových podmínek nerovných nákladů falešných pozitivit a falešných negativit. Za druhé nastavení optimální rozhodovací hraniční hodnoty na výstupu klasifikátoru. Například maximalizace přesnosti nachází optimální hraniční hodnotu na výstupu klasifikátoru v hodnotě 0,597, avšak optimální hraniční hodnota respektující vyšší náklady falešných negativit je nalezena nákladovou minimalizací nebo ROC analýzou v hodnotě podstatně nižší (0,477).

Read the paper · More papers on PaperTik