CrowdSpeech and Vox DIY: Benchmark Dataset for Crowdsourced Audio Transcription

Nikita Pavlichenko, Ivan Stelmakh, Dmitry Ustalov · Zenodo (CERN European Organization for Nuclear Research) · 2021

We collect and release CrowdSpeech — the first publicly available large-scale dataset of crowdsourced audio transcriptions. e show its applicability on an under-resourced language by constructing VoxDIY — a counterpart of CrowdSpeech for the Russian language.

Read the paper · More papers on PaperTik