Употреба модела Whisper Large v3 Sr за транскрипцију говора на српском језику у програмском језику Пајтон на платформи Гугл колаб
Никола Јанковић, Јована Иваниш · 2025
АпстрактУ овом раду представљен je скрипт у програмском језику Пајтон (енг.Python) на платформи Гугл колаб (енг.Google Colab) који користи фино подешени модел за транскрипцију говора на српском језику Whisper Large v3 Sr (https://huggingface.co/Sagicc/whisper-large-v3-sr-cmb), чиме се омогућава бесплатно, квалитетно и једноставно транскрибовање говора на српском језику у текст.Мотивација за креирање овог скрипта проистекла је из недостатка доступних алата који истраживачима пружају једноставно коришћење овог модела без потребе за напредним техничким знањима и значајним рачунарским ресурсима.Овај скрипт омогућује једноставно учитавање аудиозаписа, њихову транскрипцију помоћу модела Whisper Large v3 Sr и преузимање транскрипције у текстуалном формату.У раду ће најпре укратко бити описан горенаведени модел који скрипт користи, а затим ће детаљно бити описан начин функционисања самог скрипта, уз упутство за коришћење.Такође, биће представљени проблеми које је било неопходно превазићи за успешну примену овог приступа, као што је потреба за аутоматском сегментацијом звучних записа, одређивање оптималних параметара сегментације и омогућавање подршке за различите формате аудио-материјала.