INDONESIAN DOCUMENT SEARCHING BASED ON TOPIC MODEL USING LATENT DIRICHLET ALLOCANTION AND METADATA
Indra Lukmana · 2016
Perkembangan data dalam bentuk teks berkembang sangat pesat dari berbagai sumber seperti media sosial, blog, dan berita. Sehingga diperlukan metode pencarian data tekstual dalam jumlah besar. Berbagai solusi telah dikembangkan untuk melakukan pencarian ini. Kekurangan dari teknik-teknik tersebut adalah masih lemah dalam menangani konsep sinonim dan polisemi serta belum memperhitungkan konteks implisit yang ada dalam teks. Tesis ini mengembangkan metode pencarian dengan menggunakan analisis semantik berdasarkan topik yang dikandung dalam suatu teks dengan menggunakan Latent Dirichlet Allocation (LDA), selain itu juga dilakukan penelitian untuk meningkatkan metode pencarian ini dengan melakukan analisis metadata. Dengan mengintegrasikan teknik pencarian berdasarkan topik teks dengan metadata ini telah dapat dilakukan proses pencarian berdasarkan bobot kepentingan. Teknik yang diusulkan melakukan ekstraksi topik menggunakan gibbs sampling berdasarkan LDA, topik ini menjadi representasi teks untuk pencarian. Pencarian tersebut lalu di kombinasikan dengan hasil pencarian berdasarkan metadata. Kombinasi ini dilakukan dengan menambahkan hasil pencarian berdasarkan LDA dan metadata berdasarkan suatu bobot kepentingan. Teknik yang diusulkan di uji menggunakan pengukuran precision recall dan Fmeasure. Berdasarkan hasil pengujian pencarian berdasarkan topik menggunakan latent dirichlet allocation dan metada untuk hasil pencarian dengan teknik yang diusulkan terhadap representasi 20 topik didapat nilai F-measure harmonic tertinggi 0.81 dan terendah 0.71.