VLM-Based Context Extraction and Fine-Tuning of Korean LLMs for Automatic Travel Blog Content Generation
Donghun Lim, SeungSoo Han, Euichan Eun, Dongyeong Kim, Janghoon Choi · Journal of the Korea Society of Computer and Information · 2025
본 논문에서는 시각-언어 모델(VLM) 기반 맥락 추출과 파인 튜닝된 한국어 언어모델, 그리고 프롬프트 엔지니어링을 통한 텍스트-이미지(T2I) 생성 모델을 결합하여 한국어 여행 블로그 콘텐츠 자동 생성 시스템을 제안한다. Qwen2-VL 모델을 통해 여행 사진의 시각 정보를 분석해 감성적인 캡션을 생성하고 크롤링을 통한 여행 블로그 데이터를 활용한 HyperCLOVA X 모델 파인 튜닝을 통해 자연스러운 스토리텔링의 블로그 글을 생성한다. 또한, 여행 특화 프롬프트 엔지니어링을 통한 DALL-E 모델을 통해 여행 엽서·스탬프 이미지를 생성하여 직관적이고 창의적인 여행 기록을 제공한다. 강력한 시스템 프롬프트를 통해 환각 현상을 최소화하고, 감정 표현이 풍부한 문체를 유지하도록 설계하였다. 설문조사 결과, 파인튜닝 모델의 생성 결과가 여행에 더욱 특화되어 있다는 응답이 평균 60.9%로 나타났다. 이는 본 논문의 블로그 콘텐츠 생성물이 수작업 부담을 크게 줄이면서도 고품질의 여행 콘텐츠를 생성할 수 있음을 보여주며, 관광 분야에서 AI 기반 콘텐츠 제작에 대한 새로운 가능성을 제시한다.