Spatial Clustering with Contiguity Constraint for Improving Prediction Accuracy in Spatial Machine Learning
Hyeyun Kang, Min Jeong, Hyeongmo Koo · Journal of the Korean Society of Surveying Geodesy Photogrammetry and Cartography · 2024
기계학습에서 예측 정확도 향상은 중요하며, 이를 위해 다양한 방법이 연구되고 있다. 그 중 군집 기법은 데이터의 유사성을 바탕으로 분할하거나 병합하는 것으로, 이를 통해 생성된 각 군집에 대해 기계학습 모형을 구축함으로써 예측 정확도를 높일 수 있다. 일반적으로 군집분석은 속성적 유사성만을 반영한다. 그러나 공간데이터는 공간적 자기상관과 같은 특수성을 가지고 있어 이를 고려할 시 기계학습의 예측 정확도를 향상시킬 수 있으며, 공간적 유사성을 고려한 군집모형의 구축도 공간데이터의 특수성을 반영할 수 있는 방안이다. 따라서 본 연구는 공간적 유사성을 고려한 군집 기법이 기계학습 예측 정확도에 미치는 영향을 탐색한다. 구체적으로 속성적 유사성만을 고려한 군집 기법과 공간적 유사성과 속성적 유사성 모두를 고려한 군집 기법으로 생성된 기계학습 모형의 예측 정확도를 대중교통 일평균 승하차 인원 예측 모형을 사례로 비교하였다. 본 연구에서 사용한 기계학습 기법은 선형회귀모형, 랜덤포레스트, 그래디언트부스팅이며, 반응변수는 대중교통 일평균 승하차 인원, 그리고 입력변수는 토지특성, 인구특성, 시설특성을 설명하는 11개 변수를 사용하였다. 예측 결과 모든 모형에서 공간적 유사성을 고려한 군집 기법이 그렇지 않은 군집 기법보다 통계적으로 유의미하게 높은 예측 정확도를 보였다. 본 연구는 공간데이터를 기계학습에 적용할 때 공간적 유사성을 고려하는 것이 예측 정확도를 향상시킬 수 있음을 보여주었다는 점에서 의의를 가진다.