Speed up execution of the LLM in multi-workload environments
Sohee Park, Hunsun Hwang, Seungjay Lee, Myungsun Kim · The Journal of the Korean Institute of Information and Communication Engineering · 2024
챗 GPT의 등장으로 거대 언어 모델의 사용은 우리의 일상이 되었다. 거대 언어 모델은 메모리 요구량 및 연산 규모가 기존 딥러닝 모델들보다 훨씬 커서 함께 실행되는 워크로드들에 따라서 그 실행 성능이 많이 달라진다. 기존 언어 모델에서는 여러 개의 실행 스레드들 중 작업을 마친 스레드가 바쁜 대기 상태로 CPU를 계속해서 점유하는 방식이다. 따라서 다중 워크로드 환경에서는 작업 스레드 간 CPU를 사용하기 위한 경쟁 상태가 빈번하다. 이를 극복하기 위해 연산을 먼저 완료한 스레드가 데이터 의존성이 있는 작업의 완료를 기다리는 동안, CPU를 즉시 반환할 수 있게 실행 방법을 개선하였다. 시스템의 CPU 개수보다 많은 워크로드들이 실행되고 있는 환경에서 기존 대비 최대 9배의 성능 향상을 달성할 수 있었다.