Calibrating human and machine: Developing an AI-assisted rater discussion model for automated writing evaluation(AWE)

Jinyoung Olivia Choi, Ji-Soo Kim, Hyungsung Kim · Korean Association for Educational Information and Media · 2025

본 연구는 평가 공정성과 신뢰도 확보를 위하여 AI를 활용한 교사-AI 협업 기반의 평가자 협의 모델을 개발 및 검증하고자 하였다. 모델 개발 단계에서는 AI로 ChatGPT의 GPT-o3를 활용, 의 논술형 평가 과제를 기준으로 프롬프트 설계 및 채점을 시행하였다. 모델 검증 단계에서는 교사 3인과 AI가 고등학교 3학년 222명의 논술형 평가 답안 중 예비 채점 25편, 본 채점 50편을 샘플로 채점하였다. 이후, 국어 교사 8인을 대상으로 본 모델의 적합성 검증 FGI를 실시하였다. 양적 분석에는 채점 기준표의 설계 및 정교화, 예비 채점, 본 채점, 피드백 제공의 전 과정을 3단계로 구조화하고 채점 결과에 대한 Cronbach’s α, Rasch 내적합도(infit), 완전일치도 및 근접일치도 분석을 시행하였다. 그 결과, 교사-AI 간의 실제적인 프롬프트 설계를 제시함과 함께 본 채점 단계에서 AI 자동채점과 인간 평가자의 완전일치도가 53.2~68%, 근접일치도가 95.3~98%로 분포함을 확인하였다. MFRM은 GPT o3가 0.94로 적합한 채점자로 기능함을 확인하였다. FGI 분석 결과, 교사들은 단독 과목 운영 보조, 협의 효율성 제고, 평가 공정성 강화 측면에서 긍정적이라고 평가하였다. 그러나 교사의 AI 사용 역량편차가 존재하는 점, 교사 주도성 약화가 우려되는 점, 모델 자체의 복잡성과 AI 결과의 오류 가능성이 존재하는 점 등이 우려 사항으로 지적되었다. 이에, 본 연구는 생성형 AI를 교사 판단을 보완하는 후행적 조언자로 위치시켜 교사의 평가 전문성을 보장하는 방향을 강조하고, 인간-비인간 주체 사이의 다원적 협의 개념을 제안하였다. 추가로 AI의 ‘메타 평가자’ 가능성과 평가 유형별 적합성, 그리고 기술 활용 격차 해소 방안의 필요성을 제언하였다.

Read the paper · More papers on PaperTik