교육 콘텐츠 개인화 AI 데이터 라벨링, 새 문제와 강의에도 동일한 기준 적용

트렌드
2026-09-28

같은 문제를 풀어도 다른 학습 결과

‍



교육 콘텐츠 개인화 AI는 모든 학습자에게 동일한 콘텐츠를 제공하기보다 학습자의 문제 풀이 결과와 학습 과정에 맞춰 콘텐츠를 다르게 제시하는 방식을 구현하는 데 활용될 수 있습니다. 이를 위해서는 학습자의 정답·오답 기록만 모으는 것에서 한 단계 더 나아가 어떤 문제를 풀었는지, 어떤 유형에서 어려움을 보였는지, 어떤 콘텐츠를 학습했는지 등을 서로 연결할 수 있어야 합니다. 개인화 시스템의 데이터 구축에서는 학습자의 행동을 임의로 해석하기보다 실제로 기록할 수 있는 학습 활동과 콘텐츠 특성을 일정한 기준으로 분류하고 연결하는 작업이 중요한 기반이 됩니다.

‍

콘텐츠부터 동일한 기준으로 구조화

개인화 학습을 위해서는 학습자 데이터뿐 아니라 AI가 추천 대상으로 활용할 교육 콘텐츠 자체의 특성을 세분화하는 작업이 필요합니다. 같은 수학 콘텐츠라도 학습 단원과 개념, 문제 유형, 난이도, 요구되는 선수 지식 등에 따라 서로 다른 특성을 가질 수 있습니다. 이러한 정보를 일정한 형식으로 정리하면 학습자가 어떤 콘텐츠를 이용했는지뿐 아니라 해당 콘텐츠가 어떤 학습 목표를 갖고 있는지도 데이터로 연결할 수 있습니다. 특히 하나의 콘텐츠에 여러 개념이나 학습 목표가 포함된 경우 이를 어떤 방식으로 분류할지 사전에 기준을 정해야 콘텐츠별 데이터 편차를 줄이고 일관된 학습데이터를 구축할 수 있습니다.

‍

정답 여부만으로는 드러나지 않는 학습 과정

‍



학습자의 문제 풀이 기록에는 정답과 오답 외에도 풀이 시간, 재시도 횟수, 힌트 사용 여부, 동일 유형의 반복 학습 등 다양한 행동 정보가 포함될 수 있습니다. 이러한 기록은 개인화 모델이 학습자의 콘텐츠 이용 패턴을 분석하는 데 활용할 수 있습니다. 예를 들어 같은 문제를 여러 번 시도한 뒤 정답을 맞힌 경우와 첫 시도부터 정답을 맞힌 경우는 학습 과정에서 서로 다른 기록으로 남을 수 있습니다. 다만 관찰된 행동만으로 학습자의 이해도나 심리 상태를 단정하는 것은 적절하지 않습니다. 따라서 라벨링 단계에서는 실제 시스템에서 확인 가능한 행동과 결과를 중심으로 데이터 항목을 설계하는 것이 필요합니다.

‍

‍

교육 콘텐츠 개인화 데이터는 이렇게 구성

개인화 AI 학습데이터는 학습자 기록과 콘텐츠 정보를 서로 연결할 수 있는 구조로 설계하는 것이 핵심입니다.

‍

주요 데이터 구성 요소

  • 콘텐츠 정보 : 과목, 단원, 개념, 학습 목표, 콘텐츠 유형
  • 문항 정보 : 문제 유형, 난이도, 정답·오답, 문항별 특성
  • 학습 기록 : 풀이 시간, 시도 횟수, 학습 순서, 재학습 여부
  • 성과 정보 : 평가 결과, 영역별 정답률, 학습 과정의 변화
  • 콘텐츠 관계 정보 : 선수 학습, 연관 개념, 후속 학습 콘텐츠

이처럼 서로 다른 데이터를 연결할 수 있는 공통 기준을 마련하면 학습자별 콘텐츠 이용 패턴을 분석하고 맞춤형 콘텐츠를 제공하기 위한 AI 학습 기반으로 활용할 수 있습니다.

‍

난이도 라벨은 누가 붙여도 같은 결과가 나오도록

‍

‍

교육 콘텐츠의 난이도는 개인화 추천에서 활용될 수 있는 주요 정보지만, 작업자의 주관적인 판단에 따라 라벨이 달라지면 데이터의 일관성이 떨어질 수 있습니다. 따라서 난이도를 분류할 때는 문제에서 요구하는 개념의 수준이나 풀이 단계, 필요한 선수 지식 등 적용 기준을 구체적으로 정의할 필요가 있습니다. 또한 라벨링 작업자에게 대표 사례와 경계 사례를 함께 제공하면 비슷한 문제를 서로 다른 난이도로 분류하는 편차를 줄이는 데 도움이 될 수 있습니다. 학습자 수준 역시 단순한 등급 하나로 고정하기보다 과목이나 학습 영역별 기록을 별도로 관리하는 방식을 적용할 수 있습니다.

‍

오답을 분류할 때도 확인 가능한 근거가 필요

개인화 AI에서는 학습자가 틀린 문제의 유형을 구분하는 것도 중요한 데이터가 될 수 있습니다. 예를 들어 개념 관련 문항에서 반복적으로 오답이 발생하는 경우와 계산 과정에서 오류가 나타나는 경우는 데이터상 서로 다른 사례로 관리할 수 있습니다. 다만 정답이나 풀이 기록만으로 오답의 원인을 명확하게 확인하기 어려운 경우도 있습니다. 이때 작업자가 임의로 ‘개념 부족’이나 ‘계산 실수’ 등의 라벨을 부여하면 데이터에 주관적인 판단이 개입될 수 있습니다. 따라서 오답 원인을 별도 라벨로 구축할 경우에는 실제 풀이 과정이나 검증된 평가 기준 등 객관적으로 확인할 수 있는 근거를 마련하는 것이 필요합니다.

‍

학습 기록에는 개인정보 관리 기준도 함께 적용

‍



교육 플랫폼에서 생성되는 학습 데이터는 개인의 계정정보와 연결될 수 있으며 학습 이력과 평가 결과 역시 개인과 관련된 정보로 관리해야 할 수 있습니다. 따라서 AI 학습데이터를 구축할 때는 개인을 식별하는 데 필요한 정보와 모델 학습에 필요한 정보를 구분하고, 목적에 맞지 않는 정보의 활용을 줄이는 방식으로 데이터 구조를 설계할 필요가 있습니다. 데이터에 접근할 수 있는 작업자의 범위와 보관 방식도 함께 관리해야 합니다. 특히 학습 기록을 기반으로 학습자의 능력이나 성향을 과도하게 추론하지 않도록 실제 측정된 학습 결과와 모델이 별도로 추정한 정보를 구분하는 것도 데이터 관리 과정에서 고려할 부분입니다.

‍

새로운 콘텐츠가 들어와도 같은 기준을 유지하는 구조

교육 서비스에서는 새로운 강의와 문제, 학습 자료가 계속 추가될 수 있기 때문에 초기에 만든 데이터셋의 품질을 유지하려면 라벨링 기준을 지속적으로 관리해야 합니다. 새 콘텐츠가 기존 분류 체계에 맞게 등록되는지 확인하고, 작업자마다 난이도나 문제 유형을 다르게 판단하고 있지는 않은지도 검수할 필요가 있습니다. 또한 특정 과목이나 난이도의 데이터가 지나치게 많아지는 경우 데이터 분포를 확인하고 부족한 영역을 보완할 수 있습니다. 실제 구축 과정에서 반복되는 오류는 가이드에 반영하고 기존 데이터에도 필요한 수정 작업을 진행해야 합니다.

‍

이전글
이전글
다음글
다음글
목록보기