
의료 AI 모델의 성능을 확인하려면 학습에 사용하지 않은 별도의 검증 데이터를 활용해야 합니다. 영상이나 의료 기록 등 입력 데이터에 실제 검사 결과나 전문가의 판독 결과를 연결하면 AI가 예측한 결과와 실제 기준을 비교할 수 있습니다. 따라서 검증용 데이터 라벨링에서는 단순히 정상과 이상을 구분하는 것보다 어떤 의료적 기준에 따라 라벨을 부여했는지 명확하게 관리하는 것이 중요합니다. 모델의 활용 목적과 의료 분야에 따라 필요한 데이터와 라벨 기준도 달라질 수 있습니다.
영상 데이터를 활용하는 의료 AI라면 병변이나 이상 소견이 나타나는 위치를 정확하게 표시해야 할 수 있습니다. X-ray, CT, MRI, 초음파, 병리 이미지 등 영상 종류에 따라 확인해야 하는 영역과 표시 방식도 달라집니다. 병변의 위치를 사각형으로 표시하거나 영역 전체를 구분하는 방식처럼 모델의 목적에 맞는 라벨 체계를 적용할 필요가 있습니다. 검증 데이터에서는 라벨의 위치뿐 아니라 실제 의료진의 판독 기준과 일치하는지 확인하는 과정이 중요합니다.

의료 AI 모델은 특정 연령이나 검사 조건에만 맞춰 성능을 확인하기보다 실제 사용 환경에서 발생할 수 있는 다양한 사례를 포함해 검증할 필요가 있습니다.
이러한 구성이 필요해야 모델이 특정 데이터 특성에만 의존하지 않고 여러 조건에서 일관된 결과를 내는지 확인할 수 있습니다.
의료 데이터에서 정상과 비정상을 단순하게 이분법으로 나누기 어려운 경우가 있습니다. 초기 단계의 이상 소견이나 경계가 모호한 사례, 여러 소견이 동시에 나타나는 사례 등이 있기 때문입니다. 따라서 라벨링 단계에서 이상 소견의 유형과 위치, 정도 등을 구분할 필요가 있습니다. 판단하기 어려운 사례는 임의로 분류하기보다 전문가 재검토 대상으로 별도 관리하는 기준을 마련하는 것이 중요합니다.

의료 데이터 라벨링에서는 일반적인 이미지 데이터보다 전문적인 판단이 필요한 경우가 많습니다. 하나의 데이터에 대해 여러 전문가의 판독 결과가 다르게 나타날 수도 있기 때문에 단일 라벨만을 정답으로 간주하기 어려운 사례도 있습니다. 이 경우 복수 전문가의 검토 결과와 의견 차이를 기록하고, 최종 라벨을 결정한 기준을 함께 관리할 수 있습니다. 검증 데이터의 기준값 자체가 불명확하면 AI 모델의 성능을 평가하는 과정에서도 정확한 비교가 어려워집니다.

의료 데이터는 검사 이미지뿐 아니라 검사일, 검사 종류, 판독 결과 등의 정보와 함께 관리될 수 있습니다. 이때 환자 정보와 검사 데이터가 잘못 연결되면 라벨링뿐 아니라 모델 검증 결과에도 영향을 줄 수 있습니다. 따라서 데이터 구축 과정에서는 필요한 정보만 연결하고 개인을 직접 식별할 수 있는 정보는 적절한 보호 절차를 적용해야 합니다. 특히 동일 환자의 여러 검사 데이터가 포함되는 경우 데이터 간 관계를 관리하면서 검증 데이터와 학습 데이터가 부적절하게 겹치지 않도록 확인하는 과정도 필요합니다.
의료 AI 모델 검증에서는 라벨의 정확성뿐 아니라 데이터 구성 자체도 중요합니다.
동일 환자의 유사한 검사 결과가 학습 데이터와 검증 데이터에 동시에 포함되면 실제보다 높은 성능이 나타날 수 있어 데이터 분리 기준을 명확하게 설정해야 합니다.
