
반도체 제조 과정에서는 웨이퍼와 패널 등의 표면이나 패턴을 촬영해 스크래치, 오염, 패턴 이상 등 공정 과정에서 발생할 수 있는 결함을 확인하는 검사가 이루어집니다. 비전 AI를 적용하려면 정상적인 이미지와 결함이 포함된 이미지를 학습데이터로 구성하고, 결함의 위치와 유형을 일정한 기준으로 표시해야 합니다. 특히 반도체 검사에서는 결함의 크기가 작거나 정상 패턴과 차이가 미세한 사례도 존재할 수 있어 단순한 이미지 분류만으로는 충분하지 않을 수 있습니다. 따라서 검사 대상과 결함 유형에 맞는 세밀한 데이터 구축과 라벨링 기준이 필요합니다.
반도체 결함 탐지용 데이터는 검사 장비의 카메라나 현미경 등으로 확보한 이미지에서 구축할 수 있습니다. 이때 배율과 조명 조건, 촬영 위치, 공정 단계 등에 따라 동일한 결함도 서로 다른 형태로 나타날 수 있다는 점을 고려해야 합니다. 특정 장비나 조건에서만 촬영된 이미지에 데이터가 편중되면 AI가 실제 결함보다 촬영 환경의 특징을 학습할 가능성이 있습니다. 따라서 데이터셋을 구성할 때는 이미지의 촬영 조건과 공정 정보를 함께 관리하고, 검사 목적에 따라 필요한 데이터를 선별할 필요가 있습니다. 원본 이미지의 품질과 해상도, 중복 여부 등을 확인하는 작업도 초기 데이터 정제 과정에 포함될 수 있습니다.

수집된 이미지는 AI가 어떤 부분을 결함으로 판단해야 하는지 알 수 있도록 라벨링합니다. 대표적으로 결함의 위치와 유형, 크기 등을 표시하고 정상 영역과 구분하는 작업이 이루어질 수 있습니다. 결함 위치를 사각형으로 표시하는 바운딩박스 방식부터 미세한 결함의 영역을 픽셀 단위로 표시하는 세그멘테이션 방식까지 목적에 따라 적용할 수 있습니다. 예를 들어 단순히 결함의 존재 여부를 판단하는 모델과 결함 위치를 정확하게 찾아내는 모델은 필요한 데이터의 상세 수준이 다릅니다. 따라서 데이터 구축 전에 AI 모델이 최종적으로 수행할 검사 기능을 정의하고 그에 맞춰 라벨의 범위와 단위를 결정하는 과정이 필요합니다.

결함 탐지용 비전 AI 데이터는 불량 이미지 자체뿐 아니라 해당 이미지가 어떤 공정과 조건에서 확보됐는지 확인할 수 있도록 구성하는 것이 좋습니다.
이처럼 이미지와 결함 정보, 공정·촬영 조건을 함께 관리하면 결함 유형별 분석과 AI 모델 학습에 활용할 수 있는 데이터셋을 구성할 수 있습니다.

반도체 검사에서는 일반적으로 정상 제품이나 정상 영역의 데이터가 결함 사례보다 훨씬 많이 확보될 수 있습니다. 이처럼 정상 데이터와 결함 데이터 사이에 수량 차이가 큰 경우 데이터 불균형이 AI 학습 과정에 영향을 줄 가능성이 있습니다. 특히 특정 결함 유형의 사례가 매우 적다면 모델이 해당 결함의 특징을 충분히 학습하기 어려울 수 있습니다. 따라서 데이터 구축 과정에서 결함 유형별 수량을 확인하고 부족한 사례를 별도로 확보하거나 학습·검증 데이터의 구성을 조정하는 작업이 필요합니다. 다만 단순히 소수 결함 이미지를 반복해 사용하는 것보다 실제 검사 환경에서 발생하는 결함의 형태와 분포를 고려해 데이터를 구성하는 것이 중요합니다.
반도체 이미지에서는 모든 형태의 차이가 불량을 의미하는 것은 아닙니다. 정상적인 패턴 변화와 실제 결함을 구분하지 못하면 정상 이미지를 불량으로 분류하거나 결함을 놓치는 문제가 발생할 수 있습니다. 따라서 라벨링 작업에서는 결함 판정 기준을 구체적으로 정의하고 실제 검사 결과나 품질 판정 기준과 연결하는 것이 필요합니다. 경계가 모호한 사례를 작업자가 임의로 판단하지 않도록 별도의 보류 또는 재검토 범주를 둘 수도 있습니다. 또한 동일한 결함이라도 크기나 위치에 따라 판정 기준이 달라지는 경우 해당 조건을 라벨 체계에 반영해야 합니다. 현장 검사 기준과 데이터 라벨 기준을 일치시키는 작업이 데이터 품질을 좌우할 수 있습니다.

결함 영역이 작거나 이미지 내에서 정상 패턴과 유사한 경우에는 라벨링 오류를 발견하기 어려울 수 있습니다. 이에 따라 작업자가 표시한 결함 위치와 유형을 별도의 검수자가 다시 확인하거나 실제 검사 결과와 대조하는 과정이 필요합니다. 검수 과정에서는 결함 위치의 누락이나 과도한 영역 표시, 잘못된 결함 유형 지정 등을 확인할 수 있습니다. 또한 특정 작업자에게만 오류가 집중되는지, 특정 결함 유형에서 반복적인 오판이 발생하는지도 분석할 수 있습니다. 이러한 결과를 라벨링 가이드에 반영하면 동일한 오류가 반복되는 것을 줄일 수 있습니다. 결국 데이터 품질관리는 라벨을 한 번 작성하는 것보다 검사 기준과 실제 데이터 사이의 차이를 지속적으로 확인하는 과정에 가깝습니다.

반도체 제조 환경에서는 공정 조건과 검사 대상, 장비 등이 변경될 수 있기 때문에 기존에 구축한 데이터만으로 새로운 검사 환경을 모두 설명하기 어려울 수 있습니다. 새로운 공정에서 발생하는 결함이나 기존과 다른 이미지 특성이 확인되면 이를 데이터셋에 추가하고 라벨링 기준이 현재 검사 기준과 일치하는지도 점검해야 합니다. 또한 학습용 데이터와 별도로 모델 성능을 확인하기 위한 검증 데이터를 관리하면 특정 데이터에 과도하게 맞춰진 모델인지 확인하는 데 도움이 될 수 있습니다. 반도체 공정 결함 탐지 비전 AI 데이터 구축은 정상·결함 이미지 수집부터 세밀한 라벨링, 검수와 데이터 갱신까지 이어지는 지속적인 품질관리 과정으로 운영할 필요가 있습니다.
