
반도체 공정의 비전 AI 데이터 라벨링에서는 단순히 정상과 불량을 나누는 것만으로 충분하지 않습니다. 웨이퍼나 패널 표면에 나타나는 스크래치, 오염, 얼룩, 패턴 이상, 파티클 등 결함의 형태가 서로 다르고 같은 결함도 크기와 위치에 따라 의미가 달라질 수 있기 때문입니다. 특히 육안으로는 구분하기 어려운 미세한 차이가 검사 결과에 영향을 줄 수 있어 라벨링 단계에서 어떤 특징을 결함으로 인정할 것인지 세부 기준을 마련해야 합니다. 결함의 종류와 함께 위치, 크기, 형태 등의 정보를 일관된 방식으로 기록하는 것이 데이터 품질에 직접적인 영향을 미칩니다.
반도체 제조 과정에서는 공정 단계에 따라 관찰되는 이상 형태가 달라질 수 있습니다. 동일한 얼룩처럼 보이는 이미지라도 어느 공정에서 발생했는지에 따라 단순한 표면 흔적인지 실제 공정 이상을 나타내는 결함인지 판단 기준이 달라질 수 있습니다. 따라서 여러 공정에서 촬영된 이미지를 하나의 기준으로 단순 분류하기보다 공정 특성을 고려한 라벨 체계를 구성하는 것이 필요합니다. 전공정과 후공정에서 사용하는 검사 이미지의 특성이 다르다면 데이터셋 역시 단계별로 구분해 관리하는 방식이 적합합니다.

결함 검출 모델을 위한 데이터에서는 결함이 존재한다는 사실만 표시하는 것보다 화면의 어느 영역에 어떤 형태로 나타났는지를 함께 기록하는 작업이 중요합니다. 작은 점 형태의 결함과 길게 이어지는 선형 결함은 같은 불량으로 분류되더라도 모델이 학습해야 할 시각적 특징이 다릅니다. 또한 웨이퍼의 중심부와 가장자리에서 반복적으로 나타나는 결함은 발생 원인을 분석할 때도 서로 다른 의미를 가질 수 있습니다. 따라서 프로젝트 목적에 따라 바운딩박스나 영역 표시 등 적절한 방식으로 결함의 공간 정보를 남겨야 합니다.

반도체 이미지에서는 결함과 배경의 경계가 뚜렷하지 않은 사례도 발생합니다. 미세한 얼룩이나 명암 차이처럼 사람마다 결함 여부를 다르게 판단할 수 있는 이미지가 대표적입니다. 이런 데이터를 억지로 정상 또는 불량 중 하나로 분류하면 라벨러마다 다른 기준이 적용될 가능성이 커집니다. 따라서 판정이 어려운 사례를 별도로 표시하고 전문가 검토 대상으로 넘기는 기준을 마련하는 것이 좋습니다. 애매한 데이터를 무조건 제거하기보다 왜 판단하기 어려운지까지 기록하면 이후 라벨 기준을 보완하는 데에도 활용할 수 있습니다.

동일한 웨이퍼를 촬영하더라도 카메라나 광원, 배율, 촬영 방식에 따라 이미지의 형태가 달라질 수 있습니다. 이때 특정 장비에서만 나타나는 시각적 특성을 실제 결함으로 잘못 라벨링하면 장비가 바뀌었을 때 모델의 판정 기준이 흔들릴 가능성이 있습니다. 따라서 데이터셋을 구성할 때 검사 장비와 촬영 조건을 함께 관리하고 특정 장비의 이미지에 데이터가 지나치게 치우치지 않았는지 확인해야 합니다. 장비별 이미지 특성을 별도로 구분해두면 모델 검증 과정에서도 성능 차이를 확인하기 수월합니다.
결함 데이터에 관심이 집중되면서 정상 이미지는 단순히 ‘결함 없음’으로만 처리하기 쉽습니다. 하지만 실제 검사 환경에서는 정상 범위 안에서도 밝기나 패턴, 표면 상태에 일정한 차이가 존재합니다. 이러한 변화를 충분히 포함하지 않으면 모델이 학습 과정에서 특정한 시각적 특징을 결함으로 오인할 가능성이 있습니다. 따라서 정상 데이터 역시 다양한 공정 조건과 제품 상태를 포함하도록 구성하고, 정상 범위에서 허용되는 변동과 결함으로 판단해야 하는 차이를 라벨링 가이드에 구체적으로 정리할 필요가 있습니다.

미세 결함을 다루는 데이터에서는 처음 정한 라벨 기준이 실제 작업 과정에서 그대로 유지되지 않는 경우도 있습니다. 새로운 유형의 이미지가 등장하면서 기존 분류 기준만으로 판단하기 어려운 사례가 발견될 수 있기 때문입니다. 라벨러 간 판단 차이가 반복되는 항목을 별도로 모아 기준을 수정하고, 변경된 기준을 기존 데이터에도 적용할지 검토하는 과정이 필요합니다. 특히 이미 구축된 데이터에서 특정 결함 유형의 라벨 오류가 확인되면 해당 사례만 수정하는 데 그치지 않고 유사한 이미지까지 함께 점검해야 데이터셋 내부의 기준을 일정하게 유지할 수 있습니다.
반도체 공정 결함검출을 위한 데이터 라벨링에서는 하나의 정답 체계로 모든 검사 목적을 해결하려 하기보다 어떤 결함을 발견하고 이후 어떤 판단에 활용할 것인지에 맞춰 라벨의 깊이를 결정하는 방식이 적합합니다. 단순 검출이 목적이라면 결함의 위치와 유형이 핵심이지만, 결함 원인 분석이나 공정 개선까지 연결하려면 발생 공정과 검사 조건 등의 정보가 추가로 필요합니다. 반대로 활용하지 않을 정보를 지나치게 세분화하면 라벨링 비용과 작업 시간이 커질 수 있습니다. 모델의 목표와 실제 검사 업무에서 필요한 정보를 먼저 정한 뒤 그 범위에 맞춰 라벨 항목을 설계하는 것이 효율적인 데이터 구축으로 이어집니다.
