재검수 공수 70% 절감, 금융 이상거래 탐지 데이터 라벨링 품질 검증 AI 학습데이터

트렌드
2026-10-06

이상거래 탐지 데이터에서 확인하는 라벨 품질


금융 이상거래 탐지 AI를 학습시키려면 거래 데이터를 정상과 이상으로 구분하는 작업이 필요합니다. 하지만 실제 금융거래에서는 평소와 다른 거래가 발생했다는 사실과 실제 부정거래로 확인된 사실을 구분해 기록해야 합니다. 해외 결제나 고액 이체처럼 일반적인 이용자에게도 나타날 수 있는 거래가 있는 반면 평소와 다른 시간대와 지역에서 반복적인 거래가 발생하면서 추가 확인이 필요한 사례도 존재합니다. 따라서 라벨링 품질을 검증할 때는 단순히 분류 결과가 맞는지만 보는 것이 아니라 해당 판단을 뒷받침하는 거래 정보가 함께 연결돼 있는지 살펴봐야 합니다.

‍

정상거래와 이상거래 기준의 일관성

이상거래 데이터에서 가장 먼저 확인할 부분은 정상과 이상을 나누는 기준이 전체 데이터에서 일관되게 적용됐는지 여부입니다. 동일한 거래 조건인데 작업자에 따라 서로 다른 라벨이 붙어 있다면 AI가 어떤 패턴을 학습해야 하는지 판단하기 어려워집니다. 반대로 단순히 거래 금액이 높다는 이유만으로 이상거래로 분류하면 실제 정상적인 고액 거래까지 학습데이터에 포함될 수 있습니다. 라벨 가이드에서 거래금액, 시간, 지역, 빈도, 이용채널 등 어떤 정보를 판단 기준으로 사용하는지 명확하게 정의해야 합니다.

‍

거래 전후의 흐름과 라벨 연결

‍


금융 이상거래는 하나의 거래만으로 판단하기 어려운 사례가 많습니다. 특정 거래가 발생하기 전후에 어떤 거래가 이어졌는지를 함께 확인할 수 있는 데이터 구조가 필요합니다. 평소 소액 거래만 하던 계정에서 갑자기 고액 이체가 발생하고 짧은 시간 안에 다른 계좌로 자금이 이동하는 경우처럼 여러 거래가 연결돼 의미를 갖는 상황이 있기 때문입니다. 따라서 품질 검증 과정에서는 개별 거래의 라벨뿐 아니라 거래 순서와 시간 정보가 원본 데이터와 정확하게 연결됐는지 확인해야 합니다.

‍

금융 이상거래 데이터 품질 검증에서 확인할 항목

  • 정상·이상거래 라벨의 정의와 적용 기준
  • 거래 발생 시간과 거래 순서 정보
  • 거래 금액·계좌·채널 등 주요 거래 속성
  • 거래 전후의 연관 거래 정보
  • 이상거래 판단 근거와 검수 결과
  • 라벨 수정 및 검수 이력

이상거래 탐지 데이터에서는 라벨과 거래 원본의 연결 관계가 정확하게 유지되는지도 중요합니다. 거래 식별값이나 시간 정보가 잘못 연결되면 정상거래가 이상거래로 분류되거나 서로 다른 거래의 정보가 섞이는 문제가 발생할 수 있습니다.

‍

‍

라벨러 간 판단 차이 검증

대규모 금융 데이터는 여러 작업자가 동시에 처리하기 때문에 같은 거래를 두고 판단이 달라질 수 있습니다. 따라서 일부 데이터를 여러 라벨러가 독립적으로 검토해 작업자 간 라벨 일치도를 확인하는 과정이 필요합니다. 차이가 발생한 사례에서는 어느 기준에서 해석이 갈렸는지 확인하고 라벨 가이드를 보완해야 합니다. 특히 경계 사례가 반복적으로 발생한다면 단순한 작업자 실수보다 기준 자체가 충분히 구체적이지 않은 상황일 가능성도 고려해야 합니다.

‍

이상징후와 실제 이상거래의 구분

‍


금융 이상거래 탐지에서는 모델이 먼저 위험한 패턴을 찾아내고 이후 사람이 거래 내용을 확인하는 구조도 활용됩니다. 이때 이상징후가 발견된 거래와 실제 이상거래로 확인된 거래를 같은 라벨로 취급하지 않는 것이 중요합니다. 평소와 다른 위치에서 결제가 발생하거나 거래 빈도가 갑자기 증가했다는 사실은 추가 확인이 필요한 신호가 될 수 있지만 그 자체만으로 부정거래가 확정되는 것은 아니기 때문입니다. 데이터셋에서도 탐지 신호와 최종 확인 결과를 별도의 상태로 관리하면 모델 학습과 사후 분석에 활용할 수 있는 정보가 늘어납니다.

‍

다양한 거래 환경을 포함했는지 확인

AI가 특정 거래 패턴에만 의존하지 않도록 하려면 정상거래와 이상거래 모두 다양한 조건에서 수집된 데이터가 포함돼야 합니다. 온라인과 모바일, ATM 등 거래 채널이 다를 수 있고 국내와 해외 거래, 평일과 휴일, 낮과 야간 등 발생 조건도 다양합니다. 특정 기간이나 특정 채널에 이상거래 사례가 집중돼 있다면 AI가 실제 이상징후보다 데이터 수집 환경 자체를 학습하는 문제가 발생할 수 있습니다. 품질 검증 단계에서 거래 조건별 데이터 분포를 확인하는 이유도 여기에 있습니다.

‍

희소한 이상거래 데이터의 품질 관리

금융거래 전체에서 실제 이상거래 사례가 차지하는 비율은 정상거래보다 낮을 수 있습니다. 이 때문에 데이터셋을 구성할 때 이상거래 사례를 지나치게 적게 포함하면 모델이 정상거래 패턴에 편중되는 현상이 나타날 수 있습니다. 반대로 특정 유형의 이상거래만 인위적으로 반복하면 실제 환경에서 다양한 형태로 나타나는 이상 패턴을 충분히 반영하기 어렵습니다. 품질 검증에서는 이상거래 유형과 발생 조건을 나눠 데이터가 어느 한 사례에 과도하게 집중되지 않았는지 살펴볼 필요가 있습니다.

‍

라벨 오류와 원본 데이터 오류 구분

‍



금융 데이터에서 문제가 발견됐을 때 모든 오류가 라벨링 작업자의 실수에서 발생하는 것은 아닙니다. 거래 원본의 누락이나 중복, 시간값 오류와 라벨 자체의 판단 오류를 구분해서 검증하는 과정이 필요합니다. 원본 데이터에 문제가 있는 상태에서 라벨만 다시 확인하면 같은 오류가 반복될 수 있습니다. 따라서 품질검증 단계에서는 원본 거래정보, 라벨, 검수 결과를 각각 확인하고 오류가 어느 단계에서 발생했는지 추적할 수 있는 구조를 마련하는 것이 좋습니다.

‍

개인정보와 금융정보의 관리 상태

금융 이상거래 데이터에는 계좌나 거래정보처럼 민감하게 관리해야 하는 정보가 포함될 수 있습니다. 따라서 데이터 품질을 확인할 때는 라벨 정확도뿐 아니라 학습데이터에 불필요한 개인정보가 포함되지 않았는지도 함께 검토해야 합니다. 실제 학습에 필요한 정보와 별도로 식별에 사용되는 정보가 섞여 있다면 적절한 비식별화나 접근 권한 관리가 필요할 수 있습니다. 데이터 구축 과정에서 누가 원본에 접근했는지와 어떤 형태로 가공됐는지를 추적할 수 있는 관리체계도 함께 확인해야 합니다.

금융 이상거래 라벨 품질 검증에서 구분할 상태

  1. 거래 원본 정보와 정상·이상 라벨의 연결이 정확하게 확인된 상태
  2. 이상징후와 최종 이상거래 판단 결과가 구분돼 기록된 상태
  3. 라벨 검수와 오류 수정 결과가 데이터 이력에 반영된 상태

‍

AI 학습데이터로 사용하기 전 최종 검수

금융 이상거래 데이터의 최종 품질은 라벨 개수보다 AI가 실제로 학습해야 하는 거래 패턴이 데이터 안에 제대로 표현돼 있는지를 기준으로 확인하는 것이 적절합니다. 정상거래와 이상거래의 기준이 일관적인지, 거래 전후 정보가 연결돼 있는지, 특정 유형에 데이터가 편중되지 않았는지 등을 함께 살펴봐야 합니다. 검수 과정에서 발견된 오류는 수정 결과까지 기록하고 동일한 문제가 반복되는지 다시 확인해야 이후 모델 학습 과정에서도 데이터 품질을 추적하기 수월합니다.

‍

이전글
이전글
다음글
다음글
목록보기