FDS 모델을 검토하다 이런 질문을 받았습니다.
모델 선택에 AUROC를 어떻게 활용했습니까?
처음에는 F1을 기준으로 설명했습니다. 양성이 0.5%뿐이니 Precision과 Recall을 함께 보는 게 맞다고 생각했죠. 운영까지 연결하자 질문이 하나 더 생겼습니다.
조사팀은 하루에 몇 건을 처리할 수 있을까?
조사 용량을 기준에 넣으면 모델 선택의 성격이 달라집니다. 분류 성능을 겨루는 문제에서 제한된 조사 좌석을 배분하는 문제로 바뀝니다.
AUROC는 무엇을 설명할까
10만 건 중 실제 이상이 500건이라고 가정해 보겠습니다. 모델의 Recall은 80%, FPR은 1%입니다.
- 실제 이상 500건 중 400건을 찾습니다.
- 정상 99,500건 중 995건이 조사 대상으로 올라옵니다.
- 전체 조사 대상은 1,395건이며 Precision은 약 28.7%입니다.
AUROC는 전체 데이터에서 양성과 음성을 얼마나 잘 정렬했는지 보여줍니다.
운영팀의 질문은 조금 다릅니다. 하루에 100건을 조사한다면 상위 100건에서 몇 건을 잡을 수 있을지가 궁금합니다. 이때 필요한 지표가 Precision@100과 Recall@100입니다.
AUROC는 전체 순위를 설명하고, top-K 지표는 실제 조사 구간을 설명합니다. 두 지표가 답하는 질문이 다릅니다.
F1만으로 충분할까
F1은 Precision과 Recall의 균형을 하나의 값으로 요약합니다.
F1은 불균형 데이터에서 threshold 후보를 빠르게 비교할 때 유용합니다. 운영 기준으로 사용하려면 처리량과 비용을 함께 봐야 합니다.
첫째는 처리량입니다. F1이 가장 높은 지점에서 2,000건이 탐지될 수 있습니다. 조사팀의 하루 처리량이 100건이면 실제 운영 구간은 상위 100건입니다.
둘째는 비용입니다. 불필요한 조사 한 건과 놓친 이상 한 건의 비용은 서로 다릅니다. 조직이 감당할 수 있는 조사량과 위험 수준을 함께 반영해야 합니다.
그래서 지표를 세 층으로 나눴습니다.
| 확인할 내용 | 지표 |
|---|---|
| 전체 데이터의 순위 품질 | AUROC, AUPRC |
| 실제 조사 구간의 탐지 성과 | Precision@K, Recall@K, Lift@K |
| 운영 정책의 지속 가능성 | 조사 건수, FP/FN 비용, 월별 탐지 수율 |
양성 비율이 낮아질수록 AUPRC와 top-K 지표의 역할이 커집니다. ROC 공간에서는 작아 보이는 FPR 변화도 실제 건수로 환산하면 수백 건의 조사량을 만듭니다.
Threshold는 운영팀과 맺는 계약이다
Threshold를 찾기 전에 K부터 정했습니다. 담당 인원, 건당 조사 시간, 고위험 사례의 별도 처리 기준을 반영해 일·주·월 단위의 조사 용량을 계산합니다.
K가 100으로 정해지면 모델도 같은 조건에서 비교할 수 있습니다. 모델 A의 threshold가 0.82이고 모델 B가 0.61이어도 두 모델 모두 상위 100건을 올립니다. 이제 Precision@100과 Recall@100을 나란히 볼 수 있습니다.
비용 데이터를 축적하는 초기 단계에는 제약 조건을 사용합니다.
- Precision을 30% 이상 유지합니다.
- 고위험 유형의 Recall을 70% 이상 유지합니다.
- 하루 조사량을 100건으로 운영합니다.
제약 조건을 명시하면 모델 선택 근거도 구체화됩니다.
운영 제약을 만족하는 후보 중 Recall@100이 가장 높은 모델을 선택합니다.
시간 순서대로 다시 확인한다
FDS 데이터에는 계절성, 정책 변경, 새로운 이상 유형이 함께 들어옵니다. 여러 시점의 backtest를 통해 다음 변화를 살펴봅니다.
- Precision@K와 Recall@K의 월별 변동
- Threshold와 탐지 건수의 안정성
- 조직·상품·채널별 탐지 분포
- 정책 변경 전후의 성능 변화
Validation 기간에서 threshold를 정한 뒤 미래 시점의 Test 기간에 적용합니다. 배포 이후에는 실제 조사 수율과 지연 유입되는 이상 사례를 추적합니다. 이 과정까지 이어져야 모델 점수가 운영 성과로 연결됩니다.
F1은 여전히 유용합니다. 다만 역할이 달라졌습니다. F1은 threshold 후보를 요약하고, 최종 선택은 조사 용량과 비용 정책이 결정합니다.
모델은 위험 점수를 출력하고, 정책은 그 점수를 조사 건수와 비용으로 번역합니다. 좋은 FDS 모델은 제한된 조사 용량 안에서 일관된 결정을 지원합니다.