PART 1 · TRACK 3 · LESSON 3
나이브 베이즈 분류
베이즈 규칙의 가장 유용한 응용 중 하나는 소위 나이브 베이즈 분류기입니다.
LESSON FOCUS
이 소단원의 핵심 내용
베이즈 규칙의 가장 유용한 응용 중 하나는 소위 나이브 베이즈 분류기입니다.
- 실제 적용: 스팸 필터
- 우리가 그것을 "순진한"이라고 부르는 이유
- 매개변수 추정
베이즈 규칙의 가장 유용한 응용 중 하나는 소위 나이브 베이즈 분류기입니다.
베이즈 분류기는 텍스트 문서와 같은 객체를 두 개 이상의 클래스로 분류하는 데 사용할 수 있는 기계 학습 기술입니다. 분류자는 올바른 클래스가 제공되는 훈련 데이터 세트를 분석하여 훈련됩니다.
나이브 베이즈 분류기는 다양한 관측값이 주어졌을 때 클래스의 확률을 결정하는 데 사용할 수 있습니다. 모델의 가정은 특성 변수가 클래스에 따라 조건부 독립이라는 것입니다(이 과정에서는 조건부 독립의 의미를 논의하지 않습니다. 우리의 목적을 위해서는 분류기를 구축할 때 조건부 독립을 활용하는 것으로 충분합니다).
실제 적용: 스팸 필터
Naive Bayes 분류기의 아이디어를 설명하기 위한 실행 예제로 스팸 이메일 필터를 사용하겠습니다. 따라서 클래스 변수는 메시지가 스팸(또는 "정크 이메일")인지 또는 합법적인 메시지("햄"이라고도 함)인지 여부를 나타냅니다. 메시지의 단어는 특성 변수에 해당하므로 모델의 특성 변수 수는 메시지 길이에 따라 결정됩니다.
이 모델은 단어가 독립적으로 처리될 수 있다는 아이디어를 기반으로 하기 때문에 스팸("FREE", "LAST") 또는 ham("회의", "알고리즘")을 나타내는 특정 단어를 식별할 수 있습니다.
순진함에도 불구하고 순진한 베이즈 방법은 실제로 매우 잘 작동하는 경향이 있습니다. 이는 "모든 모델은 틀렸지만 일부 모델은 유용하다"는 통계학의 일반적인 속담의 좋은 예입니다(이 격언은 일반적으로 통계학자인 George E. P. Box의 말에 귀속됩니다).
매개변수 추정
시작하려면 스팸(햄에 대한)에 대한 사전 확률을 지정해야 합니다. 단순화를 위해 이를 1:1로 가정합니다. 이는 들어오는 메시지의 평균 절반이 스팸임을 의미합니다(실제로는 스팸의 양이 훨씬 더 높을 것입니다).
우도 비율을 얻으려면 단어 발생에 대해 두 가지 서로 다른 확률이 필요합니다. 하나는 스팸 메시지이고 다른 하나는 햄 메시지입니다.
두 클래스의 단어 분포는 합법적인 메시지뿐만 아니라 스팸 메시지도 포함된 실제 교육 데이터에서 가장 잘 추정됩니다. 가장 간단한 방법은 abacus, acacia, ..., zurg 등 각 단어가 데이터에 몇 번 나타나는지 계산하고 그 수를 전체 단어 수로 나누는 것입니다.
아이디어를 설명하기 위해 스팸과 햄을 마음대로 사용할 수 있다고 가정해 보겠습니다. 일련의 이메일을 두 개의 파일에 저장하면 이러한 데이터를 쉽게 얻을 수 있습니다.
두 가지 메시지 클래스에서 다음 단어(다른 모든 단어와 함께)의 발생 횟수를 계산했다고 가정합니다.
| 단어 | 스팸 | 햄 |
|---|---|---|
| 백만 | 156 | 98 |
| 달러 | 29 | 119 |
| 애드클릭 | 51 | 0 |
| 회의 | 0 | 12 |
| 합계 | 95791 | 306438 |
예를 들어 스팸 메시지의 한 단어가 "백만"일 확률은 95791개 중 약 156개로 대략 614개 중 1개와 같다고 추정할 수 있습니다. 마찬가지로 햄 메시지에서 306,438개 단어 중 98개(3127개 중 1개와 거의 동일함)가 백만 개라는 추정치를 얻을 수 있습니다. 이 확률 추정치는 둘 다 500분의 1 미만으로 작지만 더 중요한 것은 전자가 후자보다 높다는 것입니다. 614분의 1이 3127분의 1보다 높습니다. 이는 첫 번째 비율을 두 번째 비율로 나눈 우도 비율이 1보다 크다는 것을 의미합니다. 더 정확하게 말하면 비율은 (1/614) / (1/3127) = 3127/614 = 5.1(소수점 한 자리로 반올림)입니다.
이 섹션의 수학을 따르는 데 문제가 있는 경우 이전에 제공한 포인터를 사용하여 분수로 산술을 새로 고쳐야 한다는 점을 기억하세요(승산 및 확률 섹션의 승산에 대한 부분 참조).
위의 논리를 사용하면 0을 사용하지 않고도 가능한 모든 단어에 대한 우도 비율을 결정할 수 있으며 다음과 같은 우도 비율을 얻을 수 있습니다.
| 단어 | 우도비 |
|---|---|
| 백만 | 5.1 |
| 달러 | 0.8 |
| 애드클릭 | 53.2 |
| 회의 | 0.3 |
이제 새 메시지를 분류하는 방법을 적용할 준비가 되었습니다.
예: 스팸인가요, 햄인가요?
사전 확률과 우도 비율이 계산되면 의료 진단 사례에서 이미 예시로 연습한 베이즈 규칙을 적용할 준비가 된 것입니다. 추론은 이전과 동일하게 진행됩니다. 스팸 확률에 우도 비율을 곱하여 업데이트합니다. 절차를 상기시키기 위해 먼저 한 단어로 된 메시지를 시도해 보겠습니다. 이전 배당률의 경우 위에서 동의한 대로 배당률 1:1을 사용해야 합니다.
메시지의 나머지 단어를 처리하려면 정확히 동일한 절차를 사용할 수 있습니다. 이전 연습에서 계산한 한 단어 이후의 사후 확률은 다음 단어에 대한 사전 확률이 됩니다.
만세! 이제 다양한 실제 AI 애플리케이션에서 매일 사용되는 강력한 기술인 Naive Bayes 분류기를 마스터했습니다. 일부 기술을 건너뛰어야 하더라도 신념을 업데이트하기 위해 확률을 적용하는 기본 원칙을 이해했는지 확인해야 합니다. 이 장의 시작 부분에서 논의한 것처럼 확률적 추론의 주요 장점은 불확실하고 상충되는 증거를 처리하는 능력입니다. 의료 진단 및 스팸 필터링의 예를 사용하여 이것이 실제로 어떻게 작동하는지 보여주었습니다.
CHAPTER SUMMARY
3장을 완료하면 다음을 수행할 수 있습니다.
- 고유진동수로 확률을 표현합니다.
- 간단한 시나리오에서 위험을 추론하기 위해 베이즈 규칙 적용
- 기본율 오류를 설명하고 베이지안 추론을 적용하여 이를 방지합니다.
LESSON COMPLETE
