PART 2 · TRACK 2 · LESSON 3
나이브 베이즈 분류기
나이브 베이즈 분류기가 학습 데이터의 단어 분포를 이용해 텍스트를 여러 범주로 분류하는 원리를 배웁니다.
LESSON FOCUS
이 소단원의 핵심 내용
나이브 베이즈 분류기가 학습 데이터의 단어 분포를 이용해 텍스트를 여러 범주로 분류하는 원리를 배웁니다.
- 나이브 베이즈 분류기
- 그러면 알고리즘의 2단계에서 계산된 비율은 다음과 같습니다(소수점 4자리로 반올림됨).
- 다음과 같은 간단한 공식을 사용하여 배당률에서 확률 값을 얻을 수 있다는 점을 기억하세요.
III. 나이브 베이즈 분류기
베이즈 규칙의 가장 유용한 응용 프로그램 중 하나는 소위 Naive Bayes 분류기입니다. 텍스트 문서 등의 객체를 두 개 이상의 클래스로 분류하는 데 사용할 수 있는 기계 학습 기술입니다. 분류자는 올바른 클래스가 제공되는 일련의 훈련 데이터를 분석하여 훈련됩니다. 이 내용은 AI 소개에서 다루고 4장에서 이 과정에서 이러한 개념으로 돌아갈 것입니다. 지금 집중해야 할 것은 베이즈 규칙을 사용하여 확률을 계산하는 기본 아이디어라는 것입니다.
𝑃(𝑠𝑝𝑎𝑚∣𝑤𝑜𝑟𝑑𝑠)=𝑃(𝑤𝑜𝑟𝑑𝑠 ∣ 𝑠𝑝𝑎𝑚)𝑃(𝑠𝑝𝑎𝑚) / 𝑃(𝑤𝑜𝑟𝑑𝑠) P(스팸∣단어)=P(단어 ∣ 스팸)P(스팸)nnP(단어)
이는 메시지에 포함된 단어를 고려하여 메시지가 스팸일 확률입니다. 이 확률이 높으면 필터가 자동으로 메시지를 삭제하거나 정크 메일 폴더에 넣을 수 있습니다.
아이디어는 대규모 스팸 메시지 모음을 사용하여 메시지에 포함된 각 단어의 빈도를 추정하는 것입니다. 𝑃(𝑤𝑜𝑟𝑑𝑠 ∣ 𝑠𝑝𝑎𝑚) P(단어 ∣ 스팸). 종종 "햄"이라고 불리는 스팸이 아닌 메시지에 대해서도 동일한 작업을 수행하여 추정합니다. 𝑃(𝑤𝑜𝑟𝑑𝑠 ∣ ℎ𝑎𝑚) P(단어 ∣ 햄). 알다시피, 위의 베이즈 규칙 공식에는 후자의 항이 실제로 포함되어 있지 않지만 다음을 계산하는 데 필요합니다. 𝑃(𝑤𝑜𝑟𝑑𝑠) P(단어)는 모든 메시지(햄 또는 스팸)의 단어 빈도를 나타냅니다.
참고!
순진하다는 것은 무엇을 의미합니까?
Naive Bayes 분류기를 'naive'라고 부르는 이유는 메시지의 각 단어를 독립적으로 처리하고 순서를 무시하는 것과 관련이 있습니다. 따라서 Naive Bayes 모델에 따르면 'dog bit man'이라는 내용의 메시지는 'man bit dog'과 다르지 않습니다. 단어 순서를 무시하는 이러한 방식을 종종 '단어 모음' 접근 방식이라고 하며, 이 문제는 이 과정의 뒷부분에서 다시 다루겠습니다.
단어를 독립적으로 처리하면 새로운 단어가 수신될 때마다 확률을 업데이트하기 위해 베이즈 규칙이 반복적으로 적용되는 멋진 절차가 생성됩니다. 절차는 AI 소개에 설명되어 있으므로 다음과 같은 결과 알고리즘으로 건너뛰겠습니다.
확률부터 시작하세요 1:1 1:1 즉 스팸이 올 확률은 0.5 0.5. 소위 우도 비율을 다음과 같이 계산하십시오. 𝑟=𝑃(𝑤𝑜𝑟𝑑 ∣ 𝑠𝑝𝑎𝑚) / 𝑃(𝑤𝑜𝑟𝑑 ∣ ℎ𝑎𝑚) r=P(단어 ∣ 스팸)nnP(단어 ∣ 햄) 현재 확률에 곱하기 𝑟아르 모든 단어가 처리될 때까지 2단계와 3단계를 반복합니다.
참고: 여기서는 확률 대신 확률을 사용합니다. 왜냐하면 절차가 상당히 단순화되기 때문입니다. 확률과 승산의 관계는 AI 소개에 설명되어 있습니다.
간단한 인위적인 예를 들기 위해 메시지가 '백만 회의'라는 두 단어로 구성되어 있다고 가정해 보겠습니다. 우리는 스팸과 햄 모두에서 'million'과 'conferences'라는 단어의 빈도가 필요하며, 이는 두 종류의 메시지 모음에서 쉽게 추정할 수 있습니다. 주파수가 다음과 같이 추정되었다고 가정해 보겠습니다.
스팸햄
백만 0.0016285 0.0003198
컨퍼런스 0.0000100 0.0000391
그러면 알고리즘의 2단계에서 계산된 비율은 다음과 같습니다(소수점 4자리로 반올림됨).
𝑃(𝑚𝑖𝑙𝑙𝑖𝑜𝑛 ∣ 𝑠𝑝𝑎𝑚) / 𝑃(𝑚𝑖𝑙𝑙𝑖𝑜𝑛 ∣ ℎ𝑎𝑚)= 0.0016285 / 0.0003198 = 5.0923 P(백만개 ∣ 스팸) /P(백만개 ∣ 햄)=0.0016285 / 0.0003198=5.0923 𝑃(𝑐𝑜𝑛𝑓𝑒𝑟𝑒𝑛𝑐𝑒𝑠 ∣ 𝑠𝑝𝑎𝑚) / 𝑃(𝑐𝑜𝑛𝑓𝑒𝑟𝑒𝑛𝑐𝑒𝑠 ∣ ℎ𝑎𝑚)= 0.0000100 / 0.0000391 = 0.2554 P(컨퍼런스 ∣ 스팸)/P(컨퍼런스 ∣ 햄)=0.0000100nn0.0000391=0.2554
확률이 높을 때 1:1 1:1에 첫 번째 값을 곱하면 다음과 같습니다. 5.0923 :1 5.0923:1. 이는 '백만'이라는 단어만 주어지면 메시지가 스팸일 확률이 햄일 확률의 약 5배라는 것을 의미합니다. 메시지는 스팸처럼 보이지만 결국 햄일 수도 있습니다. 두 번째 단어 '회의'를 사용하면 확률이 곱해집니다. 0.2554 0.2554가 됩니다. ( 0.2554 × 5.0923 ):1= 1.30 :1 (0.2554×5.0923):1=1.30:1. 이제 메시지가 스팸이거나 햄일 확률은 거의 동일합니다.
다음과 같은 간단한 공식을 사용하여 배당률에서 확률 값을 얻을 수 있다는 점을 기억하세요.
예를 들어, 확률 1.30 :1 1.30:1의 확률로 1.30 / ( 1.30 +1)= 0.565 1.30π(1.30+1)=0.565(소수점 3자리). 아니면 백분율이 더 좋다고 생각한다면 56.5 % 56.5%.
우리 책상 서랍에는 주사위 두 개가 있습니다. 하나는 6개의 면이 있는 일반 일반 주사위입니다. 각 측면은 동일한 1/6 확률로 나타납니다. 다른 하나는 역시 6개의 면이 있는 로드된 주사위이지만 평균적으로 두 번째 시도마다 6개의 결과를 제공합니다. 즉, 6이 나올 확률은 첫 번째 주사위에서는 16.7%이지만 두 번째 주사위에서는 50%입니다.
주사위 중 하나를 무작위로 선택하여 두 주사위 모두 동일한 확률을 갖게 한 다음 동일한 주사위를 계속해서 굴리기 시작한다고 가정합니다. 첫 번째 굴림에서 결과가 6이라면 그것이 로드된 주사위인지 확신할 수 없습니다. 두 번째 롤에서도 결과가 6이라면 아마도 그럴 것이라고 생각하기 시작할 것입니다. 세 번째 6개 이후에는 꽤 확신하기 시작할 것입니다.
결과가 계속 6이라면, 로드된 주사위에 유리한 확률이 최소 100:1이 될 때까지 (처음부터 계산하여) 몇 번의 굴림이 필요합니까?
팁: 위에서 설명한 우도비(r)를 사용하세요. 이 경우 r = P(6 | 로드됨) / P(6 | 정상)입니다.
LESSON COMPLETE
