PART 2 · TRACK 2 · LESSON 2
베이즈 규칙
이전 섹션에서는 특정 정보를 기반으로 우리가 몰랐던 것에 대해 추론하기 위해 조건부 확률을 사용했습니다. 요약하자면, 우리가 몰랐던 것은 복권 당첨자의 국적이었고, 우리가 활용한 정보는 당첨자가 어부였다는 사실이었습니다.
LESSON FOCUS
이 소단원의 핵심 내용
이전 섹션에서는 특정 정보를 기반으로 우리가 몰랐던 것에 대해 추론하기 위해 조건부 확률을 사용했습니다. 요약하자면, 우리가 몰랐던 것은 복권 당첨자의 국적이었고, 우리가 활용한 정보는 당첨자가 어부였다는 사실이었습니다.
- 베이즈 규칙
- 새로운 팔로어 중 5%가 봇이라고 가정해 보겠습니다. 이는 다음과 같이 작성할 수 있습니다.
- 연습 9. 차단할까, 말까?
II. 베이즈 규칙
이전 섹션에서는 특정 정보를 기반으로 우리가 몰랐던 것에 대해 추론하기 위해 조건부 확률을 사용했습니다. 요약하자면, 우리가 몰랐던 것은 복권 당첨자의 국적이었고, 우리가 활용한 정보는 당첨자가 어부였다는 사실이었습니다.
많은 응용 분야에서 특히 유용한 조건부 확률을 계산하는 특정 방법, 즉 베이즈 규칙이 있습니다. 베이즈 규칙에 자주 사용되는 공식은 다음과 같습니다.
𝑃(𝐴∣𝐵)=𝑃(𝐵∣𝐴)𝑃(𝐴)𝑃(𝐵) P(A∣B)= 피(B) P(B∣A)P(A)
대신 특정 이벤트를 사용하는 경우 𝐴A와𝐵 B, 예를 들면 다음과 같습니다.
𝑃(𝐷𝑒𝑛𝑚𝑎𝑟𝑘 ∣ 𝑓𝑖𝑠ℎ𝑒𝑟)=𝑃(𝑓𝑖𝑠ℎ𝑒𝑟 ∣ 𝐷𝑒𝑛𝑚𝑎𝑟𝑘) 𝑃(𝐷𝑒𝑛𝑚𝑎𝑟𝑘) / 𝑃(𝑓𝑖𝑠ℎ𝑒𝑟) P(덴마크 ∣ 어부)=P(어부 ∣ 덴마크) P(덴마크)nnP(어부)
𝑃(𝐷𝑒𝑛𝑚𝑎𝑟𝑘∣𝑓𝑖𝑠ℎ𝑒𝑟) P(덴마크∣피셔)는 어부인 경우 덴마크인일 확률을 나타냅니다. 이를 계산하려면 이제 오른쪽의 세 수량에 대한 숫자 값이 필요합니다. 𝑃(𝑓𝑖𝑠ℎ𝑒𝑟∣𝐷𝑒𝑛𝑚𝑎𝑟𝑘) P(피셔∣덴마크), 𝑃(𝐷𝑒𝑛𝑚𝑎𝑟𝑘) P(덴마크) 및 𝑃(𝑓𝑖𝑠ℎ𝑒𝑟) 피(어부).
첫 번째 항은 덴마크에 거주하는 임의의 사람이 어부일 확률입니다. 이는 이전 섹션에서 다음과 같이 계산되었습니다.
0.034
%
0.034%. 두 번째 항은 현재 북유럽 국가만을 고려하여 임의의 사람이 덴마크에 거주할 확률입니다. 우리도 이미 계산하고 알아낸 바 있습니다.
21.5
%
21.5%.
우리에게 필요한 세 번째이자 마지막 용어는 때때로 알아내는 데 약간의 작업이 필요할 수 있는 용어입니다. 여기서는 5개국 모두의 어부 수를 합산하여 계산하는 것이 매우 간단합니다. 21,711 21,711명을 해당 국가의 전체 인구로 나누면, 26,067,000 26,067,000. 이것 역시 우리가 이미 계산했으며 이전 섹션의 첫 번째 표에서 찾을 수 있습니다. 0.083 % 0.083%.
계산을 위해 확률을 백분율 대신 일반 십진수로 작성하겠습니다(각 백분율을 다음으로 나눕니다).
100
100). 위의 숫자를 올바른 위치에 대입한 공식은 다음과 같습니다.
𝑃(𝐷𝑒𝑛𝑚𝑎𝑟𝑘 ∣ 𝑓𝑖𝑠ℎ𝑒𝑟)= 0.00034 × 0.215 / 0.00083 = 0.088 P(덴마크 ∣ 피셔)=0.00034×0.215/0.00083=0.088
(소수점 세 자리에서 반올림) 또는 약 8.8% 8.8%. 위의 베이즈 규칙 없이 결과를 계산했기 때문에 이미 결과를 알고 있다는 점을 기억하세요. (자세한 내용을 자세히 살펴보신 분이라면 실제로 결과가 나온 것을 눈치채셨을 것입니다. 8.7% 8.7% 더 일찍. 이는 반올림 오류로 인해 발생합니다. 덴마크의 어부 비율에 대해 더 정확한 값을 사용했다면 0.00034 0.00034라면 같은 결과를 얻었을 것입니다. 8.7% 8.7%, 여기도 마찬가지다. 이는 특히 작은 숫자의 경우 충분한 수의 자릿수를 사용하는 것이 중요함을 보여줍니다. 컴퓨터를 사용하면 실제로 숫자를 적을 필요가 없기 때문에 높은 정밀도를 유지하는 것이 훨씬 쉽습니다. 단, 부동 소수점 반올림 오류도 문제가 되는 경우가 있습니다.)
좋은 소식은 우리가 올바른 결과를 얻었다는 것입니다. 하지만 동일한 결과에 도달하는 직접적인 방법이 있는데 왜 도대체 베이즈 규칙을 사용하는 수고를 겪었는지 궁금하실 것입니다. 대답은 나중에 다른 경우에 사용할 수 있도록 베이즈 규칙의 사용을 설명하고 싶었다는 것입니다. 베이즈 규칙의 우변에 있는 세 항은 알고 있지만 직접 계산에 필요한 항은 모르는 경우가 많습니다. 이와 같은 일반적인 사례에는 의학적 진단(예: AI 소개의 유방암 검진 예시 참조)과 원인(의학적 상태)을 고려하여 효과(테스트 결과)의 확률을 알지만 그 반대는 알 수 없는 기타 시나리오가 포함됩니다.
Instagram, Twitter 또는 기타 플랫폼에 소셜 미디어 계정이 있다고 가정해 보겠습니다. 그렇지 않은 경우에는 문제가 되지 않습니다. 관련 정보를 제공해 드리겠습니다. 여러분의 계정을 확인하고 새로운 팔로어가 있다는 것을 알았습니다. 이는 다른 사용자가 여러분이 게시한 내용을 보기 위해 여러분을 팔로우하기로 결정했음을 의미합니다. 여러분은 그 사람을 알지 못하며, 그 사람의 사용자 이름(또는 "핸들"이라고 함)이 약간 이상합니다: John37330190. 여러분은 소름 끼치는 봇이 여러분을 따라다니는 것을 원하지 않기 때문에 그들을 차단할지 고민합니다. 새로운 팔로어를 차단할지 여부를 결정하기 위해 베이즈 규칙을 사용하기로 결정했습니다!
새로운 팔로어 중 5%가 봇이라고 가정해 보겠습니다. 이는 다음과 같이 작성할 수 있습니다.
P(봇) = 0.05.
또한 봇 계정의 80%가 8자리 숫자(예: 37330190)를 포함하는 사용자 이름을 가지고 있다고 가정해 보겠습니다.
P(8자리 | 봇) = 0.8
필요한 마지막 항은 새로운 팔로어(봇이든 아니든)의 사용자 이름에 8자리 숫자가 있을 확률입니다. 다음과 같이 가정합니다.
P(8자리) = 0.041.
베이즈 규칙 P(A | B) = P(B | A)P(A)/P(B)를 사용하여 새로운 팔로어가 봇일 확률 P(bot | 8자리)를 계산합니다. 필요한 세 가지 용어의 값은 위에 나와 있습니다. 정답을 선택하세요(소수점 한 자리로 반올림):
다음 섹션에서는 스팸 필터의 전형적인 예를 사용하여 문서 분류라는 베이즈 규칙의 또 다른 사용 사례를 보여드리겠습니다.
LESSON COMPLETE
