PART 1 · TRACK 4 · LESSON 2
최근접 이웃 분류기
최근접 이웃 분류기는 가능한 가장 간단한 분류기 중 하나입니다. 분류할 항목이 주어지면 새 항목과 가장 유사한 훈련 데이터 항목을 찾아 해당 레이블을 출력합니다. 다음 다이어그램에 예가 나와 있습니다.
LESSON FOCUS
이 소단원의 핵심 내용
최근접 이웃 분류기는 가능한 가장 간단한 분류기 중 하나입니다. 분류할 항목이 주어지면 새 항목과 가장 유사한 훈련 데이터 항목을 찾아 해당 레이블을 출력합니다. 다음 다이어그램에 예가 나와 있습니다.
- 가장 가까운 것은 무엇을 의미합니까?
- "가장 가까운" 정의
- 가장 가까운 이웃을 사용하여 사용자 행동 예측
최근접 이웃 분류기는 가능한 가장 간단한 분류기 중 하나입니다. 분류할 항목이 주어지면 새 항목과 가장 유사한 훈련 데이터 항목을 찾아 해당 레이블을 출력합니다. 다음 다이어그램에 예가 나와 있습니다.
위 다이어그램에서는 훈련 데이터 항목 모음을 보여 주며, 그 중 일부는 한 클래스(녹색)에 속하고 다른 클래스(파란색)에 속합니다. 또한, 가장 가까운 이웃 방법을 사용하여 분류할 테스트 데이터 항목인 별이 두 개 있습니다.
두 테스트 항목은 가장 가까운 이웃이 모두 녹색이기 때문에 둘 다 "녹색" 클래스로 분류됩니다(위 다이어그램 (b) 참조).
플롯에서 점의 위치는 어떤 방식으로든 항목의 속성을 나타냅니다. 평평한 2차원 표면에 다이어그램을 그리므로 두 가지 독립적인 방향(위-아래 또는 왼쪽-오른쪽)으로 이동할 수 있으므로 항목에는 비교에 사용할 수 있는 두 가지 속성이 있습니다. 예를 들어 병원에서 환자의 나이와 혈당 수준을 대표한다고 상상해 보세요. 그러나 위의 다이어그램은 클래스 값을 유사성 또는 근접성(근접성)과 연관시키는 일반적인 아이디어를 설명하기 위한 시각적 도구로 받아들여야 합니다. 일반적인 아이디어는 결코 2차원으로 제한되지 않으며 최근접 이웃 분류기는 2차원보다 더 많은 속성을 특징으로 하는 항목에 쉽게 적용될 수 있습니다.
가장 가까운 것은 무엇을 의미합니까?
최근접 이웃 분류기와 관련된 흥미로운 질문은 인스턴스 간의 거리 또는 유사성의 정의입니다. 위의 그림에서 우리는 기술적으로 유클리드 거리(Euclidean distance)라고 불리는 표준 기하학적 거리가 사용된다고 암묵적으로 가정했습니다. 이는 단순히 점이 종이에 그려지는 경우(또는 화면에 표시되는 경우) 실 조각을 한 쪽에서 다른 쪽으로 똑바로 당기고 길이를 측정하여 두 항목 사이의 거리를 측정할 수 있음을 의미합니다.
MNIST 숫자 인식의 경우 이미지 유사성을 측정하는 일반적인 방법 중 하나는 픽셀 단위로 일치하는 항목을 계산하는 것입니다. 즉, 각 이미지의 왼쪽 상단에 있는 픽셀을 서로 비교하여 색상(회색 음영)이 유사할수록 두 이미지가 더 유사한 것입니다. 또한 각 이미지의 오른쪽 하단에 있는 픽셀과 그 사이의 모든 픽셀을 비교합니다. 이 기술은 이미지 이동 또는 크기 조정에 매우 민감합니다. "1"의 이미지를 가져와 왼쪽이나 오른쪽으로 약간 이동하면 검은색 픽셀이 두 이미지에서 서로 다른 위치에 있기 때문에 결과적으로 두 이미지(이동 전후)가 매우 달라집니다. 다행히 MNIST 데이터는 이미지를 중앙에 배치하여 전처리되어 이 문제가 완화되었습니다.
가장 가까운 이웃을 사용하여 사용자 행동 예측
최근접 이웃 방법을 적용한 대표적인 예는 추천 시스템과 같은 AI 응용 분야에서 사용자 행동을 예측하는 것입니다.
아이디어는 유사한 과거 행동을 가진 사용자가 유사한 미래 행동을 하는 경향이 있다는 매우 간단한 원리를 사용하는 것입니다. 사용자의 청취 행동에 대한 데이터를 수집하는 음악 추천 시스템을 상상해 보세요. 여러분이 (논쟁을 위해) 1980년대 디스코 음악을 들었다고 가정해 봅시다. 어느 날, 서비스 제공업체는 찾기 힘든 1980년 디스코 클래식을 입수하여 음악 라이브러리에 추가했습니다. 이제 시스템은 사용자가 좋아할지 여부를 예측해야 합니다. 이를 수행하는 한 가지 방법은 서비스 제공자의 좋은 사람들이 입력한 장르, 아티스트 및 기타 메타데이터에 대한 정보를 사용하는 것입니다. 그러나 이 정보는 상대적으로 부족하고 조잡하며 대략적인 예측만 제공할 수 있습니다.
현재 추천 시스템이 수동으로 입력한 메타데이터 대신 사용하는 것이 협업 필터링입니다. 협업 측면은 다른 사용자의 데이터를 사용하여 선호도를 예측한다는 것입니다. "필터"라는 단어는 필터를 통과한 추천 콘텐츠만 추천된다는 사실을 의미합니다. 좋아할 것 같은 콘텐츠는 통과되고 다른 콘텐츠는 통과되지 않습니다(이런 종류의 필터는 1장에서 언급한 소위 필터 버블로 이어질 수 있습니다. 이에 대해서는 나중에 다시 설명하겠습니다).
이제 80년대 디스코 음악을 들어본 다른 사용자들이 새 릴리스를 즐기고 계속해서 듣고 있다고 가정해 보겠습니다. 시스템은 여러분와 다른 80년대 디스코 광신자들이 공유하는 유사한 과거 행동을 식별하고, 여러분와 같은 다른 사용자가 새 릴리스를 즐기기 때문에 시스템은 여러분도 그렇게 할 것이라고 예측합니다. 따라서 추천 목록 상단에 표시됩니다. 대체 현실에서는 추가된 노래가 그다지 좋지 않고 여러분와 유사한 과거 행동을 가진 다른 사용자가 별로 좋아하지 않을 수도 있습니다. 이 경우 시스템은 사용자에게 추천하지 않거나 적어도 권장 사항 목록의 상단에 표시되지 않습니다.
다음 연습에서는 이 아이디어를 보여줍니다.
위의 예에서는 사용자 데이터가 6명뿐이어서 우리의 예측은 아마도 매우 신뢰할 수 없었을 것입니다. 그러나 온라인 쇼핑 사이트에는 수백만 명의 사용자가 있는 경우가 많으며, 이들이 생성하는 데이터의 양은 엄청납니다. 많은 경우 과거 행동이 여러분와 매우 유사하고 구매 내역을 통해 여러분의 관심사를 꽤 잘 나타내는 수많은 사용자가 있습니다.
이러한 예측은 시스템에서 추천하는 제품을 구매할 가능성이 더 높다는 점에서 자기실현적 예언일 수도 있으며, 이로 인해 해당 제품이 실제로 얼마나 잘 작동하는지 평가하기가 까다로워집니다. 동일한 종류의 추천 시스템이 음악, 영화, 뉴스, 소셜 미디어 콘텐츠를 사용자에게 추천하는 데에도 사용됩니다. 뉴스와 소셜 미디어의 맥락에서 이러한 시스템에 의해 생성된 필터는 필터 버블로 이어질 수 있습니다.
LESSON COMPLETE



