PART 2 · TRACK 4 · LESSON 2
로지스틱 회귀에서 신경망으로
로지스틱 회귀의 선형 결합과 비선형 함수를 연결하여 신경망의 기본 구조가 만들어지는 과정을 배웁니다.
LESSON FOCUS
이 소단원의 핵심 내용
로지스틱 회귀의 선형 결합과 비선형 함수를 연결하여 신경망의 기본 구조가 만들어지는 과정을 배웁니다.
- 로지스틱 회귀에서 신경망까지
- Zen 로봇공학 폐기물 분류
- 연습 21. 신경망
II. 로지스틱 회귀에서 신경망까지
이제 우리는 로지스틱 회귀를 연구했으므로 신경망의 기본 아이디어는 실제로 아주 작은 단계에 불과합니다. 우리는 시그모이드 함수와 같은 비선형 함수와 결합된 선형 함수의 아이디어를 유지합니다. 여기에 신경망이 추가되는 것은 이러한 여러 모델을 함께 연결하여 네트워크를 얻는다는 것입니다.
신경망에 관해 이야기할 때 우리는 약간 다른 용어를 사용합니다. 계수 대신 가중치라고 합니다. 로지스틱 회귀의 경우 시그모이드 함수였던 모델의 비선형 부분을 활성화 함수라고 합니다. 그러한 모델 중 하나를 뉴런이라고 합니다. 뉴런은 한 뉴런의 출력이 다른 뉴런의 입력이 되도록 하여 서로 연결됩니다.
아래는 신경망의 다이어그램입니다. 언뜻 복잡해 보일 수도 있지만, 우리에게 이미 익숙한 부분만 담겨 있고, 지금은 우리에게 낯선 방식으로 배열되어 있다는 것을 곧 알게 될 것입니다.
입력 무작위화 입력 숨겨진 레이어 출력+5지 f(z) 지 f(z) +1지 f(z) +1-1+1 4.000 0.982 -4,000 0.018 8.766 0.683
다이어그램을 나누어 살펴보겠습니다. 이 신경망은 입력 노드 x₁, x₂, x₃, 두 개의 노드 h₁, h₂가 있는 숨겨진 레이어, 바이어스 노드, 출력 노드 o로 구성됩니다.
두 개의 노드가 있는 숨겨진 레이어인 입력 레이어를 형성합니다. h₁, h₂
바이어스 노드(나중에 자세히 설명) 및 하나의 노드가 있는 출력 레이어
𝑜
오. 입력 레이어와 히든 레이어가 연결되어 히든 레이어의 각 노드는 모델의 입력이 입력 노드에서 나오는 로지스틱 회귀 모델과 다르지 않게 동작합니다. 마찬가지로, 숨겨진 레이어의 노드는 거의 동일한 방식으로 출력 노드에 연결됩니다. 이번에는 숨겨진 레이어의 노드가 출력 노드에 입력을 제공합니다.
입력 레이어는 말 그대로 입력 데이터입니다. 하나의 노드는 입력값 하나에 대응합니다. 예를 들어 객실 가격 예측에서는 x₁이 객실 크기, x₂가 사우나 크기와 같은 방식으로 연결됩니다.
객실 크기가 되고, x₂
사우나의 크기 등등.
앞서 말했듯이 노드는 로지스틱 회귀 모델과 매우 유사하게 동작합니다. 각 노드 내에서 우리는 노드 입력의 선형 조합을 계산합니다. 출력 노드의 경우 이는 숨겨진 레이어의 노드에 의해 제공된다는 점을 상기하고 시그모이드 함수와 같은 것을 적용하여 실제 출력을 결정합니다. 위에서 언급한 바와 같이, 후반부에 적용되는 함수를 활성화함수라고 부른다. 이 용어는 뉴런이 자극을 받아 활성화될 때 다른 뉴런에 전기 펄스를 보내 통신하는 신경과학에서 직접 차용한 것입니다.
숨겨진 레이어에는 입력 노드에 연결되지 않은 바이어스 노드도 있습니다. 바이어스 노드의 목적은 기능적으로 선형 회귀의 절편 항과 동일합니다. 즉, 한 레이어에서 다른 레이어로 들어오는 입력을 일부 상수 값만큼 이동할 수 있습니다. 위의 네트워크에서는 최종 출력 레이어가 얻는 입력을 계수의 가중치에 의해 결정되는 상수 값에 따라 출력 노드로 이동합니다. 바이어스 노드는 신경망의 필수 기능은 아니지만 일반적으로 모델 성능에 도움이 됩니다.
이 모든 것의 요점은 무엇입니까? 한 걸음 물러나 신경망을 살펴보면 입력을 삽입하고 출력이 나오는 상자입니다. 입력과 출력이 있는 단순한 함수로 보면 회귀 또는 분류 모델과 동일한 목적을 제공합니다. 그리고 개별 뉴런은 로지스틱 회귀 모델보다 더 복잡하지 않은데 이것이 도대체 어떻게 유용할까요?
네트워크 내부의 뉴런이 비선형 활성화 함수를 사용하는 지점에서 마법이 일어납니다. 실제로, 항등함수와 같은 선형 활성화 함수만 사용한다면 𝑓(𝑥)=𝑥 f(x)=x이면 전체 네트워크가 단지 크고 두꺼운 선형 회귀 모델임을 알 수 있습니다. 그러나 시그모이드 함수나 정류 선형 유닛(Rectified Linear Unit)과 같은 비선형 활성화를 사용하면(전문가처럼 들리도록 ReLu라고 말하면) 모델이 갑자기 선형 모델보다 훨씬 더 강력해집니다. 실제로 네트워크에 충분한 노드가 있으면 거의 모든 데이터를 완벽하게 맞추는 방법을 배울 수 있을 정도로 강력해집니다. 이를 기술적으로 표현하는 방법은 신경망이 "보편적 기능 근사자"라고 말하는 것입니다.
뉴런이 거의 없는 비교적 단순한 모델이라도 선형 회귀, 로지스틱 회귀 또는 Naive Bayes와 같은 선형 모델에 비해 너무 많은 내용을 학습할 수 있습니다.
신경망의 성능에는 비용이 따릅니다. 더 복잡한 문제에는 더 큰 네트워크가 필요하고, 더 큰 네트워크에는 더 많은 매개변수가 포함되며, 더 많은 매개변수에는 더 많은 데이터가 필요합니다. 데이터가 너무 적은 대규모 네트워크를 맞추려고 하면 모델이 과적합되어 단순한 네트워크보다 더 나쁜 예측을 하게 됩니다. 데이터가 부족한 경우 간단한 로지스틱 회귀 모델이라도 대규모 신경망을 쉽게 이길 수 있습니다.
데이터가 충분하더라도 매개변수가 많을수록 더 많은 계산이 필요하며 어느 시점에서는 합리적인 시간 내에 피팅 프로세스를 완료하기 위한 계산 리소스가 부족해집니다. 따라서 기계 학습에도 (또는 특히) 공짜 점심은 없습니다.
훈련 데이터에 맞게 신경망의 매개변수를 최적화하는 것이 그토록 어려운 이유는 바로 우리가 2장에서 겪었던 문제입니다. 즉, 활성화 함수가 비선형일 때 최적화 "환경"도 매우 불규칙하고 최적화 프로그램이 멈출 수 있는 많은 로컬 최적을 나타냅니다. 이 문제에 대해 새롭고 더 나은 최적화 알고리즘을 고안하기 위해 상당한 양의 연구가 진행되었습니다.
케이스
Zen 로봇공학 폐기물 분류
줄이고, 재사용하고, 재활용하세요. 우리 모두는 이 원칙에 익숙하며 대부분의 사람들은 폐기물을 충실하게 분류합니다. 하지만 그 후에는 어떻게 되나요? 사실 우리가 "재활용"하는 것 중 상당수는 여전히 소각장으로 보내지거나 매립지로 보내집니다.
이는 유리, 플라스틱, 종이와 같은 품목을 재활용하려면 상대적으로 깨끗하고 일관된 유형의 재료를 사용하여 정의되는 특정 최소 수준의 순도가 필요하기 때문에 발생합니다. 그리고 이러한 순수성을 보장하는 유일한 방법은 폐기물을 분류하는 것입니다. 이는 시간이 많이 걸리고, 노동 집약적이며, 반복적이고 때로는 위험한 인간 작업입니다(또한 이를 수행할 사람을 모집하기 어렵게 만듭니다).
Zen Robotics는 인공지능(AI) 방법을 사용하여 폐기물 분류 품질을 향상시킵니다. 이들의 AI 알고리즘은 머신 비전과 머신 러닝을 기반으로 로봇이 인간처럼 평균적으로 폐기물을 분류할 수 있도록 24시간 내내 더 빠르고 안전하게 작업합니다.
사용된 AI 기법
-머신러닝
-머신 비전
LESSON COMPLETE
