본문으로 건너뛰기
AI SCHOOL
전체 진도0/34 레슨

PART 1 · TRACK 5 · LESSON 3

고급 신경망 기술

이전 섹션에서는 다층 네트워크, 비선형 활성화 함수, 역전파 알고리즘과 같은 학습 규칙 등 대부분의 신경망 방법 뒤에 있는 기본 아이디어를 논의했습니다.

예상 학습 시간 45연습문제 0

이 소단원의 핵심 내용

이전 섹션에서는 다층 네트워크, 비선형 활성화 함수, 역전파 알고리즘과 같은 학습 규칙 등 대부분의 신경망 방법 뒤에 있는 기본 아이디어를 논의했습니다.

  • CNN(컨벌루션 신경망)
  • CNN이 필요한 이유
  • 신경망은 전기양을 꿈꾸는가? 생성적 적대 네트워크(GAN)
신경망 핵심 개념

이전 섹션에서는 다층 네트워크, 비선형 활성화 함수, 역전파 알고리즘과 같은 학습 규칙 등 대부분의 신경망 방법 뒤에 있는 기본 아이디어를 논의했습니다.

거의 모든 최신 신경망 애플리케이션을 지원합니다. 그러나 여러 분야에서 딥 러닝의 큰 발전을 가져온 흥미롭고 강력한 테마 변형이 있습니다.

CNN(컨벌루션 신경망)

딥러닝이 눈부신 성공을 거둔 분야 중 하나는 이미지 처리입니다. 이전 섹션에서 자세히 연구한 간단한 분류기는 매우 제한적입니다. 모든 웃는 얼굴을 올바르게 분류하는 것조차 불가능하다는 것을 알 수 있듯이 말입니다. 네트워크에 더 많은 레이어를 추가하고 역전파를 사용하여 가중치를 학습하면 원칙적으로 문제가 해결되지만 또 다른 문제가 발생합니다. 즉, 가중치 수가 극도로 커지고 결과적으로 만족스러운 정확도를 달성하는 데 필요한 훈련 데이터의 양이 너무 커져 현실적이지 못할 수 있습니다.

다행스럽게도 너무 많은 가중치 문제에 대한 매우 명쾌한 해결책이 존재합니다. 특별한 종류의 신경망, 또는 오히려 심층 신경망에 포함될 수 있는 특별한 종류의 레이어가 있습니다. 이 특별한 종류의 레이어는 소위 컨벌루션 레이어입니다. 컨볼루셔널 레이어를 포함하는 네트워크를 CNN(컨볼루션 신경망)이라고 합니다. 핵심 속성은 밝거나 어두운(또는 특정 색상) 반점, 다양한 방향의 가장자리, 패턴 등과 같은 이미지 특징을 감지할 수 있다는 것입니다. 이는 고양이 귀, 개의 주둥이, 사람의 눈, 정지 신호의 팔각형 모양과 같은 보다 추상적인 특징을 감지하기 위한 기초를 형성합니다. 일반적으로 입력 이미지의 픽셀을 기반으로 이러한 특징을 감지하도록 신경망을 훈련시키는 것은 어렵습니다. 특징은 이미지에서 서로 다른 위치, 방향 및 크기로 나타날 수 있기 때문입니다. 객체 자체가 우리에게 동일하게 보이더라도 객체나 카메라 각도를 움직이면 픽셀 값이 극적으로 변경됩니다. 이러한 다양한 조건에서 정지 신호를 감지하는 방법을 학습하려면 방대한 양의 훈련 데이터가 필요합니다. 왜냐하면 네트워크는 훈련 데이터에 표시된 로그인 조건만 감지하기 때문입니다. 예를 들어 이미지의 오른쪽 상단에 있는 정지 신호는 학습 데이터에 오른쪽 상단에 정지 신호가 있는 이미지가 포함된 경우에만 감지됩니다. CNN은 훈련 이미지에서 객체가 관찰된 위치에 상관없이 이미지의 어느 위치에서나 객체를 인식할 수 있습니다.

컨벌루션 뉴런은 일반적으로 원시 입력 픽셀을 처리하는 네트워크의 최하위 레이어에 배치됩니다. 위에서 설명한 퍼셉트론 뉴런과 같은 기본 뉴런은 상위 계층에 배치되어 하위 계층의 출력을 처리합니다. 맨 아래 레이어는 일반적으로 특별한 예측 작업을 염두에 두지 않고 비지도 학습을 사용하여 훈련할 수 있습니다. 가중치는 입력 데이터에 자주 나타나는 특징을 감지하도록 조정됩니다. 따라서 동물 사진의 경우 일반적인 특징은 귀와 주둥이인 반면, 건물 이미지의 경우 특징은 벽, 지붕, 창문 등과 같은 건축 구성 요소입니다. 다양한 개체와 장면을 혼합하여 입력 데이터로 사용하는 경우 하위 레이어에서 학습된 기능은 다소 일반적입니다. 이는 사전 훈련된 컨벌루션 레이어를 다양한 이미지 처리 작업에서 재사용할 수 있음을 의미합니다. 이는 하위 레이어를 훈련하는 데 사용할 수 있는 레이블이 없는 훈련 데이터(레이블이 없는 이미지)를 거의 무제한으로 쉽게 얻을 수 있기 때문에 매우 중요합니다. 최상위 레이어는 항상 역전파와 같은 지도 머신러닝 기술을 통해 훈련됩니다.

Gan 핵심 개념

신경망은 전기양을 꿈꾸는가? 생성적 적대 네트워크(GAN)

데이터에 대한 신경망을 훈련한 후 이를 예측에 사용할 수 있습니다. 네트워크의 최상위 계층은 특정 분류 또는 예측 작업을 수행하기 위해 지도 방식으로 훈련되었기 때문에 최상위 계층은 실제로 해당 작업에만 유용합니다. 정지 신호를 감지하도록 훈련된 네트워크는 손으로 쓴 숫자나 고양이를 감지하는 데 쓸모가 없습니다.

사전 훈련된 하위 레이어를 가져와서 학습한 기능이 어떤 모습인지 연구하면 흥미로운 결과를 얻을 수 있습니다. 이는 하위 레이어의 특정 뉴런 세트를 활성화하는 이미지를 생성함으로써 달성될 수 있습니다. 생성된 이미지를 보면 신경망이 특정 특징을 "생각"하는 모습, 또는 선택된 특징 세트가 포함된 이미지가 어떤 모습인지 알 수 있습니다. 일부는 네트워크의 "꿈꾸는" 또는 "환각적인" 이미지에 대해 이야기하기를 좋아합니다(Google의 DeepDream 시스템 참조).

실제로 실제처럼 보이는 고양이, 사람 얼굴 또는 기타 개체(훈련 데이터로 사용한 모든 것을 얻을 수 있음)를 생성하기 위해 당시 Google Brain의 연구원이었던 Ian Goodfellow는 두 신경망의 영리한 조합을 제안했습니다. 아이디어는 두 네트워크가 서로 경쟁하도록 하는 것입니다. 네트워크 중 하나는 훈련 데이터에 있는 것과 같은 이미지를 생성하도록 훈련되었습니다. 이를 생성 네트워크라고 합니다. 다른 네트워크의 작업은 첫 번째 네트워크에서 생성된 이미지를 훈련 데이터의 실제 이미지와 분리하는 것입니다. 이를 적대적 네트워크라고 합니다. 이 두 가지가 결합되어 생성적 적대 네트워크(GAN)를 구성합니다.

시스템은 두 모델을 나란히 학습합니다. 훈련 초기에 적대적 모델은 훈련 데이터의 실제 이미지와 생성 모델의 서투른 시도를 구별하는 쉬운 작업을 수행합니다. 그러나 생성 네트워크가 점점 더 좋아짐에 따라 적대적 모델도 개선되어야 하며, 결국 생성된 이미지가 실제 이미지와 거의 구별할 수 없을 때까지 주기가 계속됩니다. GAN은 훈련 데이터의 이미지를 재현하려고 시도할 뿐만 아니라, 이는 적대적 네트워크를 이기기에는 너무 간단한 전략입니다. 오히려 시스템은 새롭고 실제처럼 보이는 이미지도 생성할 수 있도록 훈련됩니다.

위 이미지는 Jaakko Lehtinen 교수가 주도한 프로젝트에서 NVIDIA가 개발한 GAN에 의해 생성되었습니다(자세한 내용은 이 기사 참조).

여러분은 그것들이 가짜임을 인식할 수 있었습니까?

대규모 언어 모델(LLM)의 부상

위에서 언급했듯이 CNN(컨벌루션 신경망)은 신경망에서 학습 가능한 가중치의 수를 줄여 더 큰 네트워크를 계속 구축하더라도 모든 가중치를 학습하는 데 필요한 훈련 데이터의 양이 천문학적으로 커지지 않도록 합니다. CNN 아이디어 외에 현재 많은 최첨단 딥러닝 모델을 지원하는 또 다른 아키텍처 혁신은 어텐션(Attention)입니다.

어텐션 메커니즘은 원래 출력에서 특정 단어를 생성할 때 입력 텍스트의 특정 단어에 모델의 주의를 선택적으로 집중할 수 있는 기계 번역을 위해 도입되었습니다. 이렇게 하면 모델이 동시에 모든 입력에 주의를 기울일 필요가 없으므로 학습 작업이 크게 단순화됩니다. 어텐션 메커니즘은 기계 번역뿐만 아니라 매우 유용한 것으로 곧 밝혀졌습니다.

2017년 Google에서 일하는 팀은 심층 신경망을 위한 소위 변환기 아키텍처를 소개하는 블록버스터 기사 "Attention is All You Need"를 발표했습니다. 무인도에 살고 있거나 엄격한 미디어 다이어트를 하지 않는 한, 트랜스포머(장난감 프랜차이즈가 아닌 신경망 모델)에 대해 이미 들어보셨을 것입니다. 단지 GPT(Generative Pretrained Transformer)라는 약어 안에 숨어 있었을 수도 있습니다. Google 팀의 기사 제목에서 알 수 있듯이 변환기는 사용 가능한 훈련 데이터와 계산 리소스를 최대한 활용하기 위해 주의 메커니즘을 크게 활용합니다.

가장 널리 알려진 변환기 응용 프로그램은 LLM(대형 언어 모델)에서 찾을 수 있습니다. 가장 잘 알려진 것은 2018년 6월에 출시된 GPT-1과 2023년 3월에 발표된 GPT-4를 포함한 OpenAI의 GPT 시리즈이지만, 거대 플랫폼 회사 중 어느 누구도 이를 놓치고 싶어하지 않습니다. Google은 Sesame street에서 모델 이름을 선택하고 2018년 10월에 BERT(Bidirection Encoder Representations from Transformers)를 게시했으며, Meta는 조금 늦게 2023년 2월에 파티에 합류하여 동물 세계에서 영감을 받은 이름인 LLaMA를 선택했습니다. (대형 언어 모델 Meta AI). 그리고 개발을 주도하는 것은 플랫폼 회사만이 아닙니다. 대학과 기타 연구 기관은 기술 민주화를 목표로 오픈 소스 모델을 제공하고 있습니다.

원칙적으로 LLM은 기본적으로 매우 강력한 예측 텍스트 입력 기술로 볼 수 있습니다. 그러나 좀 더 생각해 보면 인간의 글쓰기와 구별할 수 없는 방식으로 텍스트의 연속성을 예측할 수 있다는 것은 상당한 위업이며 지능의 여러 측면을 포함한다는 것이 분명해집니다. "핀란드의 수도"와 "헬싱키"라는 단어 사이의 연관을 기반으로 한 위의 예는 모델이 세계에 대한 사실을 학습한 예입니다. 광범위한 질문에 대해 일반적으로 합의된 답변을 연관시키는 모델을 구축할 수 있다면 그러한 모델이 소위 "세계 지식"이라는 큰 덩어리를 학습했다고 주장할 수 있습니다. 특히 흥미로운 점은 모델이 암기 및 통계적 동시 발생을 넘어서는 일정 수준의 추론을 보여주는 것처럼 보이는 경우입니다. 현재 LLM은 제한된 의미에서 이를 수행할 수 있으며 "그냥" 통계적 기계 학습을 기반으로 하기 때문에 사소한 실수를 쉽게 할 수 있습니다. 보다 강력한 추론 알고리즘과 검증된 사실의 데이터베이스를 갖춘 딥 러닝 모델을 구축하는 데 집중적인 연구 개발 노력이 집중되고 있습니다.

지금까지 AI에 많은 관심을 기울이지 않았던 사람들조차도 거의 모든 사람이 ChatGPT에 대해 엄청난 미디어 열광과 전례 없는 관심을 불러일으킨 이유를 말하기는 쉽지 않습니다. 아마도 그 중 일부는 미세 조정 및 사용하기 쉬운 채팅 인터페이스로 인해 출력의 품질이 다소 향상되었기 때문에 설명될 수 있습니다. 이를 통해 사용자는 이전 LLM과 같이 개별 질문에 대한 일회성 답변을 얻을 수 있을 뿐만 아니라 특정 상황에서 일관된 대화를 유지할 수 있습니다. 같은 맥락에서 채팅 인터페이스를 통해 "다섯 살짜리 아이에게 설명해주세요" 또는 "닉 케이브 스타일의 노래로 써주세요"와 같은 요청을 할 수 있습니다. (그러나 Mr Cave는 감동받지 않았습니다 [BBC]). 어쨌든 ChatGPT는 AI에 대한 관심을 완전히 새로운 수준으로 높이는 데 성공했습니다.

ChatGPT 및 기타 LLM 기반 솔루션을 위한 실제 "킬러 앱"이 무엇인지는 아직 알 수 없습니다. 우리는 가장 유력한 후보가 사실 콘텐츠가 사용자 또는 다른 시스템에서 제공되고 언어 모델이 출력을 언어(자연어 또는 프로그램 코드와 같은 형식 언어) 형식으로 지정하는 데 사용되는 것이라고 생각합니다. 마지막 장에서는 ChatGPT 및 기타 LLM 기반 애플리케이션의 예상되는 영향으로 돌아가겠습니다.

5장을 완료하면 다음을 수행할 수 있습니다.

  • 신경망이 무엇인지, 어디에 성공적으로 사용되고 있는지 설명하세요.
  • 신경망을 뒷받침하는 기술적 방법 이해

이 레슨을 모두 읽었나요?