본문으로 건너뛰기
AI SCHOOL
전체 진도0/34 레슨

PART 2 · TRACK 4 · LESSON 3

딥러닝

지금까지 우리는 상대적으로 단순한 모델을 확실히 이해하고 유용한 것이 나올 때까지 더미를 계속 뒤섞는 일종의 "데이터 연금술사"가 되는 것을 피하기 위해 의도적으로 비교적 간단한 모델을 논의했습니다.

예상 학습 시간 60연습문제 0

이 소단원의 핵심 내용

지금까지 우리는 상대적으로 단순한 모델을 확실히 이해하고 유용한 것이 나올 때까지 더미를 계속 뒤섞는 일종의 "데이터 연금술사"가 되는 것을 피하기 위해 의도적으로 비교적 간단한 모델을 논의했습니다.

  • 딥러닝
  • CNN(컨벌루션 신경망)
  • 한번 시도해 보자: 고양이 귀
신경망 만들기 핵심 개념

III. 딥러닝

지금까지 우리는 상대적으로 단순한 모델을 확실히 이해하고 유용한 것이 나올 때까지 더미를 계속 뒤섞는 일종의 "데이터 연금술사"가 되는 것을 피하기 위해 의도적으로 비교적 간단한 모델을 논의했습니다.

이제 우리는 기본 사항에 익숙해졌으므로 대부분의 기술적 세부 사항을 훑어보아야 하더라도 현재의 최첨단 기술을 빠르게 익힐 수 있습니다. 혁명적이라는 단어는 너무 많이 사용되는 경향이 있고 Bulls**t와 연관되는 경향이 있지만 사용하기 쉬운 딥 러닝 도구 및 플랫폼을 통해 데이터 과학이 혁명을 일으켰다고 말하는 것이 타당하다고 생각합니다. Google의 Tensorflow, Facebook의 PyTorch, fast.ai와 같은 플랫폼을 사용하면 끈기가 있는 사람이라면 누구나 몇 달 동안 실무 요령을 배워 실제 문제에 대한 놀라운 AI ​​솔루션을 구축할 수 있습니다.

지난 10년 동안 특히 자연어 처리 및 이미지 처리 분야에서 a-m-a-z-i-n-g(기술 용어를 사용하면)의 진전이 있었습니다. 자연어 처리에서는 기계 번역, 텍스트 요약, 질문 답변 등의 문제가 데이터가 숫자나 기호인 영역에 비해 정말 뒤떨어져 있었습니다. 사람들이 딥 러닝 기술을 실험하기 시작할 때까지 이미지 인식 및 다양한 이미지 향상 작업의 진행이 고통스러울 정도로 느린 이미지 처리에 대해서도 마찬가지입니다.

특정 분야에서 비약적인 도약을 가능하게 한 몇 가지 추가적인 혁신이 있습니다. 여기서는 그 중 몇 가지를 소개하겠습니다.

CNN(컨벌루션 신경망)

무섭게 들리는 이름에는 꽤 단순한 전반적인 아이디어가 숨겨져 있습니다. 위에서 논의한 것처럼 대규모 신경망의 단점 중 하나는 많은 수의 매개변수에 많은 데이터와 많은 계산이 필요하다는 사실입니다. 이미지에는 많은 픽셀이 포함되어 있고 악마는 종종 세부 사항에 있기 때문에 이미지를 처리할 때 소규모 네트워크에 대처할 수 있는 방법이 많지 않습니다. 픽셀 수준의 데이터를 직접 처리하는 네트워크의 첫 번째 레이어에는 최소한 픽셀 수만큼의 매개변수가 있어야 합니다. 그렇지 않으면 일부 픽셀은 아무 것에도 연결되지 않아 무시됩니다.

CNN의 핵심 통찰력은 입력 이미지의 픽셀과 관련된 매개변수가 수백만 개라도 반드시 서로 다른 매개변수가 수백만 개일 필요는 없다는 사실을 깨닫는 것입니다. CNN은 원본 이미지보다 훨씬 작은 직사각형 이미지 패치인 소위 필터 모음 또는 "뱅크"로 구성됩니다. 이러한 필터는 컨볼루션의 수학적 연산에 해당하는 프로세스에서 이미지의 여러 위치에 일치하므로 이름이 CNN입니다.

신경망 아키텍처 측면에서 각 필터는 직사각형 패치 내부의 픽셀 값을 곱하는 데 사용되는 매개변수 세트에 해당합니다. 동일한 매개변수 세트는 서로 다른 패치 내에서 입력을 처리하는 서로 다른 뉴런에서 공유됩니다. 네트워크는 여러 컨볼루셔널 레이어를 포함할 수 있습니다. 첫 번째 레이어의 패치에는 원본 이미지의 픽셀이 포함되고, 추가 레이어의 패치에는 입력 이미지와 마찬가지로 직사각형 형태로 구조화된 이전 레이어의 출력이 포함됩니다.

한번 시도해 보자: 고양이 귀

작은 예를 통해 CNN이 어떻게 작동하는지 살펴보겠습니다. 필터 매개변수를 -1, 0 또는 +1로 설정하여 조정할 수 있는 간단한 예시을 만들었습니다. 예시은 자동으로 왼쪽 고양이 이미지에 필터를 적용합니다. 결과 활성화 값은 오른쪽 패널에 표시됩니다.

계속해서 필터 매개변수를 변경해 보세요. 하단의 선택기에서 값을 선택하고 가운데 패널의 필터에서 픽셀을 클릭합니다. 아마도 먼저 출력 패널에 복제된 고양이 패턴을 얻게 될 것입니다. 값 -1을 선택한 경우에는 무효화됩니다. 필터에 음수 값과 양수 값이 모두 포함되어 -1과 +1이 모두 포함되면 더 흥미로운 일이 발생하기 시작합니다.

이것은 실제 연습은 아니지만 이미지에서 귀를 감지하도록 필터를 조정해 보십시오. 즉, 출력 이미지에서 고양이 귀 주변에 흰색 점이 생기도록 하십시오.

-1
0
1

케이스

유니세프 학교 매핑

여러분의 나라에는 몇 개의 학교가 있고 어디에 위치해 있나요? 전 세계 많은 곳에서 대답은 “확실하지 않다”입니다. 학교는 원격 위치에 있고 인터넷이나 전화선에 연결되어 있지 않을 수 있습니다. 즉, 모든 학교를 찾으려면 값비싼 지상 매핑이 필요합니다.

정확하고 포괄적인 학교 지도를 갖는 것은 학습의 질을 측정하고 향상시키는 핵심 도구입니다. 이러한 지도는 디지털 연결 이니셔티브와 결합되어 정보에 대한 접근성을 향상시킬 뿐만 아니라 정부와 국제기구가 질병 발생이나 자연재해와 같은 충격에 더 잘 대비하고 대응할 수 있도록 돕습니다.

각 나라의 정확한 학교 지도 제작을 돕기 위해 UNICEF와 Development Seed는 AI 방식을 활용하기로 결정했습니다. 고해상도 위성 이미지를 사용하여 학교 건물을 식별할 수 있는 특징을 식별하도록 신경망을 훈련했습니다.

문제
전 세계 많은 국가에서 학교 위치에 대한 기록이 부정확하거나 불완전하거나 존재하지 않습니다.

해결책
UNICEF와 Development Seed는 딥 머신 러닝 기술과 훈련된 인간 매퍼를 결합하여 고해상도 이미지와 저렴한 클라우드 컴퓨팅을 결합하여 전국 규모의 포괄적인 학교 지도를 만들고 있습니다.

사용된 AI 기법
기존 Columbia 학교 지도의 훈련 데이터를 사용하여 CNN(컨볼루션 신경망)을 기반으로 한 학교 분류기의 알고리즘을 조정했습니다. CNN은 위성 이미지를 사용할 수 있도록 Xception 및 MobileNetV2 기반의 기존 도구를 수정하여 만들어졌습니다.

그들은 거의 200번의 훈련 반복에서 가장 성능이 좋은 모델을 선택하고 이를 콜롬비아와 카리브해 동부 섬에 적용하여 잠재적으로 매핑되지 않은 학교를 탐지했습니다. 이렇게 넓은 고해상도 이미지 영역에 모델을 실행하는 것은 엄청난 작업입니다. 5,200만 개가 넘는 이미지를 처리해야 했습니다. Development Seed는 대용량 위성 이미지 추론 작업을 관리하기 위해 오픈 소스 도구인 Chip-n-scale-queue-arranger를 만들었습니다.

과정
해당 국가의 알려진 학교에 대한 고품질 지도 만들기
훈련 데이터 세트 생성
학교 분류기를 생성하고 조정합니다.
다른 국가에서 모델을 실행하여 매핑되지 않은 후보 학교 식별
현장에 있는 사람들과 함께 이러한 예측을 검증하세요.

순환 신경망(RNN) 및 변환기

변환기라는 단어는 특정 신경망 아키텍처를 의미하기도 합니다.

순환 신경망(RNN)은 데이터가 입력에서 여러 숨겨진 레이어를 거쳐 출력으로 선형 진행으로 처리되지 않는 아키텍처 클래스입니다. 대신, 일부 레이어는 이전 레이어와 거꾸로 연결되어 일부 뉴런이 출력이 생성되기 전에 데이터를 여러 번 처리하는 피드백 루프를 형성합니다. RNN은 이전 섹션에서 논의한 것과 같은 단순한 피드포워드 네트워크보다 데이터에서 훈련하기가 더 복잡하고 일반적으로 훨씬 더 어렵습니다.

RNN의 가장 큰 장점은 현재 입력을 넘어서도 데이터에서 발생한 일을 네트워크가 "기억"하는 메커니즘을 가능하게 한다는 사실입니다. 텍스트를 모델링할 때 이전에 말한 내용을 기억하는 모델이 가능합니다. 예를 들어, 텍스트가 "Soile에는 새 강아지가 있습니다. 그녀가 오늘 나에게 사진을 보여주었습니다."로 시작하는 경우, 모델은 텍스트 전체가 하나의 입력 시퀀스로 처리되지 않더라도 단어 "She"를 "Soile"로 연결하고 단어 "it"를 "new puppy"로 연결할 수 있습니다. 이는 기계 번역 및 텍스트 생성에 유용합니다. 텍스트가 "그것은..."으로 계속된다면 "사랑스럽다" 또는 "정말 귀여워!!!!!"가 될 가능성이 높습니다. (네트워크가 BBC 뉴스 보도 또는 내부 Slack 채널 콘텐츠에 대해 훈련되었는지 여부에 따라) "puppy"라는 단어 대신 "chainsaw" 또는 "Harley Davidson"이라는 단어가 있었다면 동일한 연속이 거의 불가능합니다.

변환기 아키텍처는 순환 신경망의 사용을 피하면서도 단어 간의 장거리 종속성을 식별할 수 있는 기술입니다. 이 기술은 텍스트의 연속성을 예측하는 데 사용되는 가장 관련성이 높은 단어를 식별하는 소위 주의 메커니즘을 기반으로 합니다. 동일한 아키텍처를 기계 번역에도 사용할 수 있습니다. Transformer 네트워크는 RNN보다 계산이 덜 필요하기 때문에 현재 텍스트 모델링에 가장 널리 사용되는 접근 방식입니다. 이는 현재 대부분의 자연어 처리 작업에서 최첨단 솔루션입니다.

트랜스포머 네트워크의 가장 유명한 사례는 2019년 Open. AI 연구진이 만든 GPT-2(Generative Pretrained Transformer 2) 네트워크입니다. 개발자가 첫 번째 단계에서 무려 15억 개의 매개변수를 포함하는 본격적인 모델 대신 "단지" 3억 4,500만 개의 매개변수를 포함하는 소형 버전만 출시할 것이라고 발표했을 때 AI 군중 사이에서 엄청난 폭풍을 일으켰습니다. 그들의 설명은 본격적인 모델의 출시는 너무 위험할 것이며 사회는 대규모 언어 모델에 대해 "준비가 되어 있지 않을 것"이라는 것이었습니다. 악성 콘텐츠의 대량 생산을 위해 고급 텍스트 생성 방법을 사용할 가능성은 우려할 만한 이유를 제공합니다. Open. AI 팀 인용:

"우리는 또한 다음(또는 아직 예상할 수 없는 다른 응용 프로그램)을 포함하여 악의적인 목적으로 이러한 모델을 적용하는 것을 상상할 수 있습니다.
오해의 소지가 있는 뉴스 기사 생성
온라인에서 다른 사람을 사칭
소셜 미디어에 게시할 악의적이거나 위조된 콘텐츠 생성을 자동화합니다.
스팸/피싱 콘텐츠 생산 자동화
이러한 발견은 합성 이미지, 오디오 및 비디오에 대한 이전 결과와 결합되어 기술이 가짜 콘텐츠 생성 및 허위 정보 캠페인 수행 비용을 줄이고 있음을 의미합니다. "딥 페이크" 현상이 이미지에 대해 더 회의적인 시각을 불러일으키는 것처럼, 대중은 온라인에서 찾은 텍스트에 대해 더 회의적인 입장을 취해야 할 것입니다."

출처: https://openai.com/blog/better-언어-models/

Open. AI 팀은 결국 15억 개의 매개변수 모델 전체를 대중에게 공개했으며 그 이후로 1,750억 개의 매개변수를 갖춘 훨씬 더 큰 모델인 GPT-3를 개발했습니다. Open. AI 팀이 구상한 위험이 사실로 드러날지는 아직 알 수 없습니다.

이 레슨을 모두 읽었나요?