현재 문서는 1차 개정본입니다. 시험 전 초기버전 · 전체 버전 아카이브
AIDE 2급 이론은 용어를 겉핥기로 외우는 시험이 아니라, 개념의 정의·원리·동작을 이해했는지를 묻습니다. 각 용어를 "무엇인가 → 왜 그런가 → 어떻게 동작하나" 순서로 이해하세요.
데이터란 무엇인가 (원론)
데이터의 정의 — 시험 1번 문제로 나올 수 있는 원론적 개념
데이터(Data)는 관찰·측정·수집을 통해 얻어진, 그 자체로는 특정한 의미나 목적이 부여되지 않은 원시적인 사실이나 값입니다. 숫자뿐 아니라 문자·이미지·음성·영상 등 다양한 형태로 존재합니다.
데이터 → 정보 → 지식 → 지혜 (DIKW 위계)
같은 데이터라도 해석 목적·맥락에 따라 다른 정보가 됩니다. 데이터는 "가공 이전의 사실", 정보는 "맥락이 더해져 의미가 생긴 결과"입니다.
- "데이터는 반드시 숫자다" → 오답. 문자·이미지·음성·영상 모두 데이터입니다.
- 데이터 = 정보가 아닙니다. 의미 부여(가공) 전/후로 구분하세요.
빅데이터 3V / 5V
빅데이터의 특성을 정의하는 V 모델. 시험에서 3V와 5V의 구성 요소를 구분해 묻는 문제가 자주 출제됩니다.
TB·PB 단위
속도가 매우 빠름
다양한 형태의 데이터
정확도 확보
유의미한 가치 창출
- 3V에 Veracity(정확성)가 포함된다고 착각 — Veracity는 5V 추가 항목
- 영어 원어 스펠링 그대로 출제됨 — Volume/Velocity/Variety/Veracity/Value 암기 필수
데이터 유형 3가지
엑셀, 관계형 DB
행·열로 표현 가능
고정되지 않은 형태
JSON, XML, HTML
이미지, 영상, 음성
SNS 텍스트
빅데이터 3V의 Variety(다양성)는 이 세 가지 데이터 유형이 혼재한다는 의미입니다.
데이터 품질 6가지 기준
과적합 (Overfitting)
제대로 학습 못 함
모델이 너무 단순
높은 성능 유지
목표 상태
지나치게 맞춰짐
새 데이터에 약함
과적합 방지 / 해결 방법
드롭아웃 동작 원리 — "어떻게 동작하나"까지 이해
훈련 데이터에만 과하게 맞춰지는 과적합을 억제하는 규제(regularization) 기법. 하나의 신경망 안에서 앙상블 효과를 내는 것으로도 해석합니다.
- 과적합 = 훈련 성능 높음 + 검증/테스트 성능 낮음
- 드롭아웃은 과적합 방지 기법 — 과소적합과 혼동 주의
- 학습 시엔 뉴런을 끄고, 추론 시엔 전부 사용 (동작 방식 구분)
활성화함수 (Activation Function)
뉴런의 출력값을 결정하는 함수. 비선형성을 부여해 딥러닝이 복잡한 패턴을 학습할 수 있게 함.
- 이진 분류 출력층에 사용
- 기울기 소실 문제 발생 가능
- 값이 0 또는 1에 가까울 때 학습 느려짐
- 은닉층에서 가장 많이 사용
- 음수 입력 → 0 출력
- 기울기 소실 문제 완화
- 다중 분류 출력층에 사용
- 각 클래스의 확률값 출력
- 가장 높은 확률 = 예측 클래스
- Sigmoid보다 출력 범위 넓음
- 음수 처리 가능
- RNN 등에서 활용
- 은닉층 기본 → ReLU / 이진분류 출력 → Sigmoid / 다중분류 출력 → Softmax
- ReLU: 음수 입력 → 0 출력 (죽은 뉴런 문제)
CNN 기본 구조 (합성곱 신경망)
이미지 인식에 특화된 딥러닝 구조. 공간적 특징을 자동으로 추출.
(픽셀 값)
특징 추출
크기 축소
1D 변환
분류 수행
(클래스)
- CNN 순서: 입력 → 합성곱 → 풀링 → 평탄화 → 완전연결 → 출력
- Max Pooling = 최댓값 추출 / Average Pooling = 평균값 추출
- CNN은 이미지 분류·객체 인식에 특화된 딥러닝 구조