AIDE 2급 · D-10

핵심 개념 이해

데이터의 정의·DIKW · 빅데이터 3V/5V · 과적합·드롭아웃 원리 · 활성화함수 · CNN

현재 문서는 1차 개정본입니다. 시험 전 초기버전 · 전체 버전 아카이브

📖 이 과정을 보는 관점

AIDE 2급 이론은 용어를 겉핥기로 외우는 시험이 아니라, 개념의 정의·원리·동작을 이해했는지를 묻습니다. 각 용어를 "무엇인가 → 왜 그런가 → 어떻게 동작하나" 순서로 이해하세요.

01

데이터란 무엇인가 (원론)

데이터의 정의 — 시험 1번 문제로 나올 수 있는 원론적 개념

데이터(Data)는 관찰·측정·수집을 통해 얻어진, 그 자체로는 특정한 의미나 목적이 부여되지 않은 원시적인 사실이나 값입니다. 숫자뿐 아니라 문자·이미지·음성·영상 등 다양한 형태로 존재합니다.

데이터 → 정보 → 지식 → 지혜 (DIKW 위계)

D
데이터 (Data)
가공되지 않은 원시적 사실·값. 예: 28, 30, 26 (숫자 그 자체)
I
정보 (Information)
데이터에 맥락·의미를 부여해 가공한 것. 예: "이번 주 평균 기온 28℃"
K
지식 (Knowledge)
정보를 경험·규칙과 결합해 체계화한 것. 예: "28℃면 반팔을 입는다"
W
지혜 (Wisdom)
지식을 상황에 맞게 적용·판단하는 통찰. 예: 날씨를 보고 옷차림을 스스로 결정
📌 데이터 vs 정보 (핵심 구분)

같은 데이터라도 해석 목적·맥락에 따라 다른 정보가 됩니다. 데이터는 "가공 이전의 사실", 정보는 "맥락이 더해져 의미가 생긴 결과"입니다.

⚠️ 원론 함정
  • "데이터는 반드시 숫자다" → 오답. 문자·이미지·음성·영상 모두 데이터입니다.
  • 데이터 = 정보가 아닙니다. 의미 부여(가공) 전/후로 구분하세요.
02

빅데이터 3V / 5V

빅데이터의 특성을 정의하는 V 모델. 시험에서 3V와 5V의 구성 요소를 구분해 묻는 문제가 자주 출제됩니다.

V
Volume (규모)
데이터의 양이 방대함
TB·PB 단위
V
Velocity (속도)
데이터 생성·처리
속도가 매우 빠름
V
Variety (다양성)
정형·반정형·비정형
다양한 형태의 데이터
V
Veracity (정확성)
데이터의 신뢰성·
정확도 확보
V
Value (가치)
데이터로부터
유의미한 가치 창출
3V — Volume · Velocity · Variety
5V — 3V + Veracity · Value
⚠️ 시험 함정
  • 3V에 Veracity(정확성)가 포함된다고 착각 — Veracity는 5V 추가 항목
  • 영어 원어 스펠링 그대로 출제됨 — Volume/Velocity/Variety/Veracity/Value 암기 필수
03

데이터 유형 3가지

정형 데이터
구조화된 형태
엑셀, 관계형 DB
행·열로 표현 가능
반정형 데이터
일정한 구조이나
고정되지 않은 형태
JSON, XML, HTML
비정형 데이터
구조화되지 않은 형태
이미지, 영상, 음성
SNS 텍스트
📌 Variety(다양성)와 연결

빅데이터 3V의 Variety(다양성)는 이 세 가지 데이터 유형이 혼재한다는 의미입니다.

04

데이터 품질 6가지 기준

정확성 (Accuracy)
데이터가 실제 현실을 정확하게 반영하는 정도
완전성 (Completeness)
필요한 데이터가 누락 없이 존재하는 정도
일관성 (Consistency)
데이터가 서로 모순 없이 일관된 형태를 유지하는 정도
적시성 (Timeliness)
필요한 시점에 데이터를 사용할 수 있는 정도
유일성 (Uniqueness)
데이터 중복 없이 유일하게 존재하는 정도
유효성 (Validity)
정해진 형식·범위·규칙을 따르는 정도
05

과적합 (Overfitting)

과소적합
Underfitting
훈련 데이터도
제대로 학습 못 함
모델이 너무 단순
적정 학습
Good Fit
훈련·검증 모두
높은 성능 유지
목표 상태
과적합
Overfitting
훈련 데이터에만
지나치게 맞춰짐
새 데이터에 약함

과적합 방지 / 해결 방법

과적합드롭아웃(Dropout) — 학습 중 일부 뉴런을 무작위로 비활성화
과적합정규화(Regularization) — L1/L2 정규화로 가중치 크기 제한
공통데이터 증강(Data Augmentation) — 학습 데이터 양을 늘려 일반화 향상
공통교차 검증(Cross Validation) — 데이터를 여러 방식으로 나눠 성능 평가
과소적합모델 복잡도 증가 — 레이어·뉴런 수를 늘려 표현력 강화

드롭아웃 동작 원리 — "어떻게 동작하나"까지 이해

학습(Training) 시
매 스텝마다 각 층의 뉴런을 일정 확률(예: 0.5)로 무작위로 꺼서(0으로) 학습. 매번 다른 축소된 신경망으로 학습해 특정 뉴런 의존(공적응)을 막습니다.
추론(Test) 시
뉴런을 끄지 않고 전부 사용. 대신 학습 때 꺼진 비율만큼 출력을 스케일 조정해 균형을 맞춥니다.
📌 왜 쓰나

훈련 데이터에만 과하게 맞춰지는 과적합을 억제하는 규제(regularization) 기법. 하나의 신경망 안에서 앙상블 효과를 내는 것으로도 해석합니다.

⚠️ 시험 포인트
  • 과적합 = 훈련 성능 높음 + 검증/테스트 성능 낮음
  • 드롭아웃은 과적합 방지 기법 — 과소적합과 혼동 주의
  • 학습 시엔 뉴런을 끄고, 추론 시엔 전부 사용 (동작 방식 구분)
06

활성화함수 (Activation Function)

뉴런의 출력값을 결정하는 함수. 비선형성을 부여해 딥러닝이 복잡한 패턴을 학습할 수 있게 함.

Sigmoid
출력 범위: 0 ~ 1
  • 이진 분류 출력층에 사용
  • 기울기 소실 문제 발생 가능
  • 값이 0 또는 1에 가까울 때 학습 느려짐
ReLU
f(x) = max(0, x)
  • 은닉층에서 가장 많이 사용
  • 음수 입력 → 0 출력
  • 기울기 소실 문제 완화
Softmax
출력 합계 = 1 (확률)
  • 다중 분류 출력층에 사용
  • 각 클래스의 확률값 출력
  • 가장 높은 확률 = 예측 클래스
Tanh
출력 범위: -1 ~ 1
  • Sigmoid보다 출력 범위 넓음
  • 음수 처리 가능
  • RNN 등에서 활용
⚠️ 시험 포인트
  • 은닉층 기본 → ReLU / 이진분류 출력 → Sigmoid / 다중분류 출력 → Softmax
  • ReLU: 음수 입력 → 0 출력 (죽은 뉴런 문제)
07

CNN 기본 구조 (합성곱 신경망)

이미지 인식에 특화된 딥러닝 구조. 공간적 특징을 자동으로 추출.

입력층
원본 이미지
(픽셀 값)
합성곱층
Conv Layer
특징 추출
풀링층
Pooling
크기 축소
평탄화
Flatten
1D 변환
완전연결층
FC Layer
분류 수행
출력층
예측 결과
(클래스)
합성곱층 (Convolution)
필터(커널)를 이미지에 적용해 특징 맵(Feature Map)을 생성. 엣지·텍스처·패턴 검출.
풀링층 (Pooling)
Max Pooling: 영역에서 최댓값만 추출. 데이터 크기 축소, 연산량 감소, 위치 불변성 확보.
평탄화 (Flatten)
2D 특징 맵을 1D 벡터로 변환. 완전연결층 입력 준비.
완전연결층 (FC Layer)
추출된 특징으로 최종 분류 수행. 출력층에서 Softmax로 확률 출력.
⚠️ 시험 포인트
  • CNN 순서: 입력 → 합성곱 → 풀링 → 평탄화 → 완전연결 → 출력
  • Max Pooling = 최댓값 추출 / Average Pooling = 평균값 추출
  • CNN은 이미지 분류·객체 인식에 특화된 딥러닝 구조
08

핵심 키워드 (한·영)

Volume
규모
빅데이터 3V — 데이터 양
Velocity
속도
빅데이터 3V — 처리 속도
Variety
다양성
빅데이터 3V — 데이터 형태
Veracity
정확성
5V 추가 — 신뢰도
Value
가치
5V 추가 — 가치 창출
Overfitting
과적합
훈련↑ 검증↓
Dropout
드롭아웃
과적합 방지 기법
ReLU
렐루
은닉층 기본 활성화함수
Softmax
소프트맥스
다중분류 출력층
CNN
합성곱 신경망
이미지 인식 특화
Convolution
합성곱
특징 맵 생성
Max Pooling
맥스 풀링
영역 최댓값 추출
Flatten
평탄화
2D→1D 벡터 변환
Feature Map
특징 맵
합성곱 결과물
Regularization
정규화
가중치 크기 제한
09

오늘의 체크리스트