개발자 쿠키

[AI] 머신러닝(ML), 딥러닝(DL), 자연어처리(NLP) 용어 정리 본문

AI

[AI] 머신러닝(ML), 딥러닝(DL), 자연어처리(NLP) 용어 정리

개발자 쿠키 2026. 8. 11. 10:35
AI STUDY REFERENCE
[AI 용어] 머신러닝부터 임베딩까지 필수 용어 총정리
머신러닝 기초, 신경망, 토큰화와 임베딩까지 학습하며 정리한 용어 레퍼런스

1. 머신러닝 기본 용어

모델 (Model)
입력과 출력의 관계를 표현한 수식. y = ax + b도 모델. 학습은 이 수식의 계수를 찾는 작업
 
피처 (Feature)
대상을 수치로 표현해 모델에 넣는 입력 변수. 사람이 대상이면 키, 몸무게, 나이 -> 입력값
학습 : 데이터로 모델(수식)을 만들어내는 과정 -> 배포 전 단계
추론 : 완성된 모델로 새로운 값을 예측하는 과정 -> 서비스 런타임에서 동작하는 것
파라미터 : 모델이 학습을 통해 스스로 찾아내는 값 (Weight, Bias) -> 학습결과로 산출
하이퍼파라미터 : 사람이 직접 지정하는 값 (학습률, epochs, Layer 개수) -> 코드에 하드코딩
용어 의미
epoch 전체 학습 데이터를 한 바퀴 학습하는 단위. epochs = 1000이면 1000회 반복
lr (Learning Rate, 학습률) 한 번에 값을 조정하는 폭. 점프 거리를 결정
ŷ (y hat) 모델의 예측값. 실제 정답 y와 구분하기 위한 표기
Label 정답값. "이 이미지는 숫자 7이다"에서의 7
Dataset 데이터 + 정답(Label). 정답이 없으면 데이터
이진 분류 둘 중 하나로 나누는 문제. 합격/불합격, 스팸/정상

2. Loss와 최적화 용어

Loss Function (손실 함수)
모델이 얼마나 틀렸는지 계산하는 공식. 학습의 목표는 Loss가 최소가 되는 파라미터를 찾는 것
Loss, Error, Cost는 문맥에 따라 혼용됨
Loss Function 정의와 용도
MAE
Mean Absolute Error
오차 절댓값의 평균. 평균적인 오차 크기를 직관적으로 표현
MSE
Mean Squared Error
오차 제곱의 평균. 큰 오차에 크게 반응. 회귀 문제의 표준
Cross Entropy
크로스 엔트로피
작은 오차는 적게, 큰 오차는 크게 확대. 분류 문제의 표준
BCE
Binary Cross Entropy
이진 분류 전용 크로스 엔트로피. PyTorch의 nn.BCELoss()
분류에 MSE를 쓰지 않는 이유
확률은 0에서 1 사이 값이라 제곱하면 값이 작아짐. 0.5의 제곱은 0.25. 오차 확대라는 목적과 반대로 동작

파라미터 탐색 방법

Grid Search (그리드 서치)
후보값을 정해두고 2중 for문으로 전부 대입하는 완전 탐색 방식. 개념 이해용이며 실무 사용은 드묾
정규방정식 (Normal Equation)
MSE가 최소가 되는 값을 미분 방정식으로 한 번에 계산하는 방법. 반복 없음
역행렬 (Inverse Matrix) : A⁻¹ 표기. np.linalg.inv(A). 계산 비용이 크고 구할 수 없는 경우도 존재
전치행렬 (Transpose) : Aᵀ 표기. 행과 열을 뒤집은 행렬. A.T
SVD : 역행렬을 구할 수 없을 때 유사 역행렬을 사용하는 기법. 메모리 문제는 미해결
Gradient Descent (GD, 경사 하강법)
Gradient는 미분값, 즉 기울기. 랜덤 지점에서 시작해 기울기가 낮아지는 방향으로 반복 이동하며 최솟값을 탐색
정규방정식은 피처 수가 늘면 사용 불가. GD는 가능. 신경망 학습의 기반
용어 의미
Batch Gradient Descent 전체 데이터를 한 번에 사용해 에폭당 1회 업데이트하는 방식
SGD Stochastic GD. PyTorch의 optim.SGD
Local Minimum
지역 최소점
전역 최솟값이 아닌 구간에 갇혀 학습이 진행되지 않는 현상
Optimizer
옵티마이저
Weight와 Bias의 갱신 방식을 결정하는 알고리즘의 총칭
Adam
Adam Optimizer
관성 적용과 학습률 자동 조율로 Local Minimum을 회피하는 GD. 신경망의 사실상 기본값

3. 통계와 EDA 용어

EDA (Exploratory Data Analysis, 탐색적 데이터 분석)
데이터를 이해하기 위한 모든 행동. 출력, 통계 확인, 시각화 전부 포함
EDA는 확인, 전처리는 수정. 결측치를 찾는 것은 EDA, 채우거나 제거하는 것은 전처리
용어 의미
결측치 (Missing Value) 값이 비어있는 것. DB의 NULL, 파이썬의 NaN
이상치 (Outlier) 데이터 범위에서 크게 벗어난 값. min과 max로 확인 가능
분포 (Distribution) 데이터가 퍼져있는 모양. 수치가 아닌 모양
분산 (Variance) 평균 기준 퍼짐 정도의 수치. 평균과의 차이를 제곱해 평균낸 값
표준편차 (Std) 분산의 제곱근. 값이 크면 편차가 크고, 작으면 평균에 밀집
왜도 (Skewness) 좌우 어느 쪽으로 치우쳤는지
첨도 (Kurtosis) 가운데가 뾰족한지 납작한지
상관관계와 상관계수
상관관계 (Correlation) : 한 변수가 변할 때 다른 변수도 함께 변하는 관계
상관계수 (Correlation Coefficient) : 그 정도를 -1에서 1 사이 수치로 표현한 값
선형 관계 : y = ax + b로 표현 가능한 관계 / 비선형 관계 : 그 외 전부
+1은 완전한 양의 상관, -1은 완전한 음의 상관, 0은 무상관. 모델의 입력 피처를 선택하는 근거로 사용

정규화와 표준화

용어 의미
정규화 (Normalization) 값의 범위를 조율하는 행동 전체를 가리키는 상위 개념
표준화 (Standardization) 평균 0, 표준편차 1로 맞추는 것. 정규화의 하위 개념
주의 : DB의 정규화(1NF, 2NF, 3NF)와는 무관한 개념. 한국어 용어만 동일

데이터 분할과 평가지표

용어 의미
Train Set 학습용 데이터. 통상 80%
Validation Set 학습 중간 평가용. 학습률 조율과 조기 중단 판단에 사용
Test Set 최종 평가용. 학습에 사용하지 않은 데이터
R² (결정계수) 회귀 평가지표. 0에서 1 사이, 1에 가까울수록 우수
Accuracy (정확도) 분류 평가지표. 전체 중 정답을 맞춘 비율
F1-score 정확히 맞춘 것과 놓치지 않은 것의 균형
AUC (ROC-AUC) 0과 1의 구분 성능. 곡선 아래 면적
random_state 랜덤 시드 고정값. 동일 값 지정 시 항상 같은 분할 결과, 재현성 확보

4. 신경망과 딥러닝 용어

Weight (가중치) 와 Bias (편향)
수학의 기울기(a)와 절편(b)에 대응하는 딥러닝 용어. 의미는 동일하고 표기만 상이
y = ax + b 가 y = wx + b 로 표기 변경
활성화 함수 (Activation Function)
선형함수 사이에 배치해 비선형을 만드는 함수. 없으면 층을 아무리 쌓아도 결과는 선형
ReLU : 음수는 0, 양수는 그대로. 학습 속도가 빨라 가장 널리 사용
Sigmoid : 값을 0에서 1 사이 확률로 변환. S자 곡선. 이진 분류용
Softmax : 여러 점수를 합이 1인 확률 분포로 변환. 다중 분류용
함수 중첩과 Sequential Model
한 함수의 결과가 다음 함수의 입력이 되는 구조. 수학에서는 함수 중첩, 신경망에서는 Sequential Model로 지칭
용어 의미
Layer (레이어) 신경망에서 비선형 방정식의 각 단계. nn.Linear 하나가 대략 한 층
퍼셉트론 (Perceptron) 1958년 등장. 선형분류기에 학습 개념을 추가한 최초의 신경망 모델
MLP
Multi Layer Perceptron
퍼셉트론을 여러 층 중첩한 모델. 1986년 등장
Backpropagation
역전파
멀티 레이어에서 GD에 필요한 미분값을 계산하는 방법. loss.backward()가 수행
XOR 문제 직선 하나로 분리 불가능한 문제. 1970년 AI 겨울의 원인
딥러닝 (Deep Learning) 사람이 Feature를 지정하지 않고 모델이 스스로 Feature까지 찾아내는 신경망
CNN 이미지를 통째로 입력받는 딥러닝 모델
RNN 음성이나 순차 데이터를 통째로 입력받는 딥러닝 모델

PyTorch 용어

Tensor (텐서)
Numpy Array의 상위 호환. 문법은 거의 동일하며 GPU 연산과 자동 미분을 지원
벡터 = 1차원 텐서
행렬 = 2차원 텐서
행렬 N개 = 3차원 텐서
Autograd (자동 미분)
Gradient(미분값)를 자동 계산하는 기능. 학습 중 미분이 반복되므로 미분 속도가 곧 학습 속도
코드 의미
requires_grad=True 미분 추적 ON. nn.Linear()로 생성된 파라미터는 기본값이 True
with torch.no_grad() 미분 추적 OFF 구간. 평가와 시각화 시 사용, 메모리와 속도 절약
optimizer.zero_grad() 미분값 초기화. 미분값이 누적되므로 매 루프 필수
loss.backward() 미분(역전파) 계산 실행
optimizer.step() 파라미터 업데이트
state_dict() 학습된 파라미터 묶음. .pth 파일로 저장
reshape(-1, 1) 2차원 행렬로 변환. -1은 자동 계산되는 n
batch 와 DataLoader
batch : 모델에 한 번에 입력하는 데이터 묶음
batch_size : 묶음의 크기. 64면 이미지 64장을 동시 입력
DataLoader : 대용량 데이터를 나눠 읽어오는 도구. 셔플과 병렬 로딩 지원
shuffle : 데이터를 랜덤하게 섞는 옵션. 한 종류만 연속 학습 시 특징 추출이 왜곡됨
batch 내 모든 데이터는 공통된 w, b를 사용. 데이터별 파라미터가 따로 존재하지 않음
MNIST
Modified National Institute of Standards and Technology database. 손글씨 숫자 이미지 데이터셋. 28 × 28 픽셀(784칸), 0부터 9까지의 숫자.
MLP 실습의 표준 예제
PCA (차원 축소)
고차원 데이터를 저차원으로 축소하는 알고리즘. 384차원 벡터를 3차원으로 줄여 시각화할 때 사용
3차원을 2차원으로 축소하는 것은 바닥에 투영된 그림자를 취하는 원리와 동일

5. NLP와 LLM 용어

용어 의미
NLP
Natural Language Processing
컴퓨터가 인간의 말을 이해하고 분석하는 AI 분야. 자연어처리
토큰 (Token) 문장을 자른 작은 단위. 단어, 글자, Byte 조각 중 하나
토크나이저 (Tokenizer) 문장을 토큰으로 자르고 각 토큰을 Index 번호로 변환하는 툴
Vocabulary (사전) (토큰 : Index) 형태의 사전. 사전 학습되어 배포됨
Tokenizer Training 대규모 텍스트로 Vocabulary를 생성하는 작업
인덱싱 (Indexing) 토큰을 Vocabulary의 번호로 변환. DB 인덱스와 무관
토크나이저 알고리즘 2종
Word Piece : 글자 단위로 분할 후 빈출 조합을 토큰으로 등록. 이 사전을 사용하는 것이 BERT 토크나이저
Byte-Level BPE (BBPE) : Byte 단위로 분할 후 빈출 Byte 조합을 토큰으로 등록. 현재 표준이며 GPT, 클로드, 제미나이가 채택
BPE는 Character-Level BPE와 Byte-Level BPE로 나뉘므로 단독 표기 시 모호함. Byte-Level BPE 또는 BBPE로 명시 필요
용어 의미
## (BERT) 앞에 다른 글자가 붙는다는 표시. 접두사 존재
Ġ (BBPE) 띄어쓰기. ##과 의미가 다름
Sentence Piece 여러 토크나이저 알고리즘을 지원하는 프레임워크. BBPE 이전 한중일에서 다수 사용
Transformer 현대 언어 모델의 기반 구조. BERT와 GPT 모두 채택
BERT Google이 개발한 언어 모델. 토크나이저가 아님. 현재는 사용 빈도가 낮음
허깅페이스
Hugging Face
AI 모델 공유 플랫폼. GitHub에 대응
transformers 허깅페이스 공식 라이브러리. 모델과 툴 다운로드 및 사용
Model Card 허깅페이스의 모델 설명 페이지. GitHub의 README.md에 대응
safetensors 2023년 이후 권장 모델 파일 포맷. 악성코드 실행 방지

임베딩 관련

임베딩 (Embedding) 과 의미공간
단어를 의미공간이라는 벡터 공간에 맵핑하는 것. 의미공간은 유사한 의미의 단어가 유사한 벡터값을 갖는 공간
토큰 ID 상으로는 무관한 "좋아요"와 "Like"가 임베딩 공간에서는 근접한 값을 가짐
Pooling (풀링)
여러 벡터를 하나로 합치는 연산. 토큰이 3개면 벡터도 3개가 나오지만 본 모델에는 문장 벡터 1개를 입력해야 함.
Mean Pooling : 평균으로 합치는 방식. 가장 일반적
Polling과 구분 : 반복 감시를 뜻하는 Polling과 다른 단어
코사인 유사도 (Cosine Similarity)
두 벡터의 유사도를 방향만으로 측정하는 방법. 벡터는 방향과 크기로 구성되며, 유사도 판단에서는 방향이 기준. 크기 차이는 스칼라배.
내적 (Dot Product) : A · B 표기. 두 벡터를 곱해 스칼라 값 1개를 산출
‖A‖ : 벡터 A의 크기. 피타고라스 정리로 계산
유클리드 거리 : 일반 좌표계의 직선 거리. 코사인 유사도와 대비되는 개념
L2 정규화 (L2 Normalization)
벡터의 크기를 1로 만들고 방향만 남기는 연산. 크기가 1이면 코사인 유사도 공식의 분모가 1이 되어 내적 값이 곧 유사도.
LLM 언어 모델 : 미사용. 크기 정보가 소실되기 때문
검색 (이미지, 텍스트, RAG) : 사용. 유사성 판단에 크기 정보가 불필요
용어 의미
padding=True 토큰 개수를 통일하고 빈 공간을 0으로 채움. 모델 입력 크기가 동일해야 하기 때문
return_tensors='pt' 결과를 PyTorch Tensor로 반환. pt는 PyTorch 약자
Sentence Transformers Pooling, L2 정규화, 코사인 유사도를 자동 처리하는 라이브러리
RAG 검색한 문서를 LLM에 함께 입력해 답변 품질을 높이는 기법. 임베딩과 코사인 유사도가 핵심
FastAPI 파이썬 웹 프레임워크. AI 서버를 분리해 REST API로 연동할 때 사용

6. 헷갈리기 쉬운 용어 정리

헷갈리는 짝 구분 포인트
정규화 vs 표준화 정규화가 상위 개념. 표준화는 평균 0, 표준편차 1로 맞추는 것
정규화(AI) vs 정규화(DB) 별개 개념. AI는 값의 범위 조율, DB는 중복 제거를 위한 테이블 설계
파라미터 vs 하이퍼파라미터 학습으로 산출되면 파라미터, 사람이 지정하면 하이퍼파라미터
BERT 모델 vs BERT 토크나이저 BERT는 언어 모델. BERT 토크나이저는 해당 모델이 사용한 토크나이저
Pooling vs Polling Pooling은 벡터 합치기, Polling은 반복 감시. 철자 상이
분포 vs 분산 분포는 모양, 분산은 그 모양을 설명하는 수치 중 하나
기울기/절편 vs Weight/Bias 동일 개념. 수학 용어와 딥러닝 용어의 차이
함수 중첩 vs Sequential Model 동일 개념. 수학 용어와 신경망 용어의 차이
MSE vs Cross Entropy MSE는 회귀용, Cross Entropy는 분류용
머신러닝 vs 딥러닝 딥러닝은 머신러닝의 부분집합. Feature를 모델이 스스로 찾으면 딥러닝
Scikit-learn vs PyTorch 싸이킷런은 머신러닝 라이브러리, PyTorch는 딥러닝 라이브러리
Numpy vs Tensor 문법은 거의 동일. Tensor에만 GPU 연산과 자동 미분 존재
모르는 용어가 나올때마다 이 페이지에 추가할 예정입니다. (최신화: 2026.08.11)

'AI' 카테고리의 다른 글

[Claude] Figma MCP 연동하기 (windows11)  (0) 2026.03.20