평가·데이터42개
AI가 잘하는지 어떻게 재고, 어떤 데이터로 가르치는지에 관한 용어예요. 정확도, 정밀도와 재현율, 벤치마크, 라벨링, 편향, 데이터 증강처럼 성능 표를 읽을 때 필요한 말들을 모았어요.
조건이 흔들려도 여전히 통하는 성질
검증 데이터Validation Set학습에 쓰지 않고 점검에만 쓰려고 떼어 둔 자료
과소적합Underfitting너무 단순해서 연습 자료조차 못 맞히는 상태
과적합Overfitting연습 문제 답만 외워 새 문제는 못 푸는 상태
교차 검증Cross-Validation자료를 조각내 돌아가며 점검하고 점수를 평균 내는 방법
데이터 과학Data Science데이터에서 쓸 만한 답을 끌어내는 일 전체
데이터 누수Data Leakage채점용 정보가 학습 쪽으로 새어 드는 사고
데이터 정제Data Cleaning모은 자료를 쓸 수 있는 상태로 다듬는 손질
데이터 증강Data Augmentation가진 자료를 변형해 가짓수를 늘리는 방법
데이터 편향Dataset Bias모은 자료 자체가 한쪽으로 쏠려 있는 상태
데이터 품질Data Quality학습에 쓰는 자료가 얼마나 믿을 만한지
데이터셋DatasetAI를 가르치려고 모아 정리해 둔 자료 묶음
라벨Label사람이 자료에 미리 붙여 둔 정답
라벨링Labeling자료 하나하나에 사람이 답을 붙이는 작업
리더보드Leaderboard평가 점수를 줄 세워 순서로 보여 주는 표
바운딩 박스Bounding Box물체를 감싸는 네모와 그 네모의 자리
벤치마크Benchmark여러 대상을 같은 조건으로 재는 공통 문제 묶음
보정Calibration말한 확률과 실제로 맞은 비율을 맞추기
사람 평가Human Evaluation사람이 직접 보고 매기는 평가
설명 가능성ExplainabilityAI가 왜 그렇게 판단했는지 보여 줄 수 있는 정도
신뢰도 점수Confidence Score모델이 자기 답에 스스로 매긴 확신 숫자
엘로 점수Elo Rating서로 겨룬 결과를 쌓아 매기는 실력 숫자
이상치Outlier나머지 값들과 뚝 떨어져 혼자 튀는 값
정답 데이터Ground Truth학습과 채점의 기준이 되는 진짜 답
정밀도와 재현율Precision & Recall골라낸 것 중 진짜 비율과 진짜 중 찾아낸 비율
정확도Accuracy전체 판정 가운데 맞힌 것의 비율
클래스 불균형Class Imbalance한쪽 종류만 잔뜩 몰려 있는 자료의 치우침
특징FeatureAI가 판단할 때 들여다보는 재료 한 가지
퍼플렉시티Perplexity다음 말을 몇 갈래에서 헷갈리는지 나타낸 값
평가 지표Evaluation Metric무엇으로 잘한다고 할지 정해 둔 잣대
평균 제곱 오차Mean Squared Error빗나간 거리를 제곱해 평균 낸 벌점
표본 편향Sampling Bias누구를 뽑았느냐 때문에 생기는 자료의 쏠림
프롬프트 충실도Prompt Adherence주문한 대로 나왔는지 재는 잣대
학습 곡선Learning Curve회차가 늘수록 점수가 어떻게 변하는지 그린 선
합성 데이터Synthetic Data진짜 대신 만들어 낸 연습용 자료
혼동 행렬Confusion Matrix맞고 틀린 네 경우를 칸에 나눠 적은 표
A/B 테스트A/B Test둘로 나눠 써 보게 하고 결과를 견주는 시험
AI 생성물 탐지AI Content DetectionAI가 만든 것인지 가려내는 일
AI 편향AI Bias학습 자료의 치우침이 AI 판단에 그대로 남은 상태
F1 점수F1 Score정밀도와 재현율을 하나로 합친 점수
LLM 심사LLM-as-a-Judge언어 모델에게 답의 좋고 나쁨을 매기게 하기
ROC·AUCROC & AUC문턱을 옮겨 가며 잰 성적을 한 곡선과 한 숫자로