조기 종료Early Stopping
성적이 나빠지기 시작할 때 학습을 멈추기
- 조기 종료는 정해 둔 바퀴 수를 다 채우지 않고, 성적이 나빠지기 시작하는 지점에서 학습을 멈추는 방법이에요.
- 판단 기준은 학습에 쓴 자료가 아니라 따로 떼어 둔 자료의 성적이에요. 학습 자료 성적은 끝까지 좋아지거든요.
- 한 번 나빠졌다고 바로 멈추지 않아요. 몇 바퀴 더 지켜보고 회복되지 않으면 그때 끝내요.
- 멈춘 뒤에는 마지막 상태가 아니라 가장 좋았던 지점의 상태로 되돌려 써요.
- 손볼 것이 거의 없는데도 과적합을 크게 줄여 줘서, 웬만한 학습에 기본으로 걸어 둬요.
목차
1비유로 이해하기
원두를 갈면서 굵기를 조금씩 곱게 바꿔 가며 커피를 내려 봐요. 처음에는 알갱이가 굵어서 물이 그냥 지나가 밍밍해요. 조금 더 곱게 갈면 맛이 살아나고, 더 곱게 갈면 향이 진해져요. 여기까지는 갈수록 좋아져요.
그런데 어느 굵기를 지나면 상황이 뒤집혀요. 가루는 계속 더 고와지는데 맛은 오히려 텁텁하고 써져요. 더 곱게 갈수록 좋아지는 줄 알고 계속 돌리면 마실 수 없는 커피가 나와요.
그래서 한 잔씩 맛을 보면서 제일 좋았던 굵기를 적어 둬요. 맛이 꺾이기 시작하면 손을 멈추고, 적어 둔 굵기로 다이얼을 되돌려요. 조기 종료가 이 손 멈추기예요. 갈린 정도는 계속 올라가지만 맛은 어느 지점에서 꺾인다는 것을 알기에 그 지점을 찾아 멈춰요.
2자세히 알아보기
두 개의 성적이 서로 다르게 움직여요
학습 중에는 성적을 두 군데서 재요. 하나는 학습에 쓴 자료고, 다른 하나는 학습에 쓰지 않고 따로 떼어 둔 자료예요. 학습 자료 성적은 바퀴를 돌수록 거의 언제나 좋아져요. 모델이 그 자료를 점점 잘 외우기 때문이에요.
떼어 둔 자료 성적은 다르게 움직여요. 처음에는 함께 좋아지다가, 어느 지점을 지나면 더 나아지지 않고 슬슬 나빠져요. 모델이 자료에 담긴 규칙 대신 그 자료에만 있는 잡음까지 따라 그리기 시작한 순간이에요.
두 선이 벌어지기 시작하는 지점이 멈출 자리예요. 이 지점을 눈으로 확인하려면 바퀴마다 두 성적을 모두 재서 나란히 적어 두어야 해요.
떼어 둔 자료는 학습에 절대 쓰지 않아요. 한 번이라도 학습에 섞이면 그 자료 성적도 함께 좋아져서 꺾이는 지점이 보이지 않게 되거든요. 조기 종료가 제대로 작동하려면 이 자료를 깨끗하게 지켜 두는 일이 먼저예요.
바로 멈추지는 않아요
떼어 둔 자료의 성적은 조금씩 출렁여요. 자료 묶음이 매번 다르게 짜이니까 한두 바퀴 나빠졌다가 다시 좋아지는 일이 흔해요. 첫 하락에 곧바로 멈추면 아직 더 내려갈 수 있는 학습을 일찍 끊어 버려요.
그래서 몇 바퀴를 지켜볼지 미리 정해 둬요. 최고 기록이 나온 뒤로 그만큼 바퀴가 지나도록 기록이 깨지지 않으면 그때 멈춰요. 이 여유를 짧게 잡으면 성급하게 끊기고, 길게 잡으면 필요 없는 학습을 오래 끌어요.
가장 좋았던 지점으로 되돌려요
멈춘 시점의 상태를 그대로 쓰면 손해예요. 최고 기록이 나온 뒤 몇 바퀴를 더 돌았으니, 마지막 상태는 이미 조금 나빠진 상태거든요.
그래서 학습 도중 기록이 깨질 때마다 그때의 값들을 따로 저장해 둬요. 멈춘 뒤에는 저장해 둔 것 중 가장 좋았던 상태를 꺼내 쓰죠. 커피로 치면 맛이 꺾인 뒤에 다이얼을 최고였던 굵기로 되돌리는 일과 같아요.
저장은 기록이 깨질 때만 하면 돼요. 매 바퀴 전부 남겨 두면 저장 공간이 금방 차거든요. 큰 모델일수록 한 번 저장하는 데 드는 용량이 커서, 무엇을 언제 남길지 정해 두는 일이 학습 설정의 한 부분이 돼요.
3조금 더 정확하게
조기 종료는 검증 자료의 지표가 정해진 바퀴 수 동안 나아지지 않으면 학습을 끝내고, 최고 기록 시점의 값들을 되돌려 쓰는 방법이에요. 지켜보는 지표는 오차일 수도 있고 정확도 같은 다른 지표일 수도 있어요. 지표에 따라 좋아진다는 방향이 반대라서 설정을 잘못 넣으면 엉뚱한 시점에 멈춰요.
한 가지 주의할 점이 있어요. 멈출 지점을 검증 자료로 골랐다면 그 자료는 이미 학습 과정에 관여한 셈이에요. 최종 성적은 한 번도 쓰지 않은 또 다른 자료로 재야 부풀려지지 않아요.
비유가 어긋나는 지점도 있어요. 커피는 맛을 사람이 혀로 재지만, 학습에서는 미리 정한 계산으로 성적을 재요. 그리고 그라인더는 되돌려도 원두가 그대로지만, 학습은 되돌리려면 이전 값들을 미리 저장해 두어야 해요. 저장해 두지 않았다면 나빠진 상태로 끝나 버려요.
4직접 해보기
5흔한 오해
학습을 오래 돌릴수록 모델이 좋아진다고 생각하기 쉽지만, 실제로는 어느 지점을 지나면 처음 보는 자료에 대한 성적이 도리어 떨어져요.
성적이 한 번 나빠지면 바로 멈춰야 한다고 여기기 쉽지만, 실제로는 출렁임일 수 있어서 몇 바퀴 지켜본 뒤에 결정해요.
조기 종료는 학습 자료 성적을 보고 판단한다고 생각하기 쉽지만, 실제로는 학습에 쓰지 않은 자료의 성적으로만 판단해요.
7한 줄 요약
그러니까조기 종료는 맛이 꺾이는 지점에서 손을 멈추는 일이어서, 자료를 외우기 시작하기 직전의 가장 좋은 상태를 건져 줘요.
잘못된 내용이나 더 좋은 비유가 있나요? 수정 제안 보내기 · 마지막 수정2026-09-02