Métodos de entrenamiento58

Cómo aprende la IA a partir de datos. Aprendizaje supervisado, no supervisado y por refuerzo, ajuste fino, sobreajuste, función de pérdida, descenso de gradiente: los pasos escondidos tras la palabra «entrenar», uno a uno.

Nivel
Agente y entornoAgent & Environment

Quien actúa y el tablero que responde a esa acción

Básico
AgrupamientoClustering

Juntar lo parecido sin ninguna etiqueta previa

Básicos Intermedio
Ajuste finoFine-Tuning

Retocar un poco más un modelo ya entrenado con datos nuevos

Intermedio
Ajuste por instruccionesInstruction Tuning

Etapa donde el modelo aprende a responder según la instrucción

LLM Intermedio
Algoritmo genéticoGenetic Algorithm

Mezclar y variar un poco varios candidatos para ir eligiendo

Intermedio
AlineaciónAlignment

Ajustar la capacidad de la IA a lo que las personas desean

Ética Intermedio
Aprendizaje automáticoMachine Learning

Enseñar con ejemplos en vez de escribir las reglas

Básicos Básico
Aprendizaje autosupervisadoSelf-Supervised Learning

Aprender tapando parte de los datos y adivinando lo tapado

Intermedio
Aprendizaje contrastivoContrastive Learning

Acercar lo que es igual y alejar lo que es distinto al aprender

Avanzado
Aprendizaje federadoFederated Learning

Juntar solo el resumen de lo aprendido, sin juntar los datos

Avanzado
Aprendizaje no supervisadoUnsupervised Learning

Encontrar la estructura de los datos sin ninguna respuesta puesta

Básico
Aprendizaje por imitaciónImitation Learning

Aprender copiando tal cual el actuar de quien ya sabe hacerlo

Intermedio
Aprendizaje por refuerzoReinforcement Learning

Aprender a base de intentar y corregir según la puntuación recibida

Básico
Aprendizaje por transferenciaTransfer Learning

Llevar a una tarea nueva la base ya aprendida en otra

Intermedio
Aprendizaje semisupervisadoSemi-Supervised Learning

Aprender con poco dato etiquetado y mucho dato sin etiquetar

Avanzado
Aprendizaje supervisadoSupervised Learning

Aprender una regla a partir de ejemplos con la respuesta ya puesta

Básico
Aumento de datosData Augmentation

Transformar los datos que ya tienes para multiplicar su variedad

Intermedio
Colapso de modoMode Collapse

Cuando quien genera repite sin parar lo único que le funciona

Generativa Avanzado
Colapso del modeloModel Collapse

Cuando la IA aprende de lo que ella misma creó y pierde diversidad

Ética Avanzado
Conjunto de validaciónValidation Set

Datos apartados solo para revisar, nunca para entrenar

Básico
ConvergenciaConvergence

El estado en que el valor deja de mejorar y se mantiene fijo

Intermedio
Curva de aprendizajeLearning Curve

La línea que dibuja cómo cambia el puntaje según pasan las vueltas

Básico
Descenso de gradienteGradient Descent

Moverse poco a poco hacia donde el error se hace más pequeño

Intermedio
Destilación de conocimientoKnowledge Distillation

Pasar el criterio de un modelo grande a uno pequeño

Avanzado
Desvanecimiento del gradienteVanishing Gradient

Señal de aprendizaje que se debilita hasta desaparecer entre capas

Arquitectura Avanzado
DQNDeep Q-Network

Hacer que una red neuronal recuerde la tabla de valores Q

Avanzado
Dropout

Apagar al azar partes del modelo mientras entrena

Intermedio
EntrenamientoTraining

El proceso de ajustar los parámetros poco a poco con ejemplos

Básicos Básico
ÉpocaEpoch

La unidad que cuenta una vuelta completa a los datos de entrenamiento

Básico
Error cuadrático medioMean Squared Error

Castigo que resulta de elevar al cuadrado la distancia y promediarla

Evaluación Intermedio
Exploración y explotaciónExploration vs Exploitation

El equilibrio entre usar lo conocido o probar algo nuevo

Intermedio
Fuga de datosData Leakage

Información de evaluación que se cuela en el entrenamiento

Evaluación Intermedio
Función de pérdidaLoss Function

El número que mide cuánto se aleja la respuesta de la correcta

Intermedio
GeneralizaciónGeneralization

La capacidad de acertar también con datos nuevos

Básicos Intermedio
GradienteGradient

La señal que indica hacia dónde y cuánto moverse para reducir el error

Arquitectura Intermedio
HiperparámetroHyperparameter

El valor que una persona fija antes de empezar a entrenar

Intermedio
Ley de escaladoScaling Law

Regla que muestra cuánto mejora el rendimiento al crecer la escala

LLM Intermedio
LoRA

Dejar el cuerpo intacto y entrenar solo un pequeño añadido

Avanzado
Mini-loteMini-Batch

Procesar los datos en tandas, dando un paso por cada una

Intermedio
Mínimo localLocal Minimum

Un punto atrapado, aunque exista uno más bajo cerca

Intermedio
Modelo del mundoWorld Model

Un modelo que guarda cómo funciona el mundo y lo ensaya antes

Generativa Avanzado
Olvido catastróficoCatastrophic Forgetting

Perder una destreza anterior mientras se aprende algo nuevo

Avanzado
OptimizadorOptimizer

La regla que recibe el gradiente y decide cómo mover los valores

Avanzado
Parada tempranaEarly Stopping

Detener el entrenamiento cuando el puntaje empieza a empeorar

Básico
PolíticaPolicy

La norma que fija qué hacer en cada situación

Intermedio
PreentrenamientoPretraining

Etapa donde se aprende lo básico antes de decidir para qué se usará

LLM Intermedio
Punto de controlCheckpoint

Una copia que guarda el estado del entrenamiento a mitad de camino

Básico
Q-learning

Anotar y corregir la puntuación esperada de cada acción

Avanzado
RecompensaReward

El puntaje de bien o mal que llega después de actuar

Básico
RegresiónRegression

Dar un número dentro de una escala continua

Básicos Intermedio
RegularizaciónRegularization

Penalizar que los valores del modelo crezcan demasiado

Intermedio
RetropropagaciónBackpropagation

El procedimiento que reparte el error hacia atrás, paso a paso

Intermedio
RLHF

Ajusta el tono de la respuesta con preferencias humanas

LLM Intermedio
RuidoNoise

La mancha mezclada que también es el punto de partida de la creación

Generativa Básico
SobreajusteOverfitting

Memorizar los ejercicios de práctica y fallar con los nuevos

Intermedio
SubajusteUnderfitting

Tan simple que ni siquiera acierta con los datos de práctica

Intermedio
Tasa de aprendizajeLearning Rate

El valor que decide cuánto se mueve cada paso

Intermedio
Validación cruzadaCross-Validation

Dividir los datos en partes, turnarlas y promediar los resultados

Avanzado