Coffee & Cake · Español
Coffee & Cake: Pretraining, fine-tuning y post-training
Cómo el pretraining construye la base general, el fine-tuning adapta un modelo existente, qué añade el post-training y por qué estos conceptos se solapan.
- Publicado
- Duración
- 11:01
Exact published script
Transcripción
Transcripción en textoIntroducción del Café
Bienvenidos a Andy's Café, donde las máquinas preparan y las personas saborean. Hoy servimos Coffee and Cake.
Tres palabras que se solapan
Imagina que preguntas a un servicio de atención al cliente basado en un modelo de lenguaje: «¿Puedo cambiar mi vuelo del martes?» La primera versión del modelo reconoce todas las palabras, pero continúa la conversación como si estuviera completando un diálogo encontrado en internet. Su respuesta suena plausible, aunque no intenta ayudarte de una forma fiable.
Una segunda versión pide los datos que faltan, explica los límites de lo que puede confirmar y evita prometer un cambio que aún no se ha realizado. Una tercera, además, expresa la incertidumbre con claridad y sabe cuándo conviene derivar el caso a una persona.
Podría parecer que esas tres versiones corresponden a tres técnicas separadas: pretraining, fine-tuning y post-training. En español podemos hablar de entrenamiento previo, ajuste fino y posentrenamiento. Pero los términos no dividen el aprendizaje en tres cajas cerradas ni describen una cadena obligatoria.
El entrenamiento previo y el posentrenamiento indican, sobre todo, en qué parte del ciclo de vida se trabaja. El ajuste fino describe una manera de adaptar un modelo que ya existe. Por eso, un ajuste fino realizado después del entrenamiento previo puede ser las dos cosas a la vez: ajuste fino por el método utilizado y posentrenamiento por el momento en que ocurre.
Una base amplia
En los modelos de lenguaje que generan texto paso a paso, el entrenamiento previo comienza con una tarea de apariencia sencilla: predecir qué viene a continuación. El modelo procesa enormes cantidades de textos variados. Cada vez que su predicción se aleja del texto observado, el error sirve para modificar sus parámetros y ajustar las probabilidades de futuras respuestas.
La unidad que trata de predecir suele llamarse token. Un token puede ser una palabra, una parte de una palabra o incluso un signo de puntuación. Al repetir la predicción en innumerables posiciones, el modelo aprende regularidades del idioma, asociaciones entre ideas y capacidades que pueden reutilizarse en muchas tareas.
El resultado es un modelo base. Puede explicar qué es un vuelo con escala, reconocer una fecha o relacionar una tarifa con ciertas restricciones. Eso no significa que ya se comporte como un buen asistente. Su objetivo de aprendizaje ha sido continuar secuencias de forma probable, no atender a un cliente con prudencia ni seguir una conversación según nuestras expectativas.
Conviene evitar una simplificación frecuente: el entrenamiento previo no se limita a introducir datos, como si el modelo fuera un archivo. También puede desarrollar habilidades generales. Y lo aprendido no queda guardado como una colección de reglas legibles. Se distribuye entre muchos parámetros que, juntos, alteran qué continuaciones resultan más probables.
Adaptar lo que ya existe
El ajuste fino, o fine-tuning, parte de una versión que ya ha aprendido algo. En lugar de comenzar desde cero, se la entrena con datos más específicos, una tarea más concreta o un objetivo distinto. Por ejemplo, se pueden reunir preguntas de clientes junto con buenas respuestas de atención al cliente y usar esas demostraciones para hacer más probables respuestas del mismo tipo.
A veces se modifican todos los parámetros del modelo. Otras veces se conserva intacta la base y se entrenan solo pequeñas piezas añadidas. En ambos casos, el modelo que finalmente se utiliza cambia cuando se incorpora esa adaptación. El término ajuste fino describe esa relación entre un punto de partida ya entrenado y una modificación posterior; por sí solo no cuenta toda la historia del modelo.
Por eso también puede haber un nuevo ajuste fino mucho más tarde. Una empresa podría tomar un asistente que ya conversa bien y especializarlo en seguros, medicina o atención al pasajero. Sigue siendo ajuste fino, aunque el modelo haya pasado antes por otras formas de posentrenamiento.
Existe además una zona fronteriza. Un modelo ya entrenado puede seguir practicando la predicción de texto con una gran colección de documentos de un ámbito concreto. A menudo se habla entonces de entrenamiento previo continuado, porque se mantiene el objetivo original aunque el punto de partida ya no sea nuevo. La etiqueta importa menos que dos preguntas: qué datos recibió el modelo y qué objetivo trató de optimizar.
El paraguas del posentrenamiento
El posentrenamiento, o post-training, es un nombre amplio para el trabajo que llega después de construir la base. No es un algoritmo concreto. Puede incluir un ajuste fino supervisado con ejemplos de instrucciones y respuestas, pero también comparaciones entre varias respuestas, aprendizaje por refuerzo, recompensas que un verificador puede comprobar y evaluaciones repetidas.
Las comparaciones permiten enseñar algo que una única respuesta correcta no siempre muestra. Ante una duda sobre una tarifa, una persona puede preferir una contestación que reconoce lo que no sabe frente a otra que inventa una regla con gran seguridad. Esa preferencia se puede usar de distintas maneras: mediante un sistema de recompensas y aprendizaje por refuerzo, o mediante métodos directos que acercan el modelo a la respuesta elegida sin ese proceso intermedio.
No todos los laboratorios emplean los mismos pasos, ni tienen por qué seguir el mismo orden. Lo esencial es el solapamiento. El ajuste supervisado de un modelo base es ajuste fino porque adapta una versión existente, y es posentrenamiento porque sucede después de la etapa inicial. Una optimización con preferencias también puede modificar el modelo y formar parte de ese mismo paraguas.
Esto corrige otra idea demasiado cómoda: que el entrenamiento previo aporta conocimientos, el ajuste fino enseña tareas y el posentrenamiento añade buenos modales. Las fronteras reales son menos limpias. El entrenamiento previo también desarrolla capacidades; el ajuste fino puede cambiar el dominio, el formato o las preferencias; y el posentrenamiento puede influir en qué estrategia intenta el modelo, no solo en su tono.
El caso de la aerolínea
Volvamos a la pregunta sobre el vuelo del martes. El modelo base ha visto textos sobre reservas, fechas y reembolsos. Puede producir una respuesta convincente, pero también puede completar un diálogo imaginario o afirmar una condición que no conoce. Su soltura verbal no equivale a un procedimiento fiable de atención al cliente.
Durante un ajuste fino supervisado, el modelo ve buenos ejemplos. Aprende que debe pedir el número de reserva, distinguir una consulta de una confirmación y no fingir que ha cambiado un billete. Ese paso es, a la vez, ajuste fino y una parte del posentrenamiento.
Después pueden compararse varias respuestas. Una reconoce que la tarifa no está disponible en el contexto; otra inventa la norma; una tercera se niega a ayudar sin explicar por qué. Si las comparaciones favorecen la primera, el entrenamiento puede hacer más probable ese patrón de prudencia. Pero la calidad del resultado depende de lo que las personas o los verificadores hayan premiado. Una señal deficiente también se aprende.
Más adelante, una aerolínea concreta podría adaptar el asistente a su vocabulario y a los tipos de solicitudes que recibe. Eso sería otro ajuste fino. En cambio, entregarle la política vigente dentro de la pregunta, o buscarla en un documento en el momento de responder, no suele cambiar sus parámetros. Es información disponible durante esa conversación, no un nuevo entrenamiento.
Y todavía falta una separación crucial. Redactar «he solicitado el cambio» no cambia una reserva. El modelo puede proponer una acción o preparar una petición, pero ejecutar el cambio exige una herramienta externa, permisos adecuados y reglas del producto. El entrenamiento modifica cómo responde el modelo. No le concede por sí solo acceso al sistema de reservas ni autoridad para actuar.
Preguntar qué cambió
Ninguna de estas etapas garantiza que el modelo diga la verdad. Los ejemplos, las preferencias y las recompensas son aproximaciones a lo que queremos. Si una evaluación premia por accidente una mala costumbre, el entrenamiento puede reforzarla. En un experimento con resúmenes, por ejemplo, quienes evaluaban tendían a favorecer fragmentos copiados, y el modelo aprendió precisamente a copiar más.
Una adaptación también puede mejorar el comportamiento buscado y empeorar otro. Puede especializar demasiado el modelo, debilitar una capacidad previa o funcionar bien solo en casos parecidos a los datos de entrenamiento. Por eso no basta con observar que aprende los ejemplos utilizados: hay que comprobar el beneficio esperado y buscar regresiones en situaciones distintas.
Cuando alguien diga que un modelo ha sido «ajustado», conviene mirar más allá de la etiqueta. ¿De qué versión partió? ¿Aprendió con ejemplos, comparaciones o recompensas? ¿Se modificó todo el modelo o solo una pequeña parte? ¿Qué comportamiento se evaluó después? Estas preguntas suelen aclarar más que discutir dónde termina una palabra y empieza la siguiente.
La distinción útil cabe en una frase. El entrenamiento previo construye una base amplia. El ajuste fino adapta algo que ya existe. El posentrenamiento reúne el trabajo posterior que orienta el comportamiento y puede contener varios métodos, incluido el propio ajuste fino. No son tres cajones independientes, sino dos momentos del ciclo de vida y una herramienta que puede aparecer dentro de ese recorrido.
Cierre del Café
Eso es todo por hoy. El café siempre está abierto. Vuelvan pronto.
Fuentes y correcciones
Una producción editorial de Andy's Café.
No separate public source-note page is listed for this episode.
¿Has visto un error, una fuente rota o un problema en la transcripción? Contacta con hello@move37.app.
Ediciones en otros idiomas
The transcript, description and original Andy's Café editorial text are available under CC BY 4.0. Credit Andy's Café, link this canonical page and indicate changes. The composed audio has a two-part rights note because its piano cues are third-party material.