Un GPT a cámara lenta
Esto no es una animación de un modelo de lenguaje – es uno. Un GPT diminuto y completo se ejecuta aquí mismo, en tu navegador, y puedes verlo pensar a cámara lenta: qué ve, a qué atiende, qué espera y cómo todo eso se convierte en texto.
GPT es la sigla de Generative Pre-trained Transformer: preentrenado con mucho texto, generativo, construido como transformer – el tipo de modelo detrás de ChatGPT y compañía (más en el glosario).
Qué ves
Un mini-GPT (159.488 parámetros, entrenado solo con los artículos en alemán e inglés de este sitio): su ventana de contexto como tira de caracteres, su atención (attention) como arcos, su expectativa como barras de probabilidad – y el bucle que escribe.
Qué demuestra
Cómo trabaja de verdad un modelo de lenguaje: leer → ponderar (atención) → formar una distribución → elegir UN carácter → vuelta a empezar. Exactamente la maquinaria de los grandes, solo que mucho más pequeña.
1 · Lo que ve – la ventana de contexto
2 · A qué atiende – la atención
La atención – en inglés, attention – hace honor a su nombre: así pondera el modelo qué partes del texto son importantes entre sí (glosario). Los arcos son las ocho miradas más fuertes del último carácter hacia atrás en el texto; la coloración es relativa al punto más fuerte. Cada par capa/cabeza atiende de forma distinta – haz clic y compara.
3 · Lo que espera – la distribución
Haz clic en una barra para tomar exactamente ese carácter – o deja que decida el dado:
4 · Y sigue – el bucle
Toca los números
Atención del último carácter (capa/cabeza elegidas):
Top 5 con logits en bruto – las puntuaciones antes de que el softmax las convierta en probabilidades:
Sin JavaScript esta página no puede ejecutar el modelo – pero estos números son reales, registrados al exportar: tras el comienzo «Der Kontext » (en alemán) el modelo espera:
| k | 30,4 % | |
| u | 9,3 % | |
| i | 8,9 % | |
| d | 7,7 % | |
| a | 7,0 % |
Lo que se ejecuta aquí – y lo que no
- Un transformer de verdad (arquitectura GPT-2) con exactamente 159.488 parámetros – los mandos de ajuste que el entrenamiento calibra (glosario). Para situarlo: GPT-2 (2019) tenía 1.500 millones; los modelos punteros de hoy, un múltiplo de eso.
- Entrenado exclusivamente con los artículos en alemán e inglés de este sitio web: 26 textos (116.493 caracteres) para el entrenamiento, dos más reservados como material de prueba nunca visto. Las versiones en español están naciendo justo ahora y no forman parte del entrenamiento. Lo que no estaba ahí no existe para él – los datos de entrenamiento lo deciden todo.
- Lee caracteres sueltos; los grandes leen trozos de palabras (tokens) – la misma mecánica, otro tamaño de grano.
- Espera sinsentidos que suenan a alemán (y a inglés): palabras inventadas, hilos perdidos. Hasta el idioma se le puede escapar – para el modelo, el alemán y el inglés no son más que patrones de caracteres; los grandes mantienen el rumbo porque la escala y el contexto largo los estabilizan. A este tamaño eso no es una avería, sino mecánica de patrones en estado bruto – antes de que la escala la vuelva elocuente.
Bajo el capó
Arquitectura: 3 bloques transformer × 4 cabezas de atención, anchura del modelo 64, contexto de 64 caracteres, vocabulario de 83 caracteres, unembedding ligado (tied). El núcleo de cada bloque:
Attention(Q, K, V) = softmax(Q·KT / √dk) · V
Q, K y V son tres vistas aprendidas de cada carácter – traducido libremente: ¿qué busco? (Q), ¿qué ofrezco? (K), ¿qué transmito? (V). El softmax convierte esas coincidencias exactamente en los pesos que arriba se ven como arcos.
Lo que los grandes hacen distinto: tokens de trozos de palabra en vez de caracteres, muchos más bloques, cabezas y anchura, detalles refinados (codificación posicional, normalización) – y sobre todo el pulido final que lo convierte en asistente (entrenamiento con instrucciones y RLHF, es decir, afinado con feedback humano) más un corpus de entrenamiento del tamaño de internet en vez de 28 artículos.
¿Y por qué aquí, aun así, caracteres? Por la cantidad de datos: los artículos dan más de 100.000 ejemplos de entrenamiento para 83 caracteres – como trozos de palabra quedarían solo unos 40.000 para miles de trozos distintos, que apenas se han visto. A este tamaño los caracteres son la estadística más nutrida, y además ves al modelo construir palabras.
Adónde seguir desde aquí: por qué la misma máquina saca respuestas distintas a golpe de dado lo muestra el laboratorio del dado; cómo son los bocaditos de lectura de los grandes, el laboratorio de tokens; y los términos que hay detrás los explica el glosario.