Un GPT a cámara lenta

Esto no es una animación de un modelo de lenguaje – es uno. Un GPT diminuto y completo se ejecuta aquí mismo, en tu navegador, y puedes verlo pensar a cámara lenta: qué ve, a qué atiende, qué espera y cómo todo eso se convierte en texto.

GPT es la sigla de Generative Pre-trained Transformer: preentrenado con mucho texto, generativo, construido como transformer – el tipo de modelo detrás de ChatGPT y compañía (más en el glosario).

Qué ves

Un mini-GPT (159.488 parámetros, entrenado solo con los artículos en alemán e inglés de este sitio): su ventana de contexto como tira de caracteres, su atención (attention) como arcos, su expectativa como barras de probabilidad – y el bucle que escribe.

Qué demuestra

Cómo trabaja de verdad un modelo de lenguaje: leer → ponderar (atención) → formar una distribución → elegir UN carácter → vuelta a empezar. Exactamente la maquinaria de los grandes, solo que mucho más pequeña.

1 · Lo que ve – la ventana de contexto

– el texto más antiguo se desliza fuera, exactamente igual que en el laboratorio de la ventana de contexto.

2 · A qué atiende – la atención

Capa Cabeza

La atención – en inglés, attention – hace honor a su nombre: así pondera el modelo qué partes del texto son importantes entre sí (glosario). Los arcos son las ocho miradas más fuertes del último carácter hacia atrás en el texto; la coloración es relativa al punto más fuerte. Cada par capa/cabeza atiende de forma distinta – haz clic y compara.

Así ve el modelo «»: – 64 números: su embedding, el carácter traducido a matemáticas

3 · Lo que espera – la distribución

    0,8 deforma las probabilidades – el laboratorio del dado gira justo en torno a este regulador

    Haz clic en una barra para tomar exactamente ese carácter – o deja que decida el dado:

    4 · Y sigue – el bucle

    Toca los números

    Atención del último carácter (capa/cabeza elegidas):

    Top 5 con logits en bruto – las puntuaciones antes de que el softmax las convierta en probabilidades:

    Sin JavaScript esta página no puede ejecutar el modelo – pero estos números son reales, registrados al exportar: tras el comienzo «Der Kontext » (en alemán) el modelo espera:

    Caracteres siguientes más probables
    k 30,4 %
    u 9,3 %
    i 8,9 %
    d 7,7 %
    a 7,0 %

    Lo que se ejecuta aquí – y lo que no

    • Un transformer de verdad (arquitectura GPT-2) con exactamente 159.488 parámetros – los mandos de ajuste que el entrenamiento calibra (glosario). Para situarlo: GPT-2 (2019) tenía 1.500 millones; los modelos punteros de hoy, un múltiplo de eso.
    • Entrenado exclusivamente con los artículos en alemán e inglés de este sitio web: 26 textos (116.493 caracteres) para el entrenamiento, dos más reservados como material de prueba nunca visto. Las versiones en español están naciendo justo ahora y no forman parte del entrenamiento. Lo que no estaba ahí no existe para él – los datos de entrenamiento lo deciden todo.
    • Lee caracteres sueltos; los grandes leen trozos de palabras (tokens) – la misma mecánica, otro tamaño de grano.
    • Espera sinsentidos que suenan a alemán (y a inglés): palabras inventadas, hilos perdidos. Hasta el idioma se le puede escapar – para el modelo, el alemán y el inglés no son más que patrones de caracteres; los grandes mantienen el rumbo porque la escala y el contexto largo los estabilizan. A este tamaño eso no es una avería, sino mecánica de patrones en estado bruto – antes de que la escala la vuelva elocuente.
    Bajo el capó

    Arquitectura: 3 bloques transformer × 4 cabezas de atención, anchura del modelo 64, contexto de 64 caracteres, vocabulario de 83 caracteres, unembedding ligado (tied). El núcleo de cada bloque:

    Attention(Q, K, V) = softmax(Q·KT / √dk) · V

    Q, K y V son tres vistas aprendidas de cada carácter – traducido libremente: ¿qué busco? (Q), ¿qué ofrezco? (K), ¿qué transmito? (V). El softmax convierte esas coincidencias exactamente en los pesos que arriba se ven como arcos.

    Lo que los grandes hacen distinto: tokens de trozos de palabra en vez de caracteres, muchos más bloques, cabezas y anchura, detalles refinados (codificación posicional, normalización) – y sobre todo el pulido final que lo convierte en asistente (entrenamiento con instrucciones y RLHF, es decir, afinado con feedback humano) más un corpus de entrenamiento del tamaño de internet en vez de 28 artículos.

    ¿Y por qué aquí, aun así, caracteres? Por la cantidad de datos: los artículos dan más de 100.000 ejemplos de entrenamiento para 83 caracteres – como trozos de palabra quedarían solo unos 40.000 para miles de trozos distintos, que apenas se han visto. A este tamaño los caracteres son la estadística más nutrida, y además ves al modelo construir palabras.

    Entrenado el 12 de julio de 2026 con un entrenador en C# escrito a medida; las ventanas de entrenamiento se mantienen dentro de un mismo artículo (límites de documento, como en los grandes), y los gradientes se verificaron antes del entrenamiento contra derivadas numéricas. Autocomprobación (navegador vs. entrenamiento): se ejecuta tras la carga

    Adónde seguir desde aquí: por qué la misma máquina saca respuestas distintas a golpe de dado lo muestra el laboratorio del dado; cómo son los bocaditos de lectura de los grandes, el laboratorio de tokens; y los términos que hay detrás los explica el glosario.

    Se ha producido un error. Recargar 🗙

    Restableciendo la conexión …

    No se pudo reconectar – próximo intento en segundos.

    No se pudo reconectar.
    Inténtalo de nuevo o recarga la página.

    El servidor ha pausado la sesión.

    No se pudo reanudar la sesión.
    Inténtalo de nuevo o recarga la página.