Notas del taller

¿Es una estafa? La IA como segunda opinión

Una IA puede ser una buena segunda opinión ante un mensaje sospechoso – si ve lo que tiene que ver. Por qué una captura de pantalla es mejor que el texto copiado, por qué la IA no debe hacer clic en nada y qué tres preguntas sirven más que «¿Es una estafa?».

Para Practice makes safe (en inglés y alemán), un sitio gratuito para practicar cómo reconocer el phishing y las estafas en línea, mi IA y yo construimos también una página que explica cómo pedirle consejo a una IA. Su núcleo son tres pasos: una captura de pantalla en lugar del enlace, tapar los datos personales, preguntar de forma concreta. Para quien no es especialista es justo lo adecuado – breve y sin jerga.

Aquí explico por qué las reglas son así. Porque cada una tiene que ver con el contexto: con lo que la IA llega a ver y con lo que se le escapa.

Lo que la IA hace bien

Las estafas siguen patrones: prisas, amenazas, un remitente que no encaja con el nombre, un enlace que lleva a otro sitio del que dice. Los modelos de lenguaje suelen reconocer bien esos patrones cuando están a la vista. Están disponibles a cualquier hora, no se impacientan y explican en lugar de limitarse a advertir.

Lo que sale de ahí, sin embargo, es una valoración, no una comprobación. El modelo solo ve lo que le enseñas. No puede consultar el servidor de correo del remitente, ni mirar tu cuenta, ni llamar a tu banco. Un «parece auténtico» no es, por tanto, una luz verde: cuando hay dinero, contraseñas o acceso remoto de por medio, siempre hace falta una segunda vía.

Captura de pantalla, no texto: lo que hay en el contexto decide la respuesta

Quien copia el texto de un correo y se lo da a la IA copia más de lo que ve: letra blanca sobre fondo blanco, caracteres diminutos, párrafos ocultos. Justo ahí pueden esconderse instrucciones para la IA – los expertos lo llaman inyección de prompts. En 2025, 0DIN mostró cómo se ve eso («Phishing for Gemini»): un texto oculto en un correo llevó a la función de resumen de un asistente de correo a mostrar un aviso de seguridad inventado, con número de teléfono incluido. La persona veía un correo inofensivo; la IA leía un encargo.

Una captura de pantalla, en cambio, contiene casi solo lo que también ve una persona. No es del todo estanca: en octubre de 2025, Brave mostró («Unseeable prompt injections in screenshots») que un navegador con IA leía en una captura instrucciones prácticamente invisibles para las personas, escritas en un azul claro muy pálido sobre fondo amarillo. Aun así, la regla sigue siendo correcta. Reduce el problema; no lo resuelve. Para mí, de eso va lostcontext: lo que hay en el contexto decide la respuesta – aunque nadie lo vea.

Se tapan datos porque la imagen acaba en manos del proveedor de la IA. Tu nombre, los números de cliente y de contrato, el IBAN y la dirección se quedan fuera; el remitente, el asunto, el texto del enlace y aquello que te piden hacer, dentro. Y del problema del contexto sale una regla más: si la propia IA te da un número de teléfono o un enlace «para proteger tu cuenta», justo eso es sospechoso. El número de tu banco está en tu tarjeta, no en la respuesta de un chatbot.

No la dejes hacer clic

Los agentes y navegadores con IA más nuevos no solo leen, también actúan: abren enlaces, rellenan formularios, compran. Guardio lo puso a prueba en agosto de 2025 («Scamlexity»): un navegador con IA compró en una tienda falsa y siguió el enlace de un correo de phishing sin preguntar. Por eso la página de prácticas también dice: no le des el enlace a la IA «solo para comprobarlo». Las decisiones sobre dinero y contraseñas se quedan en manos de las personas – más sobre esto en las salvaguardas para agentes.

Los ayudantes discretos

No toda ayuda es un chat. El bloqueador de scareware de Microsoft Edge reconoce páginas de estafa a pantalla completa – pantallas azules falsas, supuestos bloqueos policiales – con un modelo de imagen en el propio dispositivo, y viene activado de serie en la mayoría de los ordenadores Windows y Mac (blog de Edge, 31 de octubre de 2025). Chrome hace algo parecido contra las estafas de soporte técnico, con Gemini Nano en el dispositivo, aunque solo con la «Protección mejorada» activada (Google, 8 de mayo de 2025). Ambos trabajan en local – un buen ejemplo de «modelo pequeño, encargo claro».

Tres preguntas en lugar de una

«¿Es una estafa?» es la pregunta obvia – y la más débil. Funcionan mejor tres: ¿Qué habla a favor y qué en contra? ¿Qué es lo que no puedes comprobar? ¿Cómo lo compruebo por una vía que ya conozco?

La segunda es la más importante: mete los límites del modelo en la respuesta en lugar de esconderlos. La tercera saca la conversación del chat – a la app del banco, al número de la tarjeta, al seguimiento del paquete que abres tú mismo.

Practicar, no solo preguntar

Una IA como segunda opinión está bien. Mejor aún es conocer los patrones por uno mismo antes de que llegue el próximo mensaje. Para eso está Practice makes safe (en inglés): un buzón simulado, un móvil simulado, ventanas de aviso y llamadas para practicar sin riesgo – y, en la página «Asking AI for advice», plantillas para copiar que hacen justo estas preguntas.

/compact – lo esencial cuando el contexto escasea:

Una IA puede ser una buena segunda opinión ante un mensaje sospechoso: reconoce patrones como las prisas, los remitentes falsos y los enlaces ajenos, y los explica. Pero su respuesta es una valoración, no una luz verde, porque solo ve lo que le enseñas. El texto copiado puede llevar instrucciones ocultas para la IA (inyección de prompts), así que mejor una captura de pantalla que el texto o el enlace – eso reduce el problema, pero no lo resuelve. No dejes que agentes ni navegadores con IA hagan clic en nada; el dinero y las contraseñas se quedan en manos de las personas. En lugar de «¿Es una estafa?», haz tres preguntas: ¿Qué habla a favor y qué en contra? ¿Qué no puedes comprobar? ¿Cómo lo compruebo por una vía que ya conozco?

Se ha producido un error. Recargar 🗙

Restableciendo la conexión …

No se pudo reconectar – próximo intento en segundos.

No se pudo reconectar.
Inténtalo de nuevo o recarga la página.

El servidor ha pausado la sesión.

No se pudo reanudar la sesión.
Inténtalo de nuevo o recarga la página.