Noticias 4 min de lectura

Marcas de agua invisibles en LLMs: cómo funciona el cripto-etiquetado de texto de OpenAI y Anthropic

Líneas de texto digital con una marca de agua traslúcida y brillante bajo el AI Act Europa

OpenAI y Anthropic han comenzado a desplegar de manera silenciosa marcas de agua invisibles en los textos generados por sus modelos en territorio europeo. Este movimiento no es una decisión comercial de branding, sino una respuesta técnica directa a las exigencias de transparencia de la Ley de Inteligencia Artificial de la Unión Europea (AI Act). Como profesionales de ciberseguridad, gobernanza y sistemas, necesitamos entender cómo funciona esta tecnología bajo el capó y qué impacto real tiene en nuestros entornos corporativos.

La matemática detrás de la marca de agua criptográfica en textos

A diferencia de una imagen, donde se pueden ocultar bits de información en los píxeles menos significativos (esteganografía), el texto plano carece de este margen de maniobra. En su lugar, el marcado de agua de LLMs (Large Language Models) se realiza alterando ligeramente la distribución de probabilidad de los tokens durante la generación de texto.

Cuando un modelo como GPT-4o o Claude 3.5 Sonnet predice el siguiente token, genera un listado de candidatos con diferentes probabilidades (logits). El algoritmo de marcado de agua utiliza una función hash pseudoaleatoria basada en una clave secreta del proveedor y el contexto de los tokens anteriores para clasificar las palabras candidatas en dos listas conceptuales: "verdes" (permitidas con mayor probabilidad) y "rojos" (restringidos). Al forzar sutilmente al modelo a elegir tokens de la lista verde, se introduce un sesgo estadístico imperceptible para el lector humano. Para verificar si un texto es sintético, el proveedor o una API de auditoría autorizada analiza si la proporción de tokens "verdes" en el texto bajo análisis supera de forma anómala lo estadísticamente probable en la escritura humana tradicional.

Cumplimiento del AI Act y auditoría de datos

Este sistema responde directamente a las obligaciones de transparencia de la Ley de IA europea. Las organizaciones que utilicen estos modelos de forma integrada mediante API o interfaces web se enfrentarán ahora a textos que llevan incorporada esta firma matemática. Esto tiene implicaciones directas en el cumplimiento y la gestión del riesgo tecnológico en la empresa.

Desde la perspectiva de la gobernanza de datos y marcos como ISO 27001 o el NIST AI RMF, estas marcas de agua abren la puerta a herramientas de auditoría interna capaces de detectar el uso no autorizado de IA generativa (Shadow AI) en la documentación de la compañía o en código fuente desarrollado por terceros. Si un proveedor afirma que sus entregables han sido creados de forma puramente manual, el análisis de marcas de agua permitirá contrastar esta afirmación con un nivel de confianza estadística muy elevado.

Limitaciones técnicas y vectores de elusión

No debemos tratar estas firmas como un mecanismo de seguridad infalible o inmutable. Al tratarse de una huella estadística, la marca de agua es susceptible de degradarse o destruirse por completo mediante técnicas sencillas de manipulación del texto.

Acciones comunes como la paráfrasis manual, la traducción del texto a otro idioma y su posterior retorno al original, o el uso de un modelo local de código abierto (como Llama 3) para reescribir la salida, rompen la secuencia de tokens "verdes" predichos por la clave del proveedor emisor. Del mismo modo, la inserción de texto sintético en fragmentos más pequeños o su mezcla intensiva con redacción humana diluye la muestra estadística por debajo del umbral de detección fiable.

Qué debemos implementar en nuestras infraestructuras corporativas

En lugar de confiar ciegamente en la autoría del texto, las áreas de seguridad y sistemas deben adoptar un enfoque pragmático:

Primero, evaluar las APIs de detección de los proveedores oficiales (OpenAI y Anthropic) en cuanto estén disponibles para su integración en nuestros pipelines de ingesta de datos y Git workflows. Esto facilitará un pre-filtrado automatizado de entregables.

Segundo, actualizar las políticas de seguridad de la información para reflejar que la procedencia del texto generado por IA ahora es, en teoría, rastreable. Cualquier fuga de propiedad intelectual o datos confidenciales a través de estas plataformas no solo estará registrada en los logs del proveedor, sino que el documento resultante llevará consigo la marca criptográfica de su origen.

Fuentes

Comentarios