Qué es, cómo funciona y cómo borrar el watermark de SynthID: la marca de agua de Claude y Google
En julio de 2024 di una charla en SEOPLUS (ver vídeo aquí) titulada "Técnicas y retos actuales en la detección de contenidos generados por IA", donde demostré que no existe protección contra el contenido generado por Inteligencia Artifical. Enseñé cómo engañar a detectores de imágenes con IA con un blend al 4% de una foto de arena de mi playa, cómo falsificar el estándar C2PA con un certificado autofirmado, cómo quitar el SynthID de una imagen de Imagen (Google) regenerándola con difusión, cómo un texto marcado con el watermark de Kirchenbauer dejaba de estarlo al parafrasearlo con otro modelo, etc.
Dos años después, Anthropic anuncia que Claude va a llevar marca de agua en los textos que genere, y en menos de 24 horas aparecen decenas de repos, "skills" y webs que prometen quitarla. Leo cosas como que "se elimina con un regex", que "son caracteres Unicode invisibles", que "Claude te rastrea", que "OpenAI ya lo hacía", que ahora "Google te va a penalizar"… en fin, ruido por todos lados y clientes asustados contactándome para ver que hacemos ahora con los textos que generamos con Claude.
Este artículo es para separar lo que se sabe realmente de lo te dicen 4 frikis que buscan atención en LinkedIn. Veremos cómo funciona de verdad el watermarking (spoiler: es SynthID-Text, la de Google), por qué las herramientas y skills de moda no la tocan, qué es lo único que la rompe científicamente y te lo voy a demostrar con una serie de experimentos.
Antes de nada, una marca de agua o watermark en textos de IA es un sesgo estadístico invisible que altera sutilmente qué palabras elige el modelo al generar contenido, sin añadir caracteres ocultos ni metadatos. Esta marca estadística permite detectar mediante una herramienta (o API) que un texto ha sido generado por inteligencia artificial.
Anthropic explica que su marca de agua es una versión del método SynthID-Text que Google DeepMind publicó en Nature en 2024, y que pertenece a la familia de técnicas que arranca con la propuesta de Scott Aaronson de 2022 (super fan de este tío). La misma técnica que Google lleva usando en la app de Gemini desde 2024.
¡No hay caracteres ocultos! No se añade nada al texto, no hay caracteres escondidos. La marca es estadística, por lo que vive en qué palabras elige el modelo y no en bytes añadidos a posteriori.
No identifica al usuario, lo digo porque hay gente cancelando Claude por este motivo... Según Anthropic, la marca no lleva información identificativa y no puede rastrearse hasta una persona, una organización o una conversación concretas.
Solo se añadirá a modelos nuevos, por ahora. La marca la llevarán los modelos futuros y los lanzados antes del 2 de agosto de 2026 tienen periodo de transición y se irán añadiendo en los próximos meses. Según las release notes, a día de hoy no se ha lanzado ningún modelo después de esa fecha (Opus 5 es del 24 de julio). Es decir, que hoy ningún texto de Claude en producción lleva la marca, y nadie fuera de Anthropic puede comprobarlo.
No hay detector todavía. Anuncian una API de detección para pronto y dicen que aún están cerrando los detalles. Sin API ni clave, ninguna herramienta puede afirmar que "borra" la marca de Claude, porque no puede medirla.
Se aplica en todo el mundo, también fuera de la UE, porque según ellos todavía no tienen una forma fiable de limitarla por región y en todas las superficies: API, claude.ai, Claude Code y AWS/Google Cloud/Microsoft Foundry.
Anthropic reconoce sus límites, que son archiconocidos si estas en el mundillo: no funciona bien en textos cortos, es más escasa en pasajes factuales, el código lleva en general menos marca, un texto humano corregido por Claude casi no la lleva, y una reescritura completa en la que se sustituya cada palabra la elimina. Las traducciones hechas por Claude sí la llevan.
El motivo es básicamente regulatorio: el Código de Prácticas sobre transparencia de contenido generado por IA del AI Act, que Anthropic firmó en julio junto a Google, Meta, Microsoft, Mistral y OpenAI (xAI no). El artículo 50 aplica desde el 2 de agosto de 2026; los sistemas ya en el mercado tienen hasta el 2 de diciembre. Ojo al detalle: el Código pide marcar el texto libre de más de 200 tokens; los textos muy cortos quedan fuera.
Y para las imágenes y ficheros (.png, .jpg, .svg), Anthropic usa C2PA en lugar de una marca de agua: exactamente el estándar que también rompí en 2024. Volveremos a esto.
2. Por qué lo hacen y por qué importa detectar contenido de IA
Lo hacen porque la ley les obliga
El artículo 50 del AI Act exige a los proveedores de IA generativa marcar sus salidas en un formato legible por máquina y detectable como generado artificialmente, y se aplica desde el 2 de agosto de 2026 (con prórroga hasta el 2 de diciembre para los sistemas ya en el mercado). Para concretar el "cómo", la Comisión promovió un Código de Prácticas voluntario que en julio firmaron unas 190 organizaciones, entre ellas Anthropic, Google, Meta, Microsoft, Mistral y OpenAI (lista); xAI no lo firmó, pero el artículo 50 le aplica igual. El Código pide watermark para texto libre de más de 200 tokens y un detector gratuito para investigadores, medios y reguladores; las multas llegan a 15 millones de euros o el 3 % de la facturación. Google ya lo hacía en la app de Gemini desde 2024 (no en la API); OpenAI marca imágenes y audio pero no texto; Anthropic ha decidido aplicarlo en todo el mundo porque no sabe hacerlo solo para la UE. Ese es el "por qué ahora".
Por qué importa, más allá de la ley
En la charla del SEOPLUS empecé por aquí (ver slides), porque para mi esto es lo más importante. Hay al menos diez frentes en los que la falta de trazabilidad del contenido generado por IA hace daño: la desinformación que se fabrica y difunde a escala; la propiedad intelectual de quienes escribieron lo que los modelos regurgitan; la ciberseguridad (el phishing ahora lo escribe un modelo en tu idioma y con tu tono); la integridad electoral y la seguridad nacional (declaraciones y documentos falsos verosímiles); la veracidad académica y periodística; la privacidad y la dignidad de las víctimas de deepfakes; la credibilidad y la confianza pública en medios e instituciones, que se erosiona cuando no se puede distinguir lo auténtico; la competencia leal (reseñas y opiniones falsas); y el control de calidad de lo que se publica.
Por qué importa especialmente a buscadores y modelos
Este es el punto que más nos toca a los SEO. Ricardo Baeza-Yates explicó en 2018 ("Bias on the Web", Communications of the ACM) cómo el sesgo de presentación de un buscador crea una cascada: los resultados de arriba reciben más clics, eso refuerza su prominencia, la gente se informa con ellos y produce contenido a partir de ellos, y ese contenido vuelve a entrar al índice y amplifica el sesgo original.
Natzir Turrado hablando de Bias on the Web, en SEOPLUS. Foto de Juan González, fuente: X (Twitter)
Los buscadores mitigan la cascada con explore and exploit (mostrar aleatoriamente cosas nuevas para evaluarlas) y con señales tipo information gain (premiar lo que aporta información nueva). Con la IA generativa el bucle se acelera de forma que si un LLM o un buscador aprende de contenido generado por otro LLM (que a su vez es un refrito del top 10), replica y amplifica los sesgos y la calidad se degrada (es el "colapso de modelo" que Shumailov et al. publicaron en Nature en 2024).
Por eso a Google le interesa saber qué contenido es sintético antes de rankearlo o de entrenar con él, aunque su discurso público sea otro. Desde febrero de 2023 Google dice que premia la calidad se produzca como se produzca, que usar IA no da ninguna ventaja especial (es solo contenido) y que usar automatización con el fin principal de manipular el ranking es spam; en marzo de 2024 convirtió eso en la política de scaled content abuse, que aplica sea cual sea la forma de producir el contenido.
El mismo día vi que metió en las Quality Rater Guidelines el ejemplo de un sitio cuyos términos de uso avisan de que "algunos artículos" los genera una IA y pueden tener errores o estar desactualizados, con la instrucción de considerar el sitio no fiable y de E-E-A-T mínimo.
En enero de 2025 añadió la definición de effort (hasta qué punto una persona ha trabajado activamente para crear un contenido satisfactorio) y la regla de que el contenido generado automáticamente o con IA con poco esfuerzo, poca originalidad y poco valor añadido es Lowest. Y en el leak del Content Warehouse de mayo de 2024 aparecen un racterScores, descrito como una puntuación de clasificación de contenido artificial (AGC) a nivel de sitio (lo descubrió Juan González Villa), y un contentEffort, una estimación del esfuerzo de los artículos calculada por un LLM, dentro de las señales comprimidas que pueden usarse en la puntuación preliminar.
Y en el Search Central Live Deep Dive de Bangkok (julio de 2025) Gary Illyes dijo, según la crónica de Search Engine Journal, que sus algoritmos se entrenan con el contenido de mayor calidad del índice, que es claramente humano: las señales de ranking basadas en machine learning se entrenan con contenido hecho por humanos para humanos, y por eso entienden y promueven mejor el contenido natural. Dos semanas después matizó que la palabra correcta no es "creado" sino "curado" por humanos, y admitió el bucle de que el entrenamiento de modelos tiene que aprender a excluir el contenido generado por IA o acabas en un bucle de entrenamiento. Ese bucle es la cascada con esteroides de la que nos advirtió Baeza-Yates.
3. Cómo funciona SynthID-Text
Un LLM genera un token cada vez y en cada paso tiene una distribución de probabilidad sobre el vocabulario. Cuando varias opciones son casi igual de buenas ("nublado" o "gris"), el modelo lanza un dado. La marca de agua cambia el dado, no las opciones.
Se toman los 4 tokens anteriores (H = 4 según el paper; ngram_len = 5 según el código) y se hashean junto con una clave secreta. Ese hash siembra un generador pseudoaleatorio.
Con esa semilla, cada token candidato recibe un valor aleatorio ("g-value", un 0 o un 1) en cada una de m capas (30 por defecto).
Se muestrean varios candidatos de la distribución del modelo y se hace un torneo: en cada capa gana el que tiene g-value más alto. El ganador del torneo es el siguiente token.
Resultado: los tokens elegidos tienden a tener g-values altos bajo esa clave y ese contexto. Quien tenga la clave recorre el texto, recalcula los g-values de cada token dado sus 4 anteriores y comprueba si la media se aleja de 0,5. En texto sin marca la media es 0,5 (moneda al aire); en texto marcado sube. Con 300 tokens y 30 capas, la desviación típica de esa media bajo la hipótesis nula es minúscula, así que basta un pequeño sesgo para que el z-score se dispare. Google además entrena un detector bayesiano por clave que aprovecha mejor la señal que la media simple.
Esto tiene 3 consecuencias que explican todo lo que viene después:
La marca vive en la elección de tokens en contextos de 4 tokens. Si cambias suficientes palabras, los contextos ya no son los que vio el modelo y los g-values recalculados vuelven a ser aleatorios. Da igual el idioma, la longitud o el editor: si las palabras son las de Claude, la marca está; si no, no está.
La marca solo puede vivir donde hay entropía. Si la siguiente palabra es obligatoria ("Principia … Mathematica", 2 + 2 = 4), no hay elección y no hay marca. Por eso el código y los datos factuales van casi sin marcar. Y por eso los modelos grandes y muy alineados, que están más seguros de cada token, llevan una marca más débil, cosa que el propio paper de Nature admite.
SynthID-Text es "no distorsivo por secuencia" (single-sequence non-distortionary): en promedio sobre la clave, la distribución de una respuesta es la del modelo original. Pero el propio suplemento del paper reconoce que entre respuestas al mismo prompt la diversidad baja, y que ese sesgo repetido es justamente lo que un atacante puede usar para "robar" la marca. Lo medí, y te lo cuento en la sección 7 de este post.
4. Por qué las skills y tools que prometen quitar el watermark no lo hacen
Desde el anuncio han ido apareciendo, a un ritmo de varias al día, herramientas que prometen limpiar o quitar la marca de Claude como skills para Claude Code, Cursor o Codex, plugins de WordPress, scripts de Python y webs donde pegas el texto y te lo devuelven "limpio". Mirando qué hacen por dentro, las podemos clasificar en los siguientes 3 tipos:
Las que limpian lo que no es la marca, que quitan caracteres Unicode invisibles (zero-width spaces, marcas bidi, espacios raros), los atributos HTML que dejan los editores al pegar desde el chat (data-start, data-end y similares), UTMs, JSON-LD, metadatos EXIF/IPTC/XMP de las imágenes e incluso el manifest C2PA de un fichero. Vamos, de primero de hacking... Todo eso existe y tiene sentido limpiarlo por higiene, pero no tiene nada que ver con una marca estadística que vive en qué palabras eligió el modelo. Por suerte, hay algunas de estas herramientas que son honestas y dicen, aunque sea en la letra pequeña, que no garantizan nada frente a detectores ni borran SynthID, el problema es que se comparten como si lo hicieran.
Las que reescriben con otro modelo, que pasan el texto por un modelo local o por una API y te devuelven una paráfrasis... algunas lo venden como "ataque a la capa estadística". Pero es una paráfrasis normal y corriente que te cambia el texto, degrada lo que escribiste y, lo importante, nadie puede medir si funciona contra Claude porque no hay detector ni clave.
Las webs de reescritura completa, que regeneran el texto entero y lo adornan con "puntuaciones" de detectores de IA convencionales. Es el caso anterior con peor trazabilidad ya que la puntuación que enseñan no tiene nada que ver con la marca, mide parecido estilístico con texto de IA.
Es decir, que la capa Unicode no toca la marca por construcción, la capa de reescritura es el ataque de paráfrasis de toda la vida que nadie puede verificar contra Claude y ninguna de las dos cosas necesita una skill.
Para curiosos, el mito del Unicode viene de que en abril de 2025 se detectaron espacios U+202F (el narrow no-break space) en salidas de o3/o4-mini y OpenAI dijo que era una rareza del entrenamiento por refuerzo, no una marca. Desde entonces el "caracteres raros = watermark" me parece que se quedó en el imaginario colectivo...
Resumen de mitos que he visto estos días:
Afirmación
Realidad
"Se quita con un regex / pegando en Notepad"
Falso. No hay caracteres añadidos.
"Claude te rastrea con la marca"
Falso. La marca no lleva información de usuario. (Otra cosa es que técnicamente nada impida derivar claves por cliente en el futuro.)
"Ya está activa en todo lo que escribe Claude desde el 2 de agosto"
Falso. Solo modelos posteriores al 2 de agosto, y no hay ninguno.
"OpenAI ya marca el texto"
Falso. Su página de procedencia cubre imágenes y audio; el texto lo dejan como objetivo futuro.
"Google marca todo el texto de Gemini"
Parcial. La app sí desde 2024. La API, según Google en su foro, no.
"Google va a penalizar el contenido con marca"
Sin base: nadie sin la clave puede detectarla, y no hay API.
"Reduce la calidad/creatividad"
Especulativo: hay matices reales (sección 7), pero no es lo que se está diciendo.
"Basta reescribir con otra IA"
Cierto en el fondo, pero con matices de cuánto reescribir y con qué. Es precisamente de lo que va el resto del artículo.
"Editar el texto conserva la marca"
Con matices. Una edición ligera (corregir, quitar frases) la conserva casi entera: en mi experimento, borrar el 30 % de las palabras deja detectables el 41 % de los textos de 300 tokens en inglés, el 62 % en español y el 80 % de los de 1.000 tokens (con un generador de 1,5B, cuya marca es más fuerte, el 72 %, 92 % y 100 %). Pero la marca no es todo-o-nada: decae en proporción a las ventanas de 5 tokens que cambias (correlación 0,78 sobre 670 textos atacados), así que cuanto más edites, menos queda.
"Solo una reescritura completa la borra"
Falso tal cual. No hace falta reescribir palabra por palabra a mano: una paráfrasis normal con un modelo abierto de 8B (que conserva el sentido, similitud 0,84-0,87) o una traducción ida y vuelta por un idioma lejano bastan. Lo que sí es cierto es que una edición humana ligera no la quita.
5. Qué métodos SÍ rompen la marca de agua de Claude y Google
Scott Aaronson (OpenAI), el inventor de la familia, escribió en noviembre de 2022 que si usas otra IA para parafrasear la salida de GPT, no iban a poder detectarlo. Sadasivan et al. (2023), que ya cité en la charla, formalizaron que un parafraseador ligero o una traducción de ida y vuelta basta. Y Zhang, Barak et al., "Watermarks in the Sand" (ICML 2024) demostraron que ningún watermark fuerte es posible si el atacante tiene un oráculo de calidad (un modelo que juzgue) y un oráculo de perturbación (un modelo que reescriba trozos). Es decir, que la robustez de una marca de texto es, como mucho, una cuestión de coste.
Natzir Turrado hablando de técnicas para borrar el watermarking en SEOPLUS. Foto de digitalDotSL, fuente: X (Twitter)
Ahora además existe evidencia específica sobre SynthID-Text y sobre los ataques más eficientes:
El propio paper de Nature (SI, Fig. C3): tras parafrasear con Gemini Ultra, el AUC del detector cae a ≈0,55-0,65 para textos de 100 a 1.000 tokens; hace falta irse a decenas de miles de tokens para recuperarlo. Los propios autores califican el ataque de paráfrasis de bastante fuerte.
ETH Zürich, "Probing SynthID-Text" (dic. 2024): con un parafraseador off-the-shelf (DIPPER) la tasa de eliminación en SynthID-Text supera el 90%, frente a ~2% en los esquemas rojo-verde más fuertes. Su conclusión es que SynthID es más difícil de suplantar (spoofing 4%) pero más fácil de borrar que otros esquemas punteros para un adversario ingenuo. También demostraron que se puede detectar que un modelo lleva la marca sin tener la clave, por unos 3 pavos de queries (Gloaguen et al., ICLR 2025).
Han et al. (2025) concluyen que SynthID-Text es vulnerable a los ataques que conservan el significado como paráfrasis, copiar y pegar fragmentos y traducción de ida y vuelta.
Diaa, Aremu y Lukas (ICML 2025): con menos de 7 horas de GPU (menos de 10$) afinan un parafraseador pequeño que evade más del 96% contra todos los esquemas probados, SynthID incluido, sin degradar la calidad.
Tamim y Khan (jul. 2026): 846 paráfrasis; KGW y Unigram pierden la marca el 100% de las veces, SynthID-Text el 98,3%. El mismo título del paper ya dice que la evidencia de las marcas de agua no está lista para uso forense. Ya expliqué en SEOPLUS los peligros de esto para cometer crímenes.
He et al. (ACL 2024) mostraron el ataque de idioma pivote (aka: traducir a chino y volver) bajando el AUC a 0,54-0,67 en varios esquemas; Al Ghanim et al. (2025) que los ataques asimétricos entre lenguas lejanas son peores para el defensor. Y recuerda, que si traduces con Claude, la traducción llevará marca, por lo que tiene que ser otro modelo.
Pasas el texto marcado por un modelo pequeño (Llama-3 3B les vale) y calculas la auto-información de cada token.
Enmascaras los que superan un percentil (por defecto el 30: se tapa el 70% del texto, ojo) dejando huecos _.
Le pides al mismo modelo una paráfrasis normal como "referencia" y luego que rellene los huecos con la información de la referencia sin copiar sus expresiones.
Resultado: casi 100% de éxito contra siete esquemas (KGW, Unigram, UPV, EWD, DIP, SIR y EXP; este último es el de Aaronson, primo hermano de SynthID), mejor que DIPPER y que GPT-4o parafraseando, con mejor perplejidad que el texto original y por 0,88$ por millón de tokens.
¡Eso sí! SIRA no evaluó SynthID-Text (probó EXP, de la misma familia de muestreo), y con el umbral por defecto reescribe el 70% de los tokens, o sea, se acerca bastante a esa "reescritura completa" que Anthropic ya admite que funciona. La aportación es hacerlo barato, dirigido y sin acceso al detector. Su continuación, BIRA (ICML 2026), consigue lo mismo con un sesgo negativo sobre los tokens de alta sorpresa y demuestra que la probabilidad de detección decae exponencialmente con la longitud si reduces un poquito la señal en cada token.
6. El experimento: reproduzco SynthID-Text y lo ataco para romper el watermark
Como nadie puede medir la marca de Claude todavía y SIRA no probó SynthID, he reproducido el mecanismo con una clave propia y me he puesto a atacarlo con todas las técnicas conocidas.
Qué es lo que hice exactamente
Generé texto con un modelo abierto aplicándole SynthID-Text durante la generación. Es un texto de Qwen2.5-7B en el que cada token lo eligió el algoritmo de SynthID-Text (la implementación que Google publicó en el repo google-deepmind/synthid-text y que está integrada en Hugging Face transformers; el modelo corre en MLX y el algoritmo se le enchufa como logits processor), con la configuración del paper (contexto de 4 tokens, 30 capas de torneo, top-k 40, temperatura 1) y una clave que elegí yo. Es el mismo algoritmo que Anthropic dice usar y lo que cambia es el modelo y la clave. Los mismos prompts se generan también sin marca, con la misma semilla, para tener el control.
¿Por qué no con Gemini que ya lleva la marca?
Porque para detectarla hace falta la clave, y sin detección no hay experimento: así que podría parafrasear un texto de la app de Gemini, pero no sabría si la marca sobrevivió o no. Google no publica su clave ni tiene detector público de texto (el suyo cubre imagen, vídeo y audio; y ya vimos que el texto de la API ni siquiera va marcado). Anthropic no tiene API de detección y probablemente ningún modelo marcando aún. Con mi clave, en cambio, puedo medir la marca antes y después de cada ataque.
¿Cómo sé que la marca está y que el detector no se inventa nada?
El detector de SynthID-Text no necesita el modelo, solo la clave: recorre el texto, recalcula los g-values de cada token a partir de sus 4 tokens anteriores y mira si la media se separa de 0,5. Es la puntuación "mean score" del paper convertida a z-score (Google usa además un detector bayesiano por clave, algo más potente, que no monté). Los controles: los textos sin marca dan media 0,500 y ninguna detección en 100 textos; los marcados, ≈0,55 y detección total; secuencias de tokens aleatorias, 0,50. Y un bug involuntario que lo confirma: en Apple Silicon el hashing de la implementación de HF no coincide con el de CPU, así que la primera tirada dio 0,50 en los textos "marcados"; al forzar el cálculo a CPU pasaron a 0,55-0,60 y los no marcados se quedaron en 0,50. Si el detector viera marca donde no la hay (o al revés), ese bug no habría aparecido así.
Los modelos
El "Claude" es Qwen2.5-7B-Instruct (4 bits, vía MLX), un tamaño parecido al Gemma 7B con el que Google hizo los experimentos de Nature. El atacante es Llama-3.1-8B-Instruct (4 bits), otro modelo de otra familia sin la clave, el mismo que usa el paper de SIRA como "SIRA-Small". Todo en un MacBook M1 Pro de 16 GB, sin GPU. Es el escenario realista: alguien con un modelo abierto de gama media. (Antes hice la misma tirada con Qwen2.5-1.5B en los dos papeles; la cito abajo porque enseña algo sobre el tamaño de los modelos.)
Los ataques
El "limpiador Unicode" tal cual lo hacen las skills
Borrar el 30% de las palabras al azar
Paráfrasis con el prompt de SIRA/DIPPER
Traducción ida-vuelta por un idioma cercano y (e) por chino
SIRA con su configuración por defecto (percentil 30 de auto-información, relleno guiado). Umbrales de detección: z ≥ 2,33 (1% de falsos positivos) y el clásico z ≥ 4. Similitud semántica con un sentence-transformer multilingüe para ver cuánto se destroza el texto, y porcentaje de secuencias de 5 tokens del original que sobreviven en el texto atacado, que es donde vive la marca.
Los textos
100 prompts de escritura tipo artículo de blog en inglés de ~250 palabras (las traducciones, sobre los 50 primeros), 40 en español, 20 largos de ~800 palabras y 10 de código y listas factuales. Cada uno con y sin marca. Todo el código está en mi github.
Resultados en inglés, ~300 tokens (n = 100; traducciones sobre 50)
"Detectado" = porcentaje de textos cuyo z-score supera el umbral.
Variante
tokens
media g
z (mediana)
detectado (z ≥ 2,33; 1 % FP)
detectado (z ≥ 4)
similitud
5-gramas que sobreviven
Sin marca (control)
297
0,499
−0,2
0 %
0 %
—
—
Con marca, sin tocar
299
0,547
9,0
100 %
97 %
1,00
100 %
Con marca + "limpiador Unicode" (lo que hacen las skills)
299
0,547
9,0
100 %
97 %
1,00
100 %
Borrar el 30% de las palabras al azar
209
0,513
2,1
41 %
9 %
0,91
29 %
Traducción ida-vuelta EN→ES→EN
309
0,519
3,6
76 %
36 %
0,97
50 %
Traducción ida-vuelta EN→ZH→EN
308
0,505
0,6
16 %
8 %
0,90
14 %
Paráfrasis con otro modelo (Llama 8B)
324
0,503
0,5
5 %
1 %
0,84
8 %
SIRA (máscara del 70 % + relleno guiado)
277
0,503
0,7
4 %
0 %
0,83
8 %
Resultados en español, ~300 tokens (n = 40)
Variante
z (mediana)
detectado (z ≥ 2,33)
detectado (z ≥ 4)
similitud
5-gramas que sobreviven
Sin marca (control)
−0,3
5 % (2 de 40)
0 %
—
—
Con marca, sin tocar
9,0
100 %
100 %
1,00
100 %
Borrar el 30% de las palabras
2,8
62 %
10 %
0,92
39 %
Traducción ida-vuelta ES→EN→ES
3,7
80 %
45 %
0,96
50 %
Traducción ida-vuelta ES→ZH→ES
0,4
2 %
0 %
0,87
11 %
Paráfrasis con otro modelo (Llama 8B)
1,5
38 %
12 %
0,87
21 %
SIRA
1,3
30 %
10 %
0,87
19 %
Textos largos en inglés, ~1.000 tokens (n = 20), y textos de baja entropía (n = 10)
Variante
tokens
z (mediana)
detectado (z ≥ 2,33)
detectado (z ≥ 4)
similitud
Largo, con marca
1.029
14,6
100 %
100 %
1,00
Largo, borrar el 30% de las palabras
710
3,5
80 %
35 %
0,92
Largo, paráfrasis párrafo a párrafo
896
0,3
5 %
0 %
0,75
Largo, SIRA párrafo a párrafo
938
0,3
0 %
0 %
0,79
Código y listas, con marca
285
2,2
40 %
10 %
1,00
Resumen de los hallazgos:
La marca de agua funciona y el detector no se equivoca: z ≈ 9 con 300 tokens y ≈ 15 con 1.000, cero falsos positivos en 100 textos sin marca. En español hubo 2 falsos positivos de 40 al umbral del 1 % (ninguno con z ≥ 4): el z-score analítico asume que cada g-value es una moneda independiente y algún texto muy repetitivo se desvía. Anthropic tendrá que calibrar el umbral con datos reales en vez de fiarse de la fórmula.
Cuanto mejor es el modelo, más débil es la marca. Con Qwen2.5-1.5B como generador la media de g-values era 0,586 (z ≈ 16); con el 7B, 0,547 (z ≈ 9). Es la dependencia de la entropía que se reconoce también en el paper de Nature, ya que un modelo más grande y más seguro de cada palabra deja menos espacio al dado. Claude es mucho más grande y más alineado que un 7B, así que su marca, a igualdad de configuración, sería más débil todavía, y por eso Anthropic seguramente use más capas, un detector bayesiano y textos más largos.
El "limpiador Unicode" no hace absolutamente nada. Mismo texto y mismo z-score en los 4 conjuntos y en las 2 tiradas. Vamos, que no hay caracteres que limpiar.
Una paráfrasis normal con un modelo abierto de 8B mata la marca en inglés: 5 de 100 textos siguen detectables al 1% (1 con z ≥ 4), conservando el sentido (similitud 0,84). SIRA, 4 de 100 (0 con z ≥ 4). Con Qwen2.5-1.5B como atacante fue incluso más limpio (2% y 0%). Esto quiere decir que contra SynthID a esta longitud, cualquier parafraseador decente basta. La ventaja de SIRA está en esquemas más potentes y en no depender de que el parafraseador acierte por azar. Con Claude, GPT o Gemini como parafraseador solo puede ir a mejor para el atacante. ¡Pero mucho ojo con esto! Gemini hoy, y Claude en cuanto le llegue la marca, te la vuelven a poner al reescribir. Por lo que reescribir Claude con Claude no borra nada, reescribirlo con Gemini cambia la marca de Anthropic por la de Google. La marca señala al último modelo que reescribió el texto por completo, no al autor. Por eso el atacante que se va a usar de verdad es un modelo abierto en local sin marca, que es justo lo que he medido.
En español el parafraseador copia más y la marca aguanta más: con Llama 8B, el 38% de los textos sigue detectable (SIRA 30%), y con Qwen 1,5B el 25%. La diferencia está en el atacante y en español ambos modelos conservan más secuencias de 5 tokens del original (21% y 14%) que en inglés (8% y 2%). En la práctica esto quiere decir que en español no vale cualquier modelo ni cualquier prompt y hay que mirar cuánto texto original queda.
La traducción ida y vuelta por un idioma cercano apenas ataca la marca de marca, y cuanto mejor traduce el modelo, menos la ataca. Llama 8B traduce tan fielmente entre inglés y español que el 50% de las secuencias de 5 tokens vuelven intactas y la marca sobrevive en el 76-80% de los textos (con similitud 0,96-0,97: es prácticamente el mismo texto). Con el 1,5B, más torpe, sobrevivía en el 52%. Pasando por el chino, en cambio, cae al 16% (inglés) y al 2% (español). Es lo que conté en 2024, y ahora sé por fin por qué pasa... resulta que la marca vive en las ventanas de 5 tokens y el porcentaje de ventanas que sobreviven predice el z-score (correlación 0,78 sobre 670 textos atacados; 0,77 en la tirada con el 1,5B).
Editar a mano no la quita del todo, pero con un modelo grande el margen es bastante fino: borrar el 30% de las palabras al azar deja detectables el 41% de los textos de 300 tokens (el 72% con la marca más fuerte del 1,5B), el 62% en español y el 80% de los de 1.000 tokens. La longitud protege al detector frente a ediciones parciales, pero frente a una paráfrasis párrafo a párrafo (295 párrafos, longitud conservada) la marca desaparece en 19 de 20 textos largos.
Código y listas casi no llevan marca con un modelo de 7B: z mediana 2,2; solo el 40% supera el umbral del 1% y el 10% supera z = 4. Con el 1,5B era el 90%. Ninguno de los diez textos (tabla periódica, capitales, funciones de Python, SQL) pasa de z = 5. Es exactamente lo que dice Anthropic del código: donde no hay elección, no hay marca.
Un ejemplo del conjunto en inglés (el relato del farero), para que se vea que la paráfrasis no es "reescribir todo" y que la traducción por español devuelve casi lo mismo:
Original marcado (z = 11,7): "In the rugged cliffs of a windswept island, Keeper Elias sat at his small wooden desk in the lighthouse. The room was dimly lit by the flickering flame that served as a beacon for sailors. His hands, rough from years of work, gingerly opened the envelope that lay on the desk…"
Paráfrasis con Llama 8B (z = −0,1): "On a windswept isle where rugged cliffs stood tall, a lone lighthouse keeper sat at his humble wooden desk, bathed in the soft, golden glow of a flickering flame. The light, a beacon for sailors, cast an otherworldly ambiance within the small room. Before him lay an unassuming envelope…"
Ida y vuelta por español (z = 4,9, sigue detectado): "On the jagged rocks of a wind-battered island, guardian Elias sat at his small wooden desk in the lighthouse. The room was faintly lit by the dancing flames, serving as a lighthouse for sailors. His hard hands, after years of work, carefully opened the letter that lay on the desk…"
Eso sí, tengo que ser honesto con los límites de mi réplica, el "Claude" aquí es es un 7B cuantizado, por lo que no un modelo frontera (que tendría, si acaso, menos entropía y una marca más débil). Anthropic puede usar un detector bayesiano en vez de la media simple y otros parámetros como capas, contexto, umbrales... lo que recupera algo de señal tras un ataque y el relleno de SIRA con estos modelos pequeños a veces pierde sentido (la paráfrasis simple lo conserva mejor). Lo que esto no cambia es el mecanismo, y el mecanismo es lo que se rompe y la propia Anthropic lo resume cuando admite que una reescritura completa elimina la marca.
NOTA: intenté también el "ataque emoji" de Kirchenbauer que mostré en la charla (la pedirle al modelo que meta un 🍌 tras cada palabra y luego borrarlos, que rompe los contextos de 4 tokens sin necesitar segundo modelo y que OpenAI mencionó en el WSJ en 2024). Ni el 1,5B ni el 3B obedecen la instrucción, así que no lo pude medir. Claude sí obedecería, así que este tipo de ataques de sustitución me quedan pendientes para cuando haya detector.
7. Según Anthropic la calidad "no se ve afectada"
Anthropic afirma que la marca no afecta a la calidad de las salidas de Claude y se apoya en el A/B que hizo Google en su IA en producción. Sirvió Gemini con y sin marca a una parte del tráfico (unos 20 millones de respuestas en total) y comparó los pulgares arriba y abajo que dejaron los usuarios. La diferencia fue del 0,01 % en pulgares arriba y del 0,02 % en pulgares abajo, en ambos casos a favor de la marca y sin significación estadística. Pero es un dato de una respuesta cada vez, y hay tres cosas que ese experimento no mide:
Diversidad entre respuestas. En el suplemento del paper de Nature (§G.3) los propios autores reconocen que la no distorsión por secuencia no garantiza la diversidad entre varias respuestas, y que eso puede bajar la calidad de cualquier sistema que genere muchas respuestas y se quede con la mejor. Si haces best-of-N, sampling múltiple o agentes que exploran, la marca sí te toca la calidad. Se puede mitigar (con repeated context masking de mayor K), pero a costa de detectabilidad.
Entropía. Los pulgares miden la calidad de la respuesta, no la fuerza de la marca de agua, y esa fuerza baja con el tamaño y el alineamiento del modelo como vimos antes. Es decir, en un modelo mejor, la misma configuración deja una marca más débil o exige textos más largos.
Los umbrales. En el paper, con Gemma 7B a temperatura 0,7 y 1% de falsos positivos, la tasa de detección es ≈0,5 a 100 tokens y ≈0,86 a 400. Para llegar a 95% de aciertos con 1% de falsos positivos el detector tiene que abstenerse en ≈70% de los textos de 50 tokens. Anthropic no ha publicado sus curvas.
Así que como ya tenía los datos, me propuse medir si esto es cierto
Como tenía los 100 textos en inglés y 40 en español generados con y sin marca de agua a partir del mismo prompt y la misma semilla, comparé la calidad de dos maneras.
1. Respuesta a respuesta, no hay diferencia
Perplejidad bajo un modelo independiente (Llama-3.1-8B): 5,27 con marca frente a 5,42 sin ella en inglés (medianas 5,16 y 5,14; la marca sale más alta solo en el 44% de los pares; Wilcoxon p = 0,23) y 5,64 frente a 5,68 en español (p = 0,73). Un juez LLM al que le enseño las dos respuestas en orden aleatorio y luego invertido solo prefiere de forma consistente una de las dos en 12 de 100 pares en inglés (5 a favor de la marca, 7 en contra) y en 15 de 40 en español (9 y 6), vamos, ruido. Longitud, riqueza léxica (distinct-2/3) y repetición de 4-gramas, idénticas en inglés y con un pelín más de repetición en español con marca (0,7% frente a 0,2% de 4-gramas repetidos, n = 40, no me atrevo a llamarlo diferencia). Hasta aquí Anthropic tiene razón y veo mirando una respuesta, no se distingue.
2. Entre respuestas, la diferencia es enorme
Pedí 5 respuestas al mismo prompt para 30 prompts, con y sin marca, a temperatura 1 y a 0,7, y medí cuánto se parecen entre sí (Self-BLEU, como en el paper de Nature; solapamiento de 4-gramas; similitud de embeddings). Con marca las respuestas se parecen mucho más entre ellas: Self-BLEU 38,6 frente a 19,4 a temperatura 1 (más alto con marca en los 30 prompts, p < 10⁻⁸) y 45,8 frente a 28,6 a 0,7; el solapamiento de 4-gramas se multiplica por seis (8,7% frente a 1,4%); la similitud de embeddings sube de 0,86 a 0,92. Es justo el mismo efecto que Google reconoció en el suplemento de Nature (Self-BLEU ≈27 → ≈40 en Gemma 7B a 0,7) y se puede ver a simple vista. De las cinco respuestas con marca en "describe un viaje memorable a un pueblo costero", cuatro empiezan con "My heart still sings/dances when I think back to my trip to the quaint coastal town of…" y sin marca empiezan de tres maneras distintas. El motivo es que con clave fija, el mismo contexto de 4 tokens siempre resuelve el "empate" hacia el mismo lado, así que el modelo tiende a repetirse cuando le preguntas lo mismo. Por lo quien pide una respuesta no lo nota, pero quien pide variantes (titulares, descripciones de producto, best-of-N, agentes que exploran) pierde diversidad de verdad, y un atacante puede aprovechar esa repetición para robar la marca (watermark stealing).
Así que creo que esto es suficientemente importante como para que alguien con más medios que yo (Anthropic), lo mida con una evaluación humana ciega por pares (lo mismo que hizo Google con 3.000 ejemplos, pero con más raters y tareas de escritura larga), MAUVE contra texto humano, benchmarks con y sin marca (MMLU, HumanEval, GSM8K), y sobre todo la diversidad entre respuestas y el rendimiento en best-of-N, que es donde la marca sí que se nota. Pero esto no lo dicen en el anuncio de Claude.
Y ojo! porque cuando llegue la API de detección, esta se convertirá en un oráculo de evasión (por que puedes llegar a aprender el watermark). Pang et al. (NeurIPS 2024) muestran que con acceso al detector se elimina la marca con 1,5-2,4 consultas por token y se suplanta con ~3 por token. Anthropic tendrá que limitarla mucho o aceptar que sirve para lo contrario de lo que se pretende.
8. ¿Y qué pasa con la marca de agua en imágenes? C2PA dos años después
En 2024 me bajé una imagen firmada con el C2PA de una Leica, le robé el manifest, me hice un certificado autofirmado a nombre de "Leica Camera AG" y el verificador oficial mostró "firmado por Leica", además, le puse que la foto había sido hecha en el futuro (notebook). Podría haber cambiado la localización también, ¿imagináis lo peligroso que es esto si un juez toma esa info como verídica en un juicio? Pues Anthropic ha elegido C2PA para las imágenes de Claude. ¿Ha cambiado algo desde entonces?
Natzir Turrado hablando de cómo romper y falsificar el C2PA en SEOPLUS
Ahora hay lista de confianza y programa de conformidad (c2pa.org/conformance) con certificados de Google, DigiCert, SSL.com, Adobe… y una Conforming Products List con 167 productos (Pixel Camera en nivel 2, OpenAI y Amazon Bedrock en nivel 1). Anthropic de momento no aparece a día de hoy. Eso sí, ahora un certificado autofirmado hoy sale como "unknown source" / "valid but untrusted" en los validadores modernos… pero el nombre del firmante se sigue mostrando, así que la suplantación por nombre sigue existiendo.
La vía "confiable" tampoco sirve, ya que Krawetz demostró en el Pixel 10 que el EXIF/XMP queda fuera del hash y se puede retrodatar sin que el validador de Adobe se entere. Nikon tuvo que suspender su servicio tras firmar "un carlino pilotando un avión" y en abril de 2026 Golaszewski, Krawetz, Sherman et al. publicaron el primer análisis de seguridad independiente completo, y su conclusión es que las especificaciones actuales de C2PA no cumplen los objetivos de seguridad que prometen.
Los metadatos siguen muriendo al pasar por X, Instagram o WhatsApp, y exiftool -jumbf:all= los borra en un segundo. Por eso Google y OpenAI apilan ahora C2PA + SynthID en las imágenes (mayo de 2026). Un paper reciente (Nemecek et al., 2026) enseña que estas dos capas van desconectadas y se pueden contradecir.
¡Es más! El ataque de regeneración que usé hace 2 años contra SynthID-Imagen (Zhao et al.) sigue vigente y ha mejorado: CtrlRegen (ICLR 2025), UnMarker (IEEE S&P 2025) con un 79% sobre SynthID según IEEE Spectrum (Google lo discute), el ganador del reto de NeurIPS con 95,7%. Eso sí, Goonatilake y Ateniese (2026) avisan de que quitar la marca deja su propia huella forense.
En resumen: lo de las imágenes está exactamente donde lo dejé, solo que con alguna capa más que también se puede saltar.
9. Qué significa esto para SEO y contenidos
Nadie puede detectar la marca de Claude sin la clave
Ni Google, ni Originality, ni GPTZero pueden hacerlo. Cuando exista la API de detección, será de Anthropic el único que podrá hacerlo. El AI Act obliga a que sea gratuita para investigadores, medios y reguladores, pero no obliga a Google a usarla, y no hay ni un documento, post o declaración de Google que conecte SynthID-Text (ni ninguna marca de texto) con el ranking. Lo que Google sí lee es procedencia de imágenes: C2PA en "About this image" desde noviembre de 2024 (solo manifests de la versión 2.1 en adelante firmados por una CA de la lista de confianza) y, desde el I/O de mayo de 2026, verificación de SynthID en Lens, AI Mode y Circle to Search para imagen, vídeo y audio. Texto, nada de nada.
Lo que Google mira es el esfuerzo, la originalidad y la escala
Si el texto aporta algo, con independencia de cómo se produjo. La versión de mayo de 2026 de sus guías para IA lo llama contenido commodity (pone como ejemplo un "7 consejos para compradores de primera vivienda", algo que cualquier modelo generativo podría producir) frente a non-commodity. Las QRG puntúan el esfuerzo humano visible y el leak tiene un contentEffort estimado por un LLM y un racterScores de contenido artificial a nivel de sitio. Cyrus Shepard, que fue quality rater, resume muy bien la idea, porque esfuerzo no es lo mismo que trabajo, es la evidencia de trabajo útil que acaba en la página final y deja claro que "esfuerzo" no significa "escrito por humanos mejor que IA". Google no necesita la marca de Claude para castigar el refrito, y la marca de Claude tampoco le serviría para premiar nada.
El bucle del "model collapse" ya está en marcha, con o sin watermark
La marca solo significa que Claude o Gemini intervino en el texto
El anuncio de Anthropic reconoce que no puede distinguir "esto lo escribió Claude" de "esto lo editó Claude a fondo". Técnicamente, un texto humano con correcciones ligeras casi no lleva marca, pero políticamente el problema de la "letra escarlata" es real, y en un mundo donde el 74% de las páginas nuevas llevan algo de IA, marcar "hubo IA" no discrimina nada.
Los detectores estilométricos de IA siguen sirviendo para nada
El sesgo contra no nativos (Liang et al., 2023), el "1% de pulido con IA engaña a 12 detectores" (Saha y Feizi, 2025) y las paráfrasis adversariales que bajan la detección un 88% (NeurIPS 2025). En mi charla enseñé el Génesis marcado como IA y esto no ha cambiado.
Los skills y webs que dicen que "eliminan" la marca de agua no lo hacen
Las skills no hacen nada útil... parafrasear con otro modelo funciona, pero te cambia el texto y, si el otro modelo lleva marca, te la deja puesta. Si tu preocupación es la contraria, saber si algo es de IA, la marca solo te lo dirá para textos largos, con la API de Anthropic, y solo para Claude. Y si tu preocupación es Google, la respuesta lleva tres años sin cambiar: esfuerzo visible, información que no esté ya en el top 10, y nada de contenido a escala.
Conclusiones
La marca de agua de Claude es una variante de SynthID-Text: un sesgo estadístico en la elección de tokens, sin caracteres ocultos, sin identificar al usuario, hoy sin detector público y probablemente sin estar activa en ningún modelo en producción.
Las herramientas que "la quitan" limpian Unicode y metadatos, cosas que la marca no usa. Cuando además parafrasean con otro modelo no pueden saber si la han roto o no.
Lo que sí la rompe está publicado y es muy sencillo de hacer: paráfrasis fuerte con otro modelo, traducción por idioma pivote lejano y ataques dirigidos como SIRA/BIRA. En mi réplica de SynthID-Text, parafrasear bajó la detección del 100% al 5% en 100 textos en inglés (SIRA 4%) y al 5% en textos de 1.000 tokens parafraseados párrafo a párrafo. La traducción ida y vuelta por chino la dejó en el 16% y por español, en el 76% (un buen traductor entre idiomas cercanos devuelve casi el mismo texto). Además, en español la paráfrasis con el mismo 8B dejó un 38%, por lo que el parafraseador y el idioma importan.
Que el watermark "no afecta a la calidad" he comprobado que es solo cierto respuesta a respuesta, pero falso para la diversidad entre respuestas.
La marca es tanto más débil cuanto mejor y más factual es el modelo.
C2PA sigue siendo metadatos firmados que se borran y se pueden falsificar por nombre.
Hace dos años terminé la charla con un "estamos jodidos", porque creo que identificar qué contenido se hace con IA es importante (motivos mencionados en el punto 2), y esto de momento no se va a poder conseguir. Aunque eso no quita que una marca de agua sea útil como herramienta de monitorización agregada (para cazar granjas de desinformación automática, medir la contaminación de los datos de entrenamiento...) y es cierto que para eso no hace falta que sea irrompible. Pero todo lo demás es ruido.
La Inteligencia Artificial ha dejado de ser una promesa futurista para convertirse en una fuerza transformadora en el presente y, el SEO, tenía que subirse también a la ola. Problema: nadar por el estado actual de herramientas, workflows y agentes de IA para SEO puede ser complicado, y el hype existente nubla la realidad práctica. […]
El SEO basado únicamente en palabras clave ya quedó atrás, y la llegada de la IA ha acelerado ese cambio. Hoy, los buscadores integran la IA y eso reduce los clicks que terminan en tu web. Puede que la IA sea una amenaza… pero también es una gran oportunidad para tu PYME. Desde que Sam […]