Es quizás una de las noticias más importantes para la generación de contenido por IA: la marca de agua de Claude. Es el pionero, y el secretismo en torno al método es total. Aunque es una noticia importante, no todos los usuarios están de acuerdo. Algunos acusan a la compañía de modificar y manipular el texto; otros dicen que, a la larga, no servirá de nada, pero una cosa es clara: ha llegado para quedarse.

La crítica fundamental es que este tipo de marcas de agua no es, en línea general, un método fiable para acreditar el origen de un contenido, puesto que, en la práctica, solo obliga a los usuarios a realizar una segunda pasada con otro modelo para limpiar sus propios textos.

Y claro, los expertos están buscando la forma de eliminarla. ¿El problema? No se conoce exactamente cómo funciona. En parte, tiene que ver con cómo ha hecho las cosas Antrophic. La compañía no ha revelado cómo se genera la marca de agua y solo la describe como marca a «nivel de modelo» y «nativa del texto».

Los desarrolladores de este tipo de herramientas de eliminación tampoco lo tienen claro, aunque sí que se sabe que se trata de un tipo de firma estadística, mediante la cual Claude usa una selección con cierto sesgo detectable, similar (aunque no igual) al SynthID Text. Por tanto, se conoce el método, pero no cuál es el algoritmo estadístico que va a usar el modelo en cada momento para marcar su contenido, puesto que, según la compañía, la diferencia entre el texto con marca de agua y el texto sin ella no será perceptible para los lectores.

Qué se sabe hasta ahora de la posibilidad de eliminar la marca de agua de Claude

De momento, hay dos proyectos que parecen que se lo están tomando en serio para limpiar el texto de Claude: claude-watermark-cleaner es capaz de analizar el texto y eliminar marcas Unicode invisibles; luego reescribe el texto utilizando un modelo distinto al de Claude para alterar el patrón de tokens, es decir, el reparto estadístico de palabras con las que el modelo pone su sello invisible.

Hay otro proyecto más grande: watermarks-remover está pensado para detectar Unicode invisible, espacios exóticos y aleatorios, bidi y, sobre todo, marcas de agua estadísticas en texto (basadas en el muestreo de tokens), lo que precisamente usaría Claude para marcar sus textos.

Ambos casos tienen el mismo problema. Al usarse un sistema de muestreo de tokens que solo el modelo conoce, no es posible garantizar la eliminación efectiva de las marcas de agua, al menos hasta que Anthropic publique su herramienta de detección y los umbrales correspondientes. Y no parece que vaya a ocurrir.

Si se puede detectar, se puede eliminar, sí. El problema es cómo detectarlo de forma efectiva. Y parece que, de momento, no es del todo posible, al menos con garantías.