
Anthropic ha ofrecido más detalles sobre su plan para marcar con una marca de agua el texto generado por Claude, describiendo un sistema diseñado para identificar material escrito por IA sin cambiar de forma visible la respuesta para los lectores. La empresa afirma que la marca de agua podrá detectarse con la clave criptográfica adecuada y planea ofrecer una API independiente de detección de marcas de agua.
La aclaración llega después de que Anthropic dijera a principios de esta semana que Claude adoptaría el marcado de agua para cumplir con el Código de Transparencia de la Ley de IA de la Unión Europea. La medida ha suscitado debate entre usuarios preocupados de que empleadores, escuelas u otras instituciones puedan usar la tecnología para identificar el uso no revelado de Claude.
En una entrada de blog publicada el viernes, Anthropic dijo que Claude utilizará el enfoque SynthID-Text desarrollado por Google DeepMind y descrito en 2024. El método se basa en las elecciones que hace un modelo de lenguaje cuando varias palabras o frases funcionarían igual de bien. Por ejemplo, un modelo puede tener varias formas razonables de describir el clima. A lo largo de una respuesta, esas elecciones pueden formar un patrón estadístico que no es evidente para un lector normal, pero que puede ser comprobado por alguien con la clave de detección correspondiente.
Anthropic dijo que la marca de agua no debería afectar la calidad de la salida de Claude. La empresa describe una respuesta con marca de agua como indistinguible, para un lector, de una sin marca de agua, lo que significa que es poco probable que los usuarios noten el sistema durante flujos de trabajo ordinarios de escritura o programación.
La API de detección prevista podría importar más que la propia marca de agua. Si se lanza tal como se describe, ofrecería a desarrolladores, editores, educadores y administradores empresariales una forma de incorporar la verificación en sus propios sistemas en lugar de depender solo de herramientas generales de detección de IA.
Anthropic reconoce que la marca de agua no es permanente en todas las versiones posibles de un texto. La empresa dice que una edición ligera probablemente no la eliminará por completo, mientras que una reescritura total que sustituya cada palabra sí lo hará. Esa distinción hace que el sistema sea más útil para identificar salidas de Claude que se han conservado sustancialmente que para demostrar que un documento final tiene alguna conexión con un modelo.
El resultado también puede depender de cómo se use Claude como editor. Si el modelo solo corrige un pasaje escrito por una persona, Anthropic dice que puede que haya poco texto al que una marca de agua pueda adherirse porque la mayoría de las palabras proceden del autor original. La detección dependerá de la longitud del pasaje y de cuánto lo cambie Claude.
Esa limitación es importante para los equipos de producto que construyen flujos de cumplimiento o procedencia. Un resultado positivo de marca de agua podría indicar que Claude generó o alteró sustancialmente el material, pero no necesariamente establecerá quién escribió las ideas subyacentes, cuánto del texto provino de una persona o si la versión final fue reescrita después en otro lugar.
Anthropic espera que la marca de agua sea más débil en código que en prosa normal. El software funcional generalmente deja al modelo menos libertad para elegir entre palabras o estructuras intercambiables, reduciendo el número de decisiones arbitrarias disponibles para un patrón de marcado de agua.
La empresa dice que aún puede aparecer alguna señal detectable donde el código incluya opciones lingüísticas flexibles, especialmente comentarios. Caracteriza el efecto sobre el código ejecutable como insignificante por definición, lo que sugiere que la marca de agua está pensada principalmente como un mecanismo de procedencia y no como una restricción sobre la generación de código.
Para las organizaciones de ingeniería, esa distinción podría hacer que el marcado de agua sea más relevante para la documentación, los comentarios, los mensajes de commit y las explicaciones generadas que para el comportamiento funcional de un programa. También significa que un resultado de detección puede ser menos fiable para fragmentos cortos o código muy restringido que para respuestas más largas en lenguaje natural.
Los detalles actuales proceden de la propia explicación de Anthropic sobre su implementación prevista. Las afirmaciones de la empresa sobre una calidad de salida sin cambios, resistencia a ediciones ligeras e impacto limitado en el código son declaraciones del proveedor; el material de origen no ofrece resultados de pruebas independientes, cifras de precisión de detección, tasas de falsos positivos ni una fecha de lanzamiento de la API de detección de marcas de agua.
La base técnica no es del todo exclusiva de Anthropic. Anthropic identifica SynthID-Text, el enfoque de marcado de agua de Google DeepMind, como el método que pretende usar. La empresa también dice que otros grandes desarrolladores de modelos firmaron el mismo Código de Prácticas y planean implementar sus propias marcas de agua, aunque la fuente no nombra a esos desarrolladores ni describe si sus sistemas serán interoperables.
Esto es distinto de los productos de detección de IA que examinan señales estilísticas o patrones de escritura recurrentes. Anthropic distingue específicamente la verificación por marca de agua de servicios como Pangram, que intentan inferir el uso de IA a partir de características del texto. Una comprobación de marca de agua busca una señal creada por el modelo; un detector basado en el estilo emite un juicio probabilístico a partir del propio texto.
La oposición de los usuarios ha añadido una dimensión de mercado y política al despliegue. TechCrunch informó que usuarios en Reddit criticaron la medida, mientras que Business Insider informó que docenas de personas en X afirmaron haber cancelado sus suscripciones a Claude. Esas reacciones son declaraciones de usuarios reportadas, no pruebas de un cambio medido en la base de clientes de Anthropic.
Para los creadores de IA, el anuncio apunta a que la procedencia se convierta en una función a nivel de API en lugar de una capa separada de moderación o detección. Las aplicaciones que generan informes, textos de marketing, respuestas de soporte o documentación interna podrían eventualmente adjuntar una verificación legible por máquina al contenido que producen.
Los compradores empresariales deberán decidir qué puede probar legítimamente una marca de agua. Puede ayudar a identificar contenido que sigue estando cerca de la salida de Claude, pero no resolverá casos de autoría mixta, documentos muy editados o material copiado a través de múltiples herramientas. Las organizaciones que usen marcas de agua en decisiones laborales, educativas o de cumplimiento necesitarán políticas para resultados inciertos y posibles falsos negativos.
El enfoque también crea un intercambio en el despliegue. El marcado de agua puede respaldar requisitos de transparencia sin exponer una etiqueta visible en cada respuesta, pero la verificación depende de acceder al sistema de detección adecuado. Hasta que Anthropic publique la API y existan evaluaciones independientes, los desarrolladores no podrán valorar su latencia, coste, fiabilidad o compatibilidad con sistemas de gestión de contenido de terceros.
La primera señal será el lanzamiento por parte de Anthropic de la API de detección de marcas de agua, incluida su documentación, controles de acceso, precios y tipos de contenido admitidos. Las pruebas independientes deberían entonces examinar las tasas de detección en respuestas cortas y largas, parafraseo, traducción, corrección y reescritura adversarial.
Los desarrolladores también deberían vigilar si Anthropic publica orientación de políticas para texto mixto humano e IA y cómo gestiona el código, los comentarios y la documentación. Otra cuestión abierta es si las marcas de agua de distintos proveedores de modelos pueden reconocerse de forma consistente o si seguirán ligadas a la implementación de cada empresa.
Por último, el Código de Transparencia de la UE y su aplicación práctica determinarán si el marcado de agua se convierte en un requisito básico para los principales proveedores de modelos o en un componente de un sistema de divulgación más amplio.
La aclaración de Anthropic hace que el marcado de agua de Claude suene menos como una etiqueta visible y más como una señal oculta de procedencia. Eso podría ser útil para la verificación a gran escala, pero solo si las herramientas de detección son precisas, accesibles e interpretadas como evidencia de participación del modelo y no como prueba definitiva de autoría.
La prueba más decisiva llegará cuando la API esté disponible. Hasta que resultados independientes muestren cómo se comporta la marca de agua con la edición habitual y en flujos de producción reales, las empresas deberían tratarla como una señal en desarrollo para la gobernanza, no como un veredicto autónomo de cumplimiento.
Anthropic detalla cómo las marcas de agua de Claude identificarán el texto escrito por IA, qué ediciones pueden neutralizarlas y qué deberían esperar los desarrolladores.