Anthropic anunció que futuros modelos Claude incorporarán una marca de agua estadística para ayudar a reconocer cuándo el asistente participó en la creación o modificación de un texto.
La compañía aclara que el sistema no identificará a la persona que utilizó Claude ni permitirá saber qué organización o conversación produjo el contenido. Su objetivo será calcular la probabilidad de que Claude haya intervenido.
¿Cómo funcionará?
Los modelos de lenguaje crean texto seleccionando palabras o partes de palabras entre diferentes alternativas. La marca modificará algunas de esas elecciones para dejar un patrón estadístico que no será visible durante la lectura.
Un detector que conozca la clave asociada podrá analizar ese patrón y estimar si Claude participó en el contenido. Según Anthropic, el mecanismo estará basado en una versión de SynthID-Text, una tecnología desarrollada originalmente por Google DeepMind.
No será una prueba absoluta
La señal puede ser más difícil de detectar en textos cortos, pasajes con información muy precisa, código o documentos donde Claude solo haya realizado pequeñas correcciones.
Anthropic también reconoce que una reescritura completa puede eliminar la señal. Por eso, el resultado del detector no debería interpretarse como una prueba definitiva de autoría, fraude o plagio. Solo indicaría que Claude probablemente participó en algún momento.
¿Por qué se está implementando?
El anuncio está relacionado con las obligaciones de transparencia del Reglamento de Inteligencia Artificial de la Unión Europea. Estas incluyen medidas para marcar y facilitar la detección de determinados contenidos generados o manipulados mediante inteligencia artificial.
Anthropic afirma que aplicará la marca globalmente cuando lance los modelos correspondientes. También planea ofrecer una API para comprobar la señal, pero todavía no ha informado cuándo estará disponible ni cuáles serán sus condiciones de acceso.



