GPT Diffusion

La marca de agua invisible de Claude: qué significa para devs y creadores que usan IA en producción

2026-08-16 · Devs #claude#privacidad#leyes#frontier-models#etica

TL;DR

  • Anthropic firma el Code of Practice del Artículo 50(2) del EU AI Act y empieza a marcar todo el contenido que genera Claude: marca de agua invisible en texto y metadatos C2PA firmados en ficheros
  • Aplica worldwide, no solo en la UE. Modelos lanzados desde el 2 de agosto de 2026 marcan desde el día uno; los anteriores están en periodo de transición
  • La marca de agua viaja con el texto al copiarlo y pegarlo, y puede sobrevivir a cierta edición. No es infalible: parafraseo agresivo, traducción, pasajes cortos o conversión de formato pueden hacerla indetectable
  • No hay herramientas de detección públicas todavía. Anthropic dice que las publicará, pero sin fecha
  • Para devs en producción: revisa qué superficies generan contenido de cara al usuario, entiende qué significa un marcado (y qué no), y prepárate para explicar a clientes/usuarios qué pasa cuando un detector marque contenido tuyo

Contexto

El 2 de agosto de 2026 entraron en aplicación plena las obligaciones de transparencia del Artículo 50 del EU AI Act. Nueve días después, Anthropic publicó su compromiso con el Code of Practice on Transparency of AI-Generated Content. La jugada no es sorprendente — Google y Meta ya habían firmado — pero sí tiene dientes: a partir de ahora, los modelos Claude lanzados en la UE desde el 2 de agosto marcan todo lo que generan, y esa marca aplica globalmente. Si llegas de fuera, el AI Act ya afectaba a qué modelos llegan a Europa; esto añade la capa de transparencia sobre el contenido que generan.

La pregunta que me importa no es si esto es bueno o malo para la regulación. Es: ¿qué cambia para alguien que usa Claude para generar contenido en producción?

Cómo funciona el marcaje, técnicamente

Anthropic describe dos mecanismos complementarios.

1. Marca de agua incrustada en texto

Cuando un modelo Claude soportado genera texto, teje una marca de agua imperceptible directamente en el propio texto. No cambia el significado, la calidad ni la legibilidad de la respuesta. Como está a nivel de modelo — no de producto — aparece sin importar si usas la API, Claude web, Claude Code, Claude Cowork o Claude Tag.

Propiedades clave:

  • Viaja con el texto al copiarlo y pegarlo en otro sitio
  • Puede sobrevivir a cierta edición (no especifican cuánta ni de qué tipo)
  • Funciona a través de cloud partners: AWS, Google Cloud, Microsoft Foundry
  • Se aplica worldwide, no solo en la UE

El detalle técnico — qué patrón estadístico usa, cómo se inyecta a nivel de token sampling — no está público. Sabemos que Google DeepMind abrió SynthID (que ajusta probabilidades durante la predicción de tokens), así que es razonable asumir algo similar. Pero Anthropic no lo ha confirmado.

2. Metadatos de procedencia firmados (C2PA)

Cuando Claude genera un fichero soportado — .svg, .png, .jpg — adjunta metadatos de procedencia firmados siguiendo el estándar C2PA (Coalition for Content Provenance and Authenticity). La firma indica que Claude procesó el fichero y permite detectar manipulación posterior.

Importante: C2PA solo funciona en plataformas que lo soportan. AWS, GCP y Microsoft Foundry soportan la marca de agua de texto, pero pueden no soportar los metadatos firmados de ficheros.

Lo que la marca NO prueba (y esto importa)

Anthropic es honesto sobre las limitaciones, y esto es lo que más me interesa porque es donde la gente se va a equivocar.

Una marca detectada NO demuestra que Claude escribió el contenido. Solo indica que Claude procesó el texto en algún momento. Y se puede dar en escenarios donde Claude no es el autor original:

  • Alguien usa Claude para corregir, traducir o resumir su propio texto → el resultado lleva marca aunque las ideas y el texto original sean humanos
  • El contenido puede haber cambiado después de que Claude lo procesara

La ausencia de marca NO demuestra que el contenido sea humano. Puede no detectarse porque:

  • Lo generó un modelo anterior al soporte de marcaje
  • El texto fue editado, parafraseado o traducido de forma agresiva
  • El pasaje es demasiado corto para detección fiable
  • Los metadatos se perdieron por conversión de formato o screenshot

Qué hacer si usas Claude en producción

Esto es lo que haría yo, no lo que dice el reglamento.

Mapea qué superficies generan contenido de cara al usuario

Si tienes un pipeline donde Claude genera texto que acaba en un blog, un email, un chatbot o un documento público, ese texto ahora lleva marca de agua. Probablemente no afecta a nada hoy mismo — no hay detectores públicos — pero en el momento en que Anthropic libere las herramientas de detección, cualquier tercero podrá comprobarlo.

No interpretes la marca como prueba de nada

Si un cliente o usuario te pide “demostrar que esto es IA”, la respuesta correcta es: una marca de Claude solo indica que Claude procesó el contenido, no que lo escribiera. Si te piden demostrar que NO es IA, la respuesta correcta es: la ausencia de marca tampoco prueba nada. Ambas direcciones son no concluyentes. Este es el punto más importante que tienes que comunicar a stakeholders.

Revisa tu posición ante el Artículo 50 si operas en la UE

Anthropic lo dice explícitamente: los deployers que integran Claude en sus productos deben evaluar independientemente qué requisitos del Artículo 50 les aplican. Marcar el output es necesario para el proveedor (Anthropic), pero puede que tú tengas obligaciones adicionales como deployer — etiquetar el contenido como IA-generated en la UI, por ejemplo. No soy abogado; consulta a uno si vendes en la UE.

Decide qué haces con contenido pre-agosto

El periodo de transición cubre modelos lanzados antes del 2 de agosto. Anthropic está trabajando en retroactivos, pero mientras tanto, el contenido generado con modelos anteriores puede no llevar marca. Si necesitas marcaje consistente en todo tu histórico, no lo tienes garantizado.

Qué falta por saber

Hay tres cosas que Anthropic no ha publicado y que condicionan todo el impacto real:

  1. Detección pública sin fecha. Dicen que publicarán mecanismos para que usuarios y terceros detecten las marcas, pero “en documentación futura”. Hasta que no exista, la marca es teórica para la mayoría de usos prácticos.
  2. Durabilidad técnica de la marca. ¿Cuánta edición sobrevive? ¿Un párrafo reescrito? ¿Un documento completo reformateado? Sin datos, no se puede recomendar nada sobre cuándo preocuparse.
  3. Soporte de detección en third-party tools. Detectores como Pangram o GPTZero podrían integrar la marca de Claude. Si lo hacen, el signal sería más fiable que sus heurísticas propietarias actuales. Pero eso depende de Anthropic abrir el spec.

Mi posición

El marcaje es un paso necesario y razonable hacia la transparencia. Pero la forma en que se ha comunicado — “marca invisible que sigue tu contenido” — invita a una lectura equivocada: que un detector pueda decir “esto lo escribió IA” con certeza. No puede. Y no podrá, porque la marca es una señal débil por diseño: tiene que sobrevivir a la edición y no puede ser concluyente sobre autoría.

Para devs en producción, el cambio real no es técnico. Es comunicativo. Empieza a tener una respuesta preparada para la pregunta “¿esto es IA?”. La respuesta honesta — ni la marca ni su ausencia lo prueban — es correcta, pero requiere contexto. Proporciónalo antes de que te lo pregunten.


Fuentes:

Cargando comentarios...