La compañía tecnológica OpenAI ha confirmado la introducción de un sistema de marca de agua destinado a identificar de forma automatizada los contenidos textuales generados a través de ChatGPT y Codex. Siguiendo una estrategia análoga a la adoptada previamente por Anthropic, este mecanismo busca establecer una distinción clara entre las producciones sintéticas y aquellas elaboradas de manera humana. La iniciativa se desplegará próximamente en España y en el resto de los países integrados en la Unión Europea, dando cumplimiento directo a los requerimientos normativos vigentes.
La proliferación masiva de escritos procedentes de sistemas conversacionales en plataformas digitales, canales de comunicación y soportes corporativos ha planteado un reto constante en la verificación de su procedencia. A diferencia del material visual generado por inteligencias artificiales, el formato escrito carecía hasta el momento de un distintivo perceptible que permitiera certificar su origen automatizado. Como respuesta a esta circunstancia, el marco regulatorio comunitario exige a los desarrolladores la integración de huellas técnicas reconocibles por sistemas informáticos en este tipo de prestaciones.
Funcionamiento técnico del sistema textGrain
Según la información facilitada por la corporación a través de su canal oficial de actualizaciones, la tecnología seleccionada recibe el nombre de textGrain y opera de manera totalmente imperceptible para los lectores humanos. El procedimiento introduce una modulación estadística en la selección léxica que efectúa el modelo durante la redacción, la cual puede ser contrastada con posterioridad mediante una herramienta de análisis especializada capaz de identificar la presencia de dicho patrón.
Este enfoque comparte similitudes metodológicas con las estrategias basadas en la segmentación de vocabulario por categorías de probabilidad, donde el sistema favorece sutilmente la elección de términos determinados sin comprometer la fluidez ni la precisión sintáctica del resultado. La verificación posterior consiste en evaluar la proporción de elementos léxicos asociados a dichos patrones para determinar la intervención del algoritmo.
Disponibilidad del detector y aplicación corporativa
Desde el punto de vista operativo, la corporación ha especificado que la utilidad de diagnóstico se limitará exclusivamente a corroborar la existencia del rastro estadístico, sin recopilar información relativa a los usuarios ni a las instrucciones introducidas. Asimismo, se ha confirmado que el detector no estará disponible para el público general, restringiendo su acceso de manera exclusiva a colectivos de investigación y entidades especializadas.
En el ámbito profesional, los clientes que operan a través de la interfaz de programación de aplicaciones dispondrán de la capacidad para gestionar la activación de esta propiedad en función de sus propias necesidades de cumplimiento normativo y transparencia comercial, un proceso que se articulará de manera coordinada con los proveedores de servicios en la nube durante las próximas semanas.
Limitaciones técnicas y fiabilidad del sistema
La propia organización ha reconocido que, si bien el rendimiento de la tecnología iguala o supera a alternativas evaluadas previamente como SynthID, el método no resulta infalible. Los ensayos realizados reflejan tasas de éxito elevadas en extensiones amplias de contenido discursivo, pero el margen de acierto desciende de forma notable en ámbitos técnicos o estructurados donde las opciones de vocabulario se encuentran altamente restringidas.
Adicionalmente, las pruebas demuestran que las modificaciones posteriores introducidas por los usuarios alteran significativamente la eficacia del mecanismo. La sustitución de una fracción moderada del vocabulario mediante sinónimos reduce drásticamente la capacidad del detector para identificar la procedencia original del escrito. Por este motivo, la ausencia de la señal no constituye una prueba concluyente de autoría humana, puesto que el documento pudo ser objeto de ediciones posteriores, traducciones o provenir de versiones anteriores del software.
Ante este escenario, la implementación responde estrictamente a un mandato regulatorio que no otorgará a los usuarios particulares la capacidad de verificar de forma autónoma el origen de los textos, advirtiendo los expertos sobre la posible proliferación comercial de soluciones de terceros que prometan certificar o modificar artificialmente esta clase de contenidos sin el respaldo técnico suficiente.
