Compartir

En un mundo digitalizado, los datos son el nuevo petróleo, pero sólo unos pocos disponen de ellas en cantidad y calidad adecuadas y en tiempo para poder utilizar algoritmos de inteligencia artificial y ciencia de datos que produzcan resultados satisfactorios. Por tanto, son cada vez más quienes se fabrican su propio petróleo de forma efectiva ya un coste mucho más reducido. Estamos hablando de las datos sintéticos.

La generación de datos sintéticos nació como una metodología para preservar la privacidad de datos personales, en especial aquellos que conllevan una componente ética y legal más clara, como en el entorno clínico y de la salud. Ya sea por un reemplazo total a través de un modelo de simulación, o bien a través de la imputación de datos como forma de sustitución de información del mundo real, los datos sintéticos permiten evitar el uso de datos originales sin perder fiabilidad algorítmica. Siguiendo este hilo, también se empezaron a utilizar como una forma aumentar el tamaño de las bases de datos en visión por ordenador, modificando los datos originales con transformaciones verosímiles de las imágenes del mundo real por medio de cambios aleatorios de iluminación, color de objetos, desplazamientos y rotaciones, superposición de imágenes.

Muy pronto se demostró que esa información anotada generada a partir de simulaciones o algoritmos era de hecho una buena alternativa a los datos del mundo real. Aunque son datos generados artificialmente, son capaces de superar tests estadísticos de comparativa entre funciones de distribución de probabilidad de datos reales y aquella distribución de la información de los datos sintéticos. Dado que la mayoría de sistemas discriminadores o generadores tienen por objetivo llegar sólo hasta este grado estadístico de precisión, desde hace unos años los desarrolladores de redes neurales profundas utilizan de forma masiva datos sintéticos para entrenar a los modelos.

De hecho, el paradigma actual defiende que sólo a partir del uso de datos sintéticos en el entrenamiento de tus algoritmos es posible construir modelos de inteligencia artificial valiosos y de alta calidad. El uso de estos datos sintéticos permite generar información con ruido o incluso explorar regiones de datos donde no se dispone de datos reales, que ayudan a los algoritmos a crear modelos más completos y robustos que aquellos que sólo hubieran sido creados utilizando datos del mundo real.

Ya hemos comentado algunas formas de creación de datos sintéticos, a partir de modelos, por medio de cambios aleatorios verosímiles, utilizando una base de reglas, todos ellos sistemas generadores básicos. Pero, rizando el rizo, también es posible generar estos datos sintéticos utilizando otros sistemas algorítmicos de inteligencia artificial generadores, como son las redes generativas antagónicas (GANOS) o los sistemas de autocodificación o autoencoders variacionales. En este caso, los sistemas generadores de datos sintéticos acaban reduciéndose a un vector generador aleatorio capaz de sintetizar información estadísticamente equivalente a la que se está utilizando como base real.

Finalmente, en estos últimos dos años la generación de datos sintéticos, completos o por imputación de una parte de la información, se está mostrando como un camino válido para la generación de entornos seguros de aprendizaje federado. Los sistemas de aprendizaje actúan en local sobre datos propios y condicionan su entrenamiento con datos sintéticos importados de otros proveedores del espacio datos. Se garantiza de este modo un espacio de datos seguro y de compartición en función de las especificaciones acordadas entre los proveedores y el usuario.

Prof. Cecilio Angulo
Fundador de IDEAI-UPC y Presidente de la ACIA. 

Durante décadas, la inteligencia artificial (IA) parecía un campo de interés académico o científico, pero lejos de las necesidades de muchas empresas. En aplicaciones de […]

Datos del último informe “Global Entrepreneuship Monitor; GEM” 2022-2023[1] indican que Cataluña sigue liderando la actividad emprendedora en España con una TEA del 6,9%. Es […]

Hoy nadie duda del potencial de la Inteligencia Artificial para cambiar el mundo que nos rodea. En línea con lo comentado por Brad Smith, presidente […]

CIDAI