Compartir

Durante la última década, Deep Learning ha revolucionado casi cualquier área de las TIC, penetrando tan rápida y profundamente en ámbitos empresariales y sociales que ha permitido nuevas capacidades nunca antes vistas. Algunas de ellas tan cotidianas como los controvertidos y falsos retratos fotorealistas, también conocidos como deepfakes.

A estos efectos, las Redes Neuronales generativas han experimentado una mejora intensa y constante en sus capacidades, incluyendo varios cambios de paradigma. Algunas de sus variantes permiten técnicas impresionantes para la Multimodal Domain Translation (MDT), mediante las cuales por ejemplo puede generarse una imagen a partir de una simple descripción textual, o poblar un extracto de vídeo sin sonido con una pista de audio sintética y plausible. En el estado del arte las Condicional Generative Adversarial Neural Networks (cGAN) poseen algunos beneficios y demuestran resultados excelentes sobre los Variational Autoencoders (VAE), en una carrera competitiva donde los Transformers han irrumpido recientemente con altos niveles de expectación.

En esta clase magistral, recorreremos diversas aplicaciones creativas MDT y ejemplos de imagen a imagen, texto a sonido o vídeo a sonido. Al mismo tiempo se desgranarán múltiples técnicas para mejorar y estabilizar el entrenamiento de cGANs, como conditioning Augmentation, espectral normalization, adaptive data augmentation, gradiente penal, self-attention, class conditional normalization o conditional projection classifiers. Una visita final a las arquitecturas atencionales, que configuran el núcleo del paradigma de Transformers, mostrará sus capacidades únicas como traductores, más allá de Natural Language Processing como GPT-3, y como generadores en general.

Dirigida a:

– Expertos en visión por ordenador – Profesionales en sectores de creación de contenido multimedia (imagen, audio, música) – Profesionales del sector diseño, publicidad y creativos, artistas digitales – Sector del audiolibro – Profesionales del sector de las Tics en general

Programa

1. Aplicaciones creativas y algunos ejemplos
2. Técnicas para mejorar y estabilizar el entrenamiento de cGANs
3. Arquitecturas atencionales
4. Preguntas

Masterclass impartida por Eurecat (core partner de CIDAI)

[descargas tipo="masterclass"]

Impartido por:

Rafael Redondo
Senior Researcher on Computer Vision en Eurecat
CIDAI