Referencia: Optimizadores
Una referencia que cubre los optimizadores de redes neuronales desde GD hasta AdamW, con programación de la tasa de aprendizaje, árboles de decisión y guía práctica para cada arquitectura.
Una referencia que cubre los optimizadores de redes neuronales desde GD hasta AdamW, con programación de la tasa de aprendizaje, árboles de decisión y guía práctica para cada arquitectura.
Aprende una lista de verificación práctica de 4 pasos para diagnosticar modelos de deep learning estancados: sobreajustar un lote, revisar los gradientes, escalar los datos y hacer un barrido de las tasas de aprendizaje.
Descubre cómo la codificación posicional le otorga a los Transformers noción del orden de las palabras y la atención de múltiples cabezas rastrea múltiples patrones a la vez en esta guía práctica.
Comprende el mecanismo de atención que impulsa todos los modelos de lenguaje modernos: consultas, claves, valores y softmax explicados con analogías y código Python.
Aprende cómo las LSTMs y GRUs usan memoria con compuertas para superar el gradiente desvaneciente, reteniendo señales tempranas a lo largo de secuencias largas para lograr mejores predicciones de secuencias.
Aprende por qué las CNN superan a las redes densas en el reconocimiento de imágenes utilizando filtros deslizantes, pesos compartidos y pooling para detectar patrones espaciales de manera eficiente.
Aprende cómo funciona la retropropagación de forma intuitiva, sin necesidad de cálculo. Descubre cómo las redes neuronales asignan la culpa a los pesos mediante la regla de la cadena y aprenden de sus errores.