All Courses
Course Syllabus

Deep Learning & Neural Architectures

22-part comprehensive master curriculum: Perceptrons, Backpropagation, Optimizers, CNNs, Sequence Models, Attention, Transformers, Autoencoders & GANs.

22Notebooks
Start Lesson 1
Lesson #1
Beginner

01. Neural Networks & Perceptron Foundations

Comprehensive foundations of artificial neurons, Rosenblatt perceptron, multi-layer architectures, activation functions, and biological vs artificial neural computation.

Deep LearningNeural Networks+4
15 min
Read Notebook
Lesson #2
Beginner

02. Forward Propagation & Computational Graphs

Layer-by-layer forward execution, matrix multiplications, linear transformations, logits calculation, probability mapping, and computational graphs.

Forward PropagationMatrix Multiplication+3
12 min
Read Notebook
Lesson #3
Intermediate

03. Loss Functions & Optimization Objectives

Comprehensive mathematical guide to regression losses (MSE, MAE, Huber) and classification losses (BCE, Categorical Cross-Entropy, Focal Loss).

Loss FunctionsMSE+4
14 min
Read Notebook
Lesson #4
Intermediate

04. Backpropagation & The Calculus Chain Rule

Analytical and computational derivation of backpropagation: partial derivatives, Jacobian matrices, multivariate chain rule, and gradient flows.

BackpropagationChain Rule+4
16 min
Read Notebook
Lesson #5
Beginner

05. Gradient Descent & Convergence Dynamics

Mechanisms of Batch Gradient Descent, Stochastic Gradient Descent (SGD), Mini-Batch GD, learning rate schedules, and loss surface navigation.

Gradient DescentBGD+4
14 min
Read Notebook
Lesson #6
Intermediate

06. Advanced Optimizers (SGD, Momentum, RMSProp, Adam, AdamW)

In-depth guide to modern deep learning optimizers: SGD with Momentum, Nesterov, AdaGrad, RMSProp, Adam, and decoupled weight decay AdamW.

OptimizersMomentum+5
15 min
Read Notebook
Lesson #7
Intermediate

07. Weight Initialization Strategies (Xavier & He/Kaiming)

Preventing vanishing and exploding gradients through principled weight initialization: Xavier/Glorot, He/Kaiming, and variance preservation analysis.

Weight InitializationXavier Glorot+3
10 min
Read Notebook
Lesson #8
Intermediate

08. Regularization Techniques (Dropout, L1/L2, Early Stopping)

Techniques for model generalization: L1 Lasso, L2 Ridge weight decay, inverted Dropout, early stopping, and data augmentation strategies.

RegularizationDropout+4
18 min
Read Notebook
Lesson #9
Intermediate

09. Normalization (BatchNorm, LayerNorm, RMSNorm, GroupNorm)

Stabilizing internal covariate shift: Batch Normalization, Layer Normalization in Transformers, Instance Normalization, Group Normalization, and RMSNorm.

NormalizationBatch Normalization+4
14 min
Read Notebook
Lesson #10
Intermediate

10. Deep Feedforward Networks & MLP Architectures

Deep Feedforward Networks (MLP): universal approximation theorem, width vs depth tradeoffs, residual connections, and production network design.

FeedforwardMLP+4
25 min
Read Notebook
Lesson #11
Intermediate

11. Convolutional Neural Networks (CNN) Fundamentals

Foundations of spatial computer vision: 2D convolutions, kernels, stride, padding, receptive fields, pooling layers, and full CNN pipelines.

CNNConvolutions+4
28 min
Read Notebook
Lesson #12
Advanced

12. Landmark CNN Architectures (LeNet to ResNet & ConvNeXt)

Evolution of computer vision backbones: LeNet-5, AlexNet, VGG-16/19, Inception modules, ResNet residual skip-connections, and modern ConvNeXt.

CNN ArchitecturesAlexNet+5
22 min
Read Notebook
Lesson #13
Advanced

13. Computer Vision Tasks (Detection, Segmentation, Tracking)

End-to-end computer vision: classification, object detection (YOLO, Faster R-CNN), semantic & instance segmentation (U-Net, Mask R-CNN), and mAP/IoU evaluation.

Computer VisionObject Detection+5
26 min
Read Notebook
Lesson #14
Intermediate

14. Sequence Models & Recurrent Neural Networks (RNN)

Processing temporal and sequential data: Recurrent Neural Network (RNN) hidden state dynamics, Backpropagation Through Time (BPTT), and vanishing gradients.

Sequence ModelsRNN+4
24 min
Read Notebook
Lesson #15
Intermediate

15. Long Short-Term Memory Networks (LSTM)

Overcoming long-term dependencies: Cell state highway, forget gate, input gate, output candidate generation, and bidirectional LSTM architectures.

LSTMCell State+5
24 min
Read Notebook
Lesson #16
Intermediate

16. Gated Recurrent Units (GRU)

Streamlined gated sequence processing: Reset and update gate mechanisms, hidden state interpolation, computational efficiency, and GRU vs LSTM comparison.

GRUReset Gate+4
20 min
Read Notebook
Lesson #17
Advanced

17. Attention Mechanisms (Bahdanau, Luong, Scaled Dot-Product)

The breakthrough in neural representations: Additive (Bahdanau) attention, multiplicative (Luong) attention, and Query-Key-Value mathematical formulation.

Attention MechanismBahdanau+4
24 min
Read Notebook
Lesson #18
Advanced

18. Transformers Architecture & Multi-Head Self-Attention

Attention Is All You Need: Scaled dot-product self-attention, Multi-Head Attention, sinusoidal and rotary positional encodings, feed-forward sublayers, and layer normalization.

TransformersSelf-Attention+4
28 min
Read Notebook
Lesson #19
Advanced

19. Transformer Families (BERT, GPT, T5, LLaMA & Decoder-Only)

Taxonomy of transformer models: Autoencoding (BERT Masked LM), Autoregressive (GPT causal decoder), Sequence-to-Sequence (T5), and modern open LLMs.

BERTGPT+6
18 min
Read Notebook
Lesson #20
Intermediate

20. High-Dimensional Embeddings & Vector Representations

Mapping discrete entities to dense continuous vector spaces: One-hot vs dense vectors, Word2Vec (Skip-gram & CBOW), subword tokenization, and vector similarity metrics.

EmbeddingsWord2Vec+4
18 min
Read Notebook
Lesson #21
Advanced

21. Autoencoders & Variational Autoencoders (VAE)

Unsupervised representation learning: Undercomplete, sparse, and denoising autoencoders, Variational Autoencoder (VAE) probabilistic latent spaces, and KL divergence.

AutoencodersVAE+4
20 min
Read Notebook
Lesson #22
Advanced

22. Generative Adversarial Networks (GAN)

Adversarial zero-sum game dynamics: Generator vs Discriminator architectures, minimax loss functions, mode collapse mitigation, and Wasserstein GAN with Gradient Penalty.

GANGenerator+5
16 min
Read Notebook