ADVANCED LEVELLLM INFRA
AI & ML Infrastructure Topologies
Large Language Model Infrastructure: Building and Deploying Production AI Systems
Master production LLM infrastructure from token economics and GPU memory hierarchies to vLLM PagedAttention, continuous batching, quantization, speculative decoding, HNSW vector search, RAG pipelines, and autonomous agent execution engines.
Est. Duration
~16 Hours
Curriculum
10 Chapters • 40 Lessons
Capstones
7 Global Arena
Total Bounty
+845 XP
Your Progress0 of 40 Lessons (0%)
Start Here:Chapter 1.1 — How Large Language Models Process Text: The Transformer Architecture and Autoregressive Decoding
Curriculum Syllabus
10 Chapters • 40 Lessons
1.1How Large Language Models Process Text: The Transformer Architecture and Autoregressive Decoding
8 min+15 XP
1.2Tokenization Algorithms: Byte-Pair Encoding (BPE), SentencePiece, and Tiktoken⚔️ Landmark Capstone
9 min+50 XP
1.3Understanding Core LLM Performance Metrics: TTFT, TPOT, ITL, and Throughput
8 min+15 XP
1.4The Two Phases of LLM Inference: Compute-Bound Prefill vs Memory-Bound Decode
9 min+15 XP
2.1Modern GPU Architecture: Streaming Multiprocessors, Tensor Cores, and VRAM Hierarchy
9 min+15 XP
2.2Memory Bandwidth as the Fundamental LLM Bottleneck: HBM3e vs SRAM
8 min+15 XP
2.3Calculating GPU Memory Footprints: Formulas for Weights, KV Cache, and Overhead
9 min+15 XP
2.4Non-Weight Memory: Activation Memory, CUDA Context, and System Overhead
9 min+15 XP
3.1What is the Key-Value (KV) Cache? Accelerating Autoregressive Generation
9 min+15 XP
3.2Calculating KV Cache Memory Growth: Capacity Planning for Concurrency
9 min+15 XP
3.3Memory Fragmentation in Naive LLM Serving Systems
8 min+15 XP
3.4PagedAttention and vLLM Architecture: Virtual Memory for LLM Serving⚔️ Landmark Capstone
10 min+50 XP
4.1Continuous Batching Explained: Iteration-Level Scheduling in Modern LLM Servers⚔️ Landmark Capstone
9 min+50 XP
4.2FlashAttention 1, 2, and 3 Explained: Fast IO-Aware Exact Attention
9 min+15 XP
4.3Automatic Prefix Caching: Reusing KV Cache Across System Prompts and Multi-Turn Chats
9 min+15 XP
4.4Chunked Prefill: Eliminating Inter-Token Latency Jitter in Mixed Workloads
8 min+15 XP
5.1Fundamentals of Numerical Precision: FP32, FP16, BF16, and FP8 Explained
9 min+15 XP
5.2Post-Training Quantization (PTQ) vs Quantization-Aware Training (QAT)
8 min+15 XP
5.3Advanced Quantization Algorithms: AWQ and GPTQ Explained
9 min+15 XP
5.4Speculative Decoding: Breaking the Memory Wall with Draft Models⚔️ Landmark Capstone
9 min+50 XP
6.1Multi-GPU LLM Scaling: Memory Limits, Interconnects, and NVLink vs PCIe
9 min+15 XP
6.2Tensor Parallelism Explained: Splitting Attention and FFN Weights Across GPUs
9 min+15 XP
6.3Pipeline Parallelism in LLMs: Layer Partitioning and 1F1B Scheduling
9 min+15 XP
6.4Mixture-of-Experts (MoE) Architecture and Expert Parallelism
9 min+15 XP
7.1What are Vector Embeddings? High-Dimensional Semantic Mathematics Explained
8 min+15 XP
7.2Vector Distance Metrics: Cosine Similarity vs Dot Product vs Euclidean (L2)
9 min+15 XP
7.3Hierarchical Navigable Small World (HNSW) Indexing Explained⚔️ Landmark Capstone
10 min+50 XP
7.4IVF-PQ Vector Indexing: Scaling Vector Databases to Billions of Vectors
9 min+15 XP
8.1Why Naive RAG Fails in Production: Chunking Loss, Retrieval Gaps, and Hallucinations
8 min+15 XP
8.2Advanced Document Chunking and Preprocessing Strategies for RAG
9 min+15 XP
8.3Hybrid Search and Reciprocal Rank Fusion (RRF): Combining Vector + BM25 Search⚔️ Landmark Capstone
9 min+50 XP
8.4Re-Ranking and Query Transformation: Cross-Encoders, HyDE, and Sub-Query Decomposition
9 min+15 XP
9.1Building AI Agents: The ReAct Pattern (Reasoning + Acting) Explained
9 min+15 XP
9.2Structured Outputs and JSON Schema Constrained Decoding⚔️ Landmark Capstone
10 min+50 XP
9.3Agentic Workflow Architecture: State Machines vs DAGs (LangGraph Style)
9 min+15 XP
9.4Sandboxed Tool Execution for AI Agents: gVisor, WebAssembly, and MicroVMs
9 min+15 XP
10.1The AI Gateway Pattern: Routing, Fallbacks, Rate Limiting, and Load Balancing
9 min+15 XP
10.2Semantic Caching at the Edge: Sub-10ms AI Responses via Vector Similarity
8 min+15 XP
10.3AI Security and Guardrails: Defending Against Prompt Injection and PII Leaks
9 min+15 XP
10.4Continuous Evaluation and Tracing: The RAG Triad and LLM Observability
9 min+15 XP