Servidores de Inferência de Alta Vazão

Servidores de Inferência de Alta Vazão: 12 aulas em 3 módulos da formação Formação em Infraestrutura Soberana & LLMs Locais.

Módulos e aulas

vLLM: PagedAttention, Continuous Batching e Throughput de Produção

Nível 5 · 4 aulas

  1. Arquitetura Interna do vLLM e o Algoritmo PagedAttention
  2. Continuous Batching e Escalonamento por Iteração (Iteration-Level Scheduling)
  3. Configuração do Servidor vLLM OpenAI-Compatible em Produção
  4. Prefix Caching e Otimização de Prompts de Sistema

llama.cpp e Ollama em Produção: CPU Offload e Quantização GGUF

Nível 3 · 4 aulas

  1. Arquitetura do llama.cpp e o Formato Binário GGUF
  2. Offloading Híbrido de Camadas (CPU/GPU) no llama.cpp
  3. Deploy de Ollama e Gestão de Modelos em Ambientes Corporativos
  4. Benchmarking de Performance: vLLM vs SGLang vs llama.cpp vs TensorRT-LLM

Multi-GPU, Tensor Parallelism e Escalabilidade Horizontal

Nível 5 · 4 aulas

  1. Paralelismo de Tensores (Tensor Parallelism) e Operações All-Reduce
  2. Pipeline Parallelism para Modelos Massivos (70B a 405B)
  3. Orquestração de Clusters Ray com vLLM para Inferência Multi-Nó
  4. Otimizações de Rede NCCL, InfiniBand e RoCEv2 para Clusters Multi-GPU