Fundamentos de Evals & Engenharia de Testes de IA

Fundamentos de Evals & Engenharia de Testes de IA: 12 aulas em 3 módulos da formação Formação IA Harness: Test & Evaluation Harness para IA.

Módulos e aulas

Por que Testar LLMs é Diferente

Nível 3 · 4 aulas

  1. Do 'Vibe Coding' à Engenharia de Precisão: O Fim dos Testes no Olhômetro
  2. Estocasticidade, Temperatura e a Natureza Não-Determinística dos LLMs
  3. O Problema da Regressão Silenciosa de Prompts (Prompt Drift)
  4. Anatomia de um Framework de Avaliação: Datasets, Runners e Scorers

Taxonomia de Métricas de Avaliação

Nível 3 · 4 aulas

  1. Métricas Determinísticas: Regex, JSON Schema, Validação de Tipos e Invariantes
  2. Métricas Semânticas: Similaridade Cosseno com Embeddings e Distância Vetorial
  3. Métricas Tradicionais de NLP: BLEU, ROUGE, Exact Match e F1-Score
  4. LLM-as-a-Judge: Princípios, Potencialidades e Cuidados Críticos

Golden Datasets & Red Teaming

Nível 3 · 4 aulas

  1. Construindo um Golden Dataset: Curadoria de Casos Reais e Validação Humana
  2. Geração de Casos de Teste Sintéticos com IA e Variações Linguísticas
  3. Curadoria e Versionamento de Fixtures com Git LFS e DVC
  4. Red Teaming e Testes Adversariais: Injeção de Prompt, Jailbreaks e Ataques de Fuga