Autumn 2025
Model calibration é sobre garantir que as probabilidades previstas por um modelo reflitam as probabilidades reais.
Em outras palavras, um modelo bem calibrado dá probabilidades que correspondem aos resultados reais.
Model calibration é sobre garantir que as probabilidades previstas por um modelo reflitam as probabilidades reais.
Em outras palavras, um modelo bem calibrado dá probabilidades que correspondem aos resultados reais.
Em resumo, se o seu modelo diz que algo tem 70% de chance de acontecer, esse evento deveria de fato acontecer cerca de 70% das vezes ao longo de muitas previsões desse tipo.
Temos dois classificadores:
Qual é melhor?
Temos dois classificadores:
Qual é melhor?
Bem, Model A é melhor porque se um modelo tem 90% de accuracy em sua previsão (prevendo corretamente 9 de 10 amostras), então seu confidence também deveria ser 90%.
O que acontece com o Model B?
O que acontece com o Model B?
O que acontece com o Model B?
Por outro lado, se houvesse um Model C com 90% de accuracy e 0.8 de confidence em cada previsão.
O que acontece com o Model B?
Por outro lado, se houvesse um Model C com 90% de accuracy e 0.8 de confidence em cada previsão.
Por definição, dizemos que um modelo está bem calibrado quando uma previsão de uma classe com confidence p está correta 100p% das vezes.
Caso contrário, os modelos underconfident e overconfident são chamados de ill-calibrated.
Abaixo está o reliability plot (discutido mais adiante) de um modelo ill-calibrated e um well-calibrated:
Abaixo está o reliability plot (discutido mais adiante) de um modelo ill-calibrated e um well-calibrated:
Isso significa que um modelo tem muitos falsos negativos!!
Previsões confiáveis – especialmente em áreas de alto risco como saúde, decisões legais, ou condução autônoma.
Melhor tomada de decisão – quando probabilidades são usadas para disparar ações (como alertas ou intervenções).
Previsões confiáveis – especialmente em áreas de alto risco como saúde, decisões legais, ou condução autônoma.
Melhor tomada de decisão – quando probabilidades são usadas para disparar ações (como alertas ou intervenções).
Estimativa de incerteza – útil em tarefas posteriores como ensembling, active learning, ou inferência Bayesiana.
Um modelo de detecção de covid onde, se o confidence for maior que 90%, o paciente é enviado ao médico.
Um modelo de detecção de covid onde, se o confidence for maior que 90%, o paciente é enviado ao médico.
Um modelo de detecção de covid onde, se o confidence for maior que 90%, o paciente é enviado ao médico.
Expected Calibration Error (ECE)
Maximum Calibration Error (MCE)
Reliability Diagrams – plota as probabilidades previstas vs. as reais.
ECE mede a diferença média entre o confidence previsto e o accuracy real — através de bins de previsões.
Divide as previsões em M bins, depois para cada bin B, calcula accuracy e confidence: \[ECE=\sum_{i=1}^M \frac{|B_i|}{n} |acc(B_i) - conf(B_i)|\]
Onde |B| é o número de amostras no bin B.
Um ECE menor significa melhor calibration.
MCE foca no pior bin — a diferença máxima entre confidence e accuracy em todos os bins. \[MCE = \max_{i=1}^{M} |acc(B_i) - conf(B_i)|\]
Destaca a maior lacuna de calibration.
Útil quando você se importa com qualquer má calibration, não só a média.