Visualization for Machine Learning

Autumn 2025

Aula de Hoje

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

Aula de Hoje

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

Por que Model Interpretation & Explanation?

  • Model Validation and Improvement
  • Decision Making and Knowledge Discovery
  • Gain Confidence and Obtain Trust

Machine-learning-assisted materials discovery using failed experiments

SVM derived decision tree
  • Os pesquisadores primeiro construíram um banco de dados de experimentos de química (novo material).
  • Depois treinaram um SVM para prever se um novo experimento de química teria sucesso.
  • Depois treinaram um DT surrogate para explicar o modelo e aprender mais sobre o experimento.

Por que Model Interpretation & Explanation?

https://arxiv.org/abs/1702.08608
  • Fairness
  • Privacy
  • Reliability or Robustness
  • Causality
  • Trust

Como Interpretamos o Model Behavior?

Os métodos para model interpretation de machine learning podem ser classificados de acordo com vários critérios.

  • White-box / Intrinsic interpretability: Modelos de machine learning considerados interpretable devido à sua estrutura simples, como short decision trees ou sparse linear models. A interpretability é obtida explicando a estrutura interna do modelo.

  • Black-box / Post-hoc interpretability: Modelos de machine learning difíceis de compreender totalmente em seu funcionamento interno (por exemplo, deep neural networks) são considerados black boxes. A interpretability é obtida explicando o model behavior após o training.

Taxonomy of Interpretability Methods

Aula de Hoje

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

White-box Models

Discutimos os seguintes modelos que são intrinsecamente interpretable: - Linear Regression - Generalized Additive Models (GAM) - Tree-based Models - Decision Rules

Linear Regression

Modelos lineares podem ser usados para modelar a dependência de um regression target y sobre algumas features x em um formato como abaixo: \[\begin{equation} y = \beta_0 + \beta_1 x_1 + \ldots + \beta_n x_n + \varepsilon\end{equation}\]

O predicted target \(y\) é uma combinação linear das weighted features \(\beta_i x_i\). A estimated linear equation é um hyperplane no espaço feature/target (uma linha simples no caso de uma única feature).

Os weights especificam a inclinação (gradient) do hyperplane em cada direção.

Linear Regression

Linear Regression: Um Exemplo de Preço de Imóvel

Como você interpreta a influência de cada propriedade na predição do preço do imóvel?

Evaluation do Modelo de Linear Regression

R Square

\(R^2\) (R-squared) \[\begin{equation} R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2} \end{equation}\]

Mean Square Error (MSE)/Root Mean Square Error (RMSE)

\[\begin{equation} MSE = \frac{1}{N} \sum_{i=1}^{N} (y_i - \hat{y}_i)^2 \end{equation}\]

Mean Absolute Error (MAE)

\[\begin{equation} MAE = \frac{1}{N} \sum_{i=1}^{N} |y_i - \hat{y}_i| \end{equation}\]

Visual Analytics (VA) Systems para Linear Regression

https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=6634169

Existe um trade-off entre a complexidade do modelo (número de features) e o accuracy.

Esse VA system ajuda na model building (feature ranking) e na model validation.

Pros e Cons dos Linear Models

Pros:

Cons:

Pros e Cons dos Linear Models

Pros:

Facilmente interpretable

Garantias estatísticas sobre a inference (se os supostos forem satisfeitos)

Sem hyperparameters (solução analítica)

Cons:

A relação de \(X\) com \(Y\) pode ser não-linear. Nesses casos, a linear regression pode não apresentar bons resultados.

Se certos supostos não forem satisfeitos (a saber, distribuição normal dos residuals e homoscedasticity), então a inference pode ser incorreta.

Limitações dos Linear Models

  • Assume-se que as features seguem uma distribuição Gaussian
  • Não há interações entre features

E se o seu dataset não seguir essas suposições?

Generalized Additive Models (GAMs)

Os generalized additive models estendem os modelos lineares padrão, permitindo funções não-lineares para cada uma das variáveis. \[\begin{equation} y_i = \beta_0 + \sum_{j=1}^{p} f_j(x_{ij}) + \varepsilon_i \\ = \beta_0 + f_1(x_{i1}) + f_2(x_{i2}) + \dots + f_p(x_{ip}) + \varepsilon_i \end{equation}\]

Generalized Additive Models (GAMs): Um Exemplo

\[\begin{equation} Wage = f(year, age, education) = b_0 + f_1(year) + f_2(age) + f_3(education) \end{equation}\]

Training de GAMs (Backfitting)

Generalized Additive Models (GAMs): Pros e Cons

Pros:

Os GAMs nos permitem ajustar uma \(f_j\) não-linear a cada \(X_j\), de modo que possamos modelar relações não-lineares facilmente.

Os ajustes não-lineares podem potencialmente levar a melhores predições.

Como o modelo é additive, podemos examinar o efeito de cada \(X_j\) sobre \(Y\) para cada observação. Isso é útil para visualization.

Cons:

Os GAMs são restritos a serem additive. Com muitas variáveis, interações importantes podem passar despercebidas ou ser computacionalmente inviáveis de encontrar.

Explainable Boosting Machines

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) \end{equation}\]

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) + \sum f_{ij}(x_i, x_j) \end{equation}\]

No entanto, assim como na linear regression, podemos adicionar manualmente interaction terms ao modelo GAM incluindo predictors adicionais na forma \(X_j \times X_k\). Além disso, podemos adicionar low-dimensional interaction functions na forma \(f_{jk}(X_j , X_k)\) ao modelo.

Explainable Boosting Machines

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) \end{equation}\]

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) + \sum f_{ij}(x_i, x_j) \end{equation}\]

E se tivermos muitas interações? Como escolhemos nossas interações?

Explainable Boosting Machines

Visualizando EBMs (ou GAMs)

Partial dependency plot

Visualizando EBMs (ou GAMs)

Partial dependency plot

Visualizando EBMs (ou GAMs)

Partial dependency plot

Visualizando EBMs (ou GAMs)

Partial dependency plot

Visual Analytics (VA) Systems que Usam GAMs

HTML tutorial

Visual Analytics (VA) Systems que Usam GAMs

Visual Analytics (VA) Systems que Usam GAMs

HTML tutorial

Github aqui.

Prática 1

Notebook aqui

Outras bibliotecas para PDP visualization: Scikit-learn interpret

BREAK

Tree-based Models: Exemplo

A decision tree of diabetes diagnosis

Visualization de Trees

https://treevis.net/ oferece uma galeria de tree visualization. Esses trees são usados para visualizar estruturas hierárquicas, não apenas modelos de machine learning baseados em trees.

VA Systems que Usam Tree-based Models

BaobabView

Mostra o fluxo das diferentes class, e a class distribution ao longo dos feature values.

VA Systems que Usam Tree-based Models

iForest

Decision Rules: Diferentes Estruturas

Rule List: If-then-else structure. Vê-se claramente como a decisão é tomada e qual rule é mais importante.

Rule Set: A set of if-then rules.

A decisão final é tomada com base em um mecanismo de voting.

Um estudo de usuários recente mostra que “if-then structure without any connecting else statements enables users to easily reason about the decision boundaries of classes.”

Decision Rules: Diferentes Estruturas

Disjunctive normal form (DNF, OR-of-ANDs) Conjunctive normal form (CNF, AND-of-ORs)

What form does this rule set follow?

Decision Rules: Fatores Visuais que Influenciam o Rule Understanding

Paper: https://arxiv.org/abs/2109.09160

Diferentes visualizations de rules podem levar a diferentes níveis de understanding das rules?

Se sim, quais são os fatores visuais que influenciam o understanding e como eles atuam no rule understanding?

Evaluation de Rules

Dada a seguinte rule:

Se \(X\), então class \(Y\).

Support / Coverage de uma rule:

\[\begin{equation} \text{Support} = \frac{\text{número de instances que atendem às condições em } X}{\text{número total de instances}} \end{equation}\]

Confidence / Accuracy de uma rule:

\[\begin{equation} \text{Confidence} = \frac{\text{número de instances que atendem às condições em } X \text{ e pertencem à class } Y}{\text{número de instances que atendem às condições em } X} \end{equation}\]

Global Surrogate

Imagine que temos um black-box model (complexo demais para entender a estrutura interna); podemos usar white-box models para nos ajudar a entender o model behavior do black-box model?

Global Surrogate

Abra a black box entendendo um “surrogate model” que aproxima o behavior do black-box model original.

No entanto…

O que você quer:

O que você obtém:

VA System para Rule List

RuleMatrix

VA Systems para Rules em Random Forest

Explainable Matrix

Outros white-box models?

  • Naive Bayes
  • K-nearest neighbors
  • etc.

Prática 2

Notebook aqui.

Aula de Hoje

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

Manipulando e Medindo a Model Interpretability

https://arxiv.org/abs/1802.07810

Stop explaining black box machine learning models for high stakes decisions

https://www.nature.com/articles/s42256-019-0048-x

Slice Finder: Automated Data Slicing for Model Validation

E se usássemos se a model prediction está errada ou não para treinar uma “surrogate tree”?

https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=8731353

Toolkits

InterpretML.