Visualization for Machine Learning

Autumn 2025

Clase de Hoy

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

Clase de Hoy

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

¿Por qué Model Interpretation & Explanation?

  • Model Validation and Improvement
  • Decision Making and Knowledge Discovery
  • Gain Confidence and Obtain Trust

Machine-learning-assisted materials discovery using failed experiments

SVM derived decision tree
  • Los investigadores primero construyeron una base de datos de experimentos de química (nuevo material).
  • Luego entrenaron un SVM para predecir si un nuevo experimento de química tendría éxito.
  • Luego entrenaron un DT surrogate para explicar el modelo y aprender más sobre el experimento.

¿Por qué Model Interpretation & Explanation?

https://arxiv.org/abs/1702.08608
  • Fairness
  • Privacy
  • Reliability or Robustness
  • Causality
  • Trust

¿Cómo Interpretamos el Model Behavior?

Los métodos para model interpretation de machine learning se pueden clasificar según varios criterios.

  • White-box / Intrinsic interpretability: Modelos de machine learning que se consideran interpretable debido a su estructura simple, como short decision trees o sparse linear models. La interpretability se obtiene explicando la estructura interna del modelo.

  • Black-box / Post-hoc interpretability: Modelos de machine learning en los que es difícil obtener una comprensión completa de su funcionamiento interno (por ejemplo, deep neural networks) se consideran black boxes. La interpretability se obtiene explicando el model behavior después del training.

Taxonomy of Interpretability Methods

Clase de Hoy

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

White-box Models

Discutimos los siguientes modelos que son intrínsecamente interpretable: - Linear Regression - Generalized Additive Models (GAM) - Tree-based Models - Decision Rules

Linear Regression

Los modelos lineares se pueden usar para modelar la dependencia de un regression target y sobre algunas features x en un formato como el siguiente: \[\begin{equation} y = \beta_0 + \beta_1 x_1 + \ldots + \beta_n x_n + \varepsilon\end{equation}\]

El predicted target \(y\) es una combinación linear de las weighted features \(\beta_i x_i\). La estimated linear equation es un hyperplane en el espacio feature/target (una simple línea en el caso de una sola feature).

Los weights especifican la pendiente (gradient) del hyperplane en cada dirección.

Linear Regression

Linear Regression: Un Ejemplo de Precio de Vivienda

¿Cómo interpretas la influencia de cada propiedad en la predicción del precio de la vivienda?

Evaluation del Modelo de Linear Regression

R Square

\(R^2\) (R-squared) \[\begin{equation} R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2} \end{equation}\]

Mean Square Error (MSE)/Root Mean Square Error (RMSE)

\[\begin{equation} MSE = \frac{1}{N} \sum_{i=1}^{N} (y_i - \hat{y}_i)^2 \end{equation}\]

Mean Absolute Error (MAE)

\[\begin{equation} MAE = \frac{1}{N} \sum_{i=1}^{N} |y_i - \hat{y}_i| \end{equation}\]

Visual Analytics (VA) Systems para Linear Regression

https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=6634169

Existe un trade-off entre la complejidad del modelo (número de features) y el accuracy.

Este VA system ayuda a la model building (feature ranking) y a la model validation.

Pros y Cons de los Linear Models

Pros:

Cons:

Pros y Cons de los Linear Models

Pros:

Fácilmente interpretable

Garantías estadísticas sobre la inference (si se cumplen los supuestos)

Sin hyperparameters (solución analítica)

Cons:

La relación de \(X\) con \(Y\) puede ser no-linear. En estos casos, la linear regression puede no dar buenos resultados.

Si no se cumplen ciertos supuestos (a saber, distribución normal de los residuals y homoscedasticity), entonces la inference puede ser incorrecta.

Limitaciones de los Linear Models

  • Se asume que las features siguen una distribución Gaussian
  • No hay interacciones entre features

¿Qué pasa si tu dataset no sigue estos supuestos?

Generalized Additive Models (GAMs)

Los generalized additive models extienden los modelos lineares estándar permitiendo funciones no-lineares de cada una de las variables. \[\begin{equation} y_i = \beta_0 + \sum_{j=1}^{p} f_j(x_{ij}) + \varepsilon_i \\ = \beta_0 + f_1(x_{i1}) + f_2(x_{i2}) + \dots + f_p(x_{ip}) + \varepsilon_i \end{equation}\]

Generalized Additive Models (GAMs): Un Ejemplo

\[\begin{equation} Wage = f(year, age, education) = b_0 + f_1(year) + f_2(age) + f_3(education) \end{equation}\]

Training de GAMs (Backfitting)

Generalized Additive Models (GAMs): Pros y Cons

Pros:

Los GAMs nos permiten ajustar una \(f_j\) no-linear a cada \(X_j\), de modo que podamos modelar relaciones no-lineares fácilmente.

Los ajustes no-lineares pueden potencialmente llevar a mejores predicciones.

Como el modelo es additive, podemos examinar el efecto de cada \(X_j\) sobre \(Y\) para cada observación. Esto es útil para visualization.

Cons:

Los GAMs están restringidos a ser additive. Con muchas variables, interacciones importantes pueden pasarse por alto o ser computacionalmente inviables de encontrar.

Explainable Boosting Machines

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) \end{equation}\]

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) + \sum f_{ij}(x_i, x_j) \end{equation}\]

Sin embargo, al igual que con la linear regression, podemos añadir manualmente interaction terms al modelo GAM incluyendo predictors adicionales de la forma \(X_j \times X_k\). Además podemos añadir low-dimensional interaction functions de la forma \(f_{jk}(X_j , X_k)\) al modelo.

Explainable Boosting Machines

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) \end{equation}\]

\[\begin{equation} g(\mathbb{E}[y]) = \beta_0 + \sum f_j(x_j) + \sum f_{ij}(x_i, x_j) \end{equation}\]

¿Qué pasa si tenemos muchas interacciones? ¿Cómo elegimos nuestras interacciones?

Explainable Boosting Machines

Visualizando EBMs (o GAMs)

Partial dependency plot

Visualizando EBMs (o GAMs)

Partial dependency plot

Visualizando EBMs (o GAMs)

Partial dependency plot

Visualizando EBMs (o GAMs)

Partial dependency plot

Visual Analytics (VA) Systems que Usan GAMs

HTML tutorial

Visual Analytics (VA) Systems que Usan GAMs

Visual Analytics (VA) Systems que Usan GAMs

HTML tutorial

Github aquí.

Práctica 1

Notebook aquí

Otras librerías para PDP visualization: Scikit-learn interpret

BREAK

Tree-based Models: Ejemplo

A decision tree of diabetes diagnosis

Visualization de Trees

https://treevis.net/ ofrece una galería de tree visualization. Estos trees se usan para visualizar estructuras jerárquicas, no solo modelos de machine learning basados en trees.

VA Systems que Usan Tree-based Models

BaobabView

Muestra el flujo de distintas class, y la class distribution a lo largo de los feature values.

VA Systems que Usan Tree-based Models

iForest

Decision Rules: Diferentes Estructuras

Rule List: If-then-else structure. Se ve claramente cómo se toma la decisión y qué rule es más importante.

Rule Set: A set of if-then rules.

La decisión final se toma con base en un mecanismo de voting.

Un estudio de usuarios reciente muestra que “if-then structure without any connecting else statements enables users to easily reason about the decision boundaries of classes.”

Decision Rules: Diferentes Estructuras

Disjunctive normal form (DNF, OR-of-ANDs) Conjunctive normal form (CNF, AND-of-ORs)

What form does this rule set follow?

Decision Rules: Factores Visuales que Influyen en el Rule Understanding

Paper: https://arxiv.org/abs/2109.09160

¿Pueden distintas visualizations de rules llevar a distintos niveles de understanding de las rules?

Si es así, ¿cuáles son los factores visuales que influyen en el understanding y cómo juegan un papel en el rule understanding?

Evaluation de Rules

Dada la siguiente rule:

Si \(X\), entonces class \(Y\).

Support / Coverage de una rule:

\[\begin{equation} \text{Support} = \frac{\text{número de instances que cumplen las condiciones en } X}{\text{número total de instances}} \end{equation}\]

Confidence / Accuracy de una rule:

\[\begin{equation} \text{Confidence} = \frac{\text{número de instances que cumplen las condiciones en } X \text{ y pertenecen a la class } Y}{\text{número de instances que cumplen las condiciones en } X} \end{equation}\]

Global Surrogate

Imagina que tenemos un black-box model (demasiado complejo para entender la estructura interna), ¿podemos usar white-box models para ayudarnos a entender el model behavior del black-box model?

Global Surrogate

Abre la black box entendiendo un “surrogate model” que aproxima el behavior del black-box model original.

Sin embargo…

Lo que quieres:

Lo que obtienes:

VA System para Rule List

RuleMatrix

VA Systems para Rules en Random Forest

Explainable Matrix

¿Otros white-box models?

  • Naive Bayes
  • K-nearest neighbors
  • etc.

Práctica 2

Notebook aquí.

Clase de Hoy

  • Model Interpretation and Explanation
  • White-box Approaches and Visualizations
  • Related Research in VIS & AI

Manipulando y Midiendo la Model Interpretability

https://arxiv.org/abs/1802.07810

Stop explaining black box machine learning models for high stakes decisions

https://www.nature.com/articles/s42256-019-0048-x

Slice Finder: Automated Data Slicing for Model Validation

¿Qué tal si usamos si la model prediction es incorrecta o no para entrenar un “surrogate tree”?

https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=8731353

Toolkits

InterpretML.