Dimensionality Reduction es el proceso de reducir el número de variables aleatorias bajo consideración, obteniendo un conjunto de variables principales.
Dimensionality Reduction
¿Qué es Dimensionality Reduction?
Dimensionality Reduction es el proceso de reducir el número de variables aleatorias bajo consideración, obteniendo un conjunto de variables principales. Ayuda en:
Uniform Manifold Approximation and Projection (UMAP)
PCA
PCA
Idea central:
Se basa en la maximización de la varianza y la eigen decomposition.
PCA
Idea central:
Se basa en la maximización de la varianza y la eigen decomposition.
Propósito:
Encontrar un conjunto de ejes ortogonales (componentes principales) que capturen la máxima varianza en los datos.
PCA
Pasos:
Centrar los datos.
Calcular la matriz de covarianza: \(\sum = \frac{1}{n} X^T X\)
Calcular los eigenvectors y eigenvalues: \(\sum v_i = \lambda_i v_i\)
Proyectar los datos sobre el nuevo espacio: \(Z = X W_k\) donde \(W_k\) son los top-k eigenvectors.
Ejemplo en MNIST
MNIST Dataset
Dataset de imágenes de 28x28 píxeles de dígitos escritos a mano
MNIST Dataset
Cada imagen de MNIST puede pensarse como un arreglo de 28x28 números que describen qué tan oscuro es cada píxel:
Podemos aplanar cada arreglo en un vector de 28 * 28 = 784 dimensiones, donde cada componente del vector es un valor entre cero y uno que describe la intensidad del píxel
Podemos pensar en MNIST como una colección de vectores de 784 dimensiones
MNIST Dataset
¡Pero no todos los vectores en este espacio de 784 dimensiones son dígitos de MNIST! Los puntos típicos en este espacio son muy diferentes
Para tener una idea de cómo luce un punto típico, podemos elegir al azar algunas imágenes de 28x28 – cada píxel es aleatoriamente blanco, negro o algún tono de gris. Estos puntos aleatorios se ven como ruido:
MNIST Dataset
Las imágenes de 28x28 que se parecen a dígitos de MNIST son muy raras - conforman un subespacio muy pequeño del espacio de 784 dimensiones
Con algunos argumentos un poco más complejos, podemos ver que ocupan un subespacio de dimensión menor (que 748)
Muchas teorías sobre la estructura de menor dimensión de MNIST (y datos similares)
Hipótesis del manifold (popular entre investigadores de ML): MNIST es un manifold de baja dimensión que se curva a través de su embedding space de alta dimensión
Otra hipótesis (con raíces en topological data analysis) es que datos como MNIST consisten en blobs con protuberancias tipo tentáculo que sobresalen hacia el espacio circundante
¡Pero nadie lo sabe con certeza!
MNIST Cube
Imagina los puntos de datos de MNIST como puntos suspendidos en un cubo de 784 dimensiones
Cada dimensión del cubo corresponde a un píxel en particular
Los puntos de datos van de cero a uno según la intensidad del píxel
De un lado de la dimensión hay imágenes donde ese píxel es blanco. Del otro lado de la dimensión hay imágenes donde es negro. En el medio, hay imágenes donde es gris.
¿Cómo se ve este cubo si miramos una cara bidimensional en particular? Veamos las visualizations de Olah.
MNIST Cube
¿Qué cualidades tendría la visualization ‘perfecta’ de MNIST? ¿Cuál debería ser nuestro objetivo?
¿Cuál es la mejor forma de hacer clustering de los datos de MNIST?
Podemos intentar lo que aprendimos la semana pasada…
También se conoce como Principal Coordinates Analysis (PCoA).
MDS
También se conoce como Principal Coordinates Analysis (PCoA).
Idea central:
Se enfoca en preservar distancias usando eigenvalue decomposition de una matriz de similitud.
MDS
También se conoce como Principal Coordinates Analysis (PCoA).
Idea central:
Se enfoca en preservar distancias usando eigenvalue decomposition de una matriz de similitud.
Propósito:
Preservar las distancias por pares entre los puntos de datos en el embedding de baja dimensión.
MDS
Pasos:
Calcular la matriz de proximidad al cuadrado: \(D^2 = [d^2_{ij}]\)
Doble-centrar la matriz de distancias para obtener una matriz de similitud: \(B = - \frac{1}{2} C D^2 C\) Donde \(C=I-\frac{1}{n} J_n\) es la matriz de centrado y \(J_n = 11^T\) es la matriz de todos unos.
Realizar eigen decomposition: \(B = V \Sigma V^T\)
Usar los top eigenvectors como coordenadas de baja dimensión: \(X = V_k \Sigma_k ^{1/2}\)