Desbloquee descubrimientos ocultos utilizando ydata-profile
El análisis de datos exploratorios (EDA) juega un papel importante en la ciencia de datos, ya que nos permite obtener información y comprender patrones dentro de una base de datos. En uno de mis artículos anteriores, presenté la conveniencia de una biblioteca de Python llamada «Pandas GUI», que es una herramienta back-end externa de Python EDA.
Ahora, centrémonos en «ydata-profiling», un proveedor de la popular biblioteca «pandas-profiling». «ydata-profiling» ofrece capacidades EDA avanzadas e incluye los detalles de sus predecesores, lo que lo convierte en un recurso único para científicos y analistas de datos.
Como siempre, antes de que podamos comenzar a usar la biblioteca, debemos instalarla. pip.
pip install ydata-profiling
Para implementar EDA, necesitamos tener una base de datos. Utilicemos uno de los conjuntos de datos públicos más populares: el conjunto de datos Iris para esta demostración. Puede obtenerlo en la biblioteca de Sci-kit Learn. Sin embargo, para hacerlo más fácil, dado que no usaremos la biblioteca Sci-kit Learn en esta demostración, he incluido los datos sobre datahub.io sitio web que puede utilizar directamente.
https://datahub.io/machine-learning/iris/r/iris.csv
Podemos cargar fácilmente datos desde la URL al marco de datos de Pandas como se muestra a continuación.
import pandas as pddf = pd.read_csv("https://datahub.io/machine-learning/iris/r/iris.csv")
df.head()
Entonces podemos importar ProfileReport módulo de la biblioteca ydata-profile para generar un informe EDA a partir del marco de datos de pandas.
from ydata_profiling…

