- Explorar las distribuciones muestrales de estadísticas de las variables numéricas en nuestro dataset
- Practicar el entrenamiento de modelos de Regresión Lineal Múltiple
- Tener un dataset que contenga variables numéricas
En este Postwork vamos a analizar la incertidumbre y los sesgos que existen en las medidas de locación y dispersión de nuestras variables numéricas. También vamos a practicar el entrenamiento de modelos de Regresión Lineal Múltiple, aunque eso no sea el objetivo de tu proyecto. Realiza los siguientes pasos:
- Identifica las variables numéricas en tu dataset y revisa las medidas de locación y dispersión que ya has realizado de ellas.
- Utilizando la técnica de bootstrap, explora las distribuciones muestrales de las estadísticas que obtuviste anteriormente y reporta:
a) La distribución, su asimetría y curtosis
b) El error estándar
c) El intervalo de confianza que te parezca más apropiado
- Si tiene sentido, elige algunas de tus variables numéricas para entrenar uno o más modelos de Regresión Lineal Múltiple. Utiliza las técnicas de división de dataset y validación cruzada de K-iteraciones para asegurarte de que tu modelo generalice.
- Comparte con tus compañeros y la experta tus hallazgos.
¡Mucha suerte!