Estudio comparativo de modelos de Machine Learning, preprocesamiento riguroso y optimización mediante Cross-Validation.
Ficha Técnica
Rol: Junior Data Analyst
Dataset: Pima Indians Diabetes Dataset (UCI Machine Learning Repository)
Tecnologías: Python, Scikit-Learn, TensorFlow/Keras, Seaborn, Pandas
1. Objetivo del Estudio
Evaluar y comparar algoritmos de aprendizaje automático supervisado para la detección temprana de diabetes mellitus a partir de variables clínicas no invasivas y de fácil acceso en atención primaria.
2. Preprocesamiento & Análisis Exploratorio (EDA)
Tratamiento de Inconsistencias: Identificación de ceros imposibles fisiológicamente (en Glucose, BMI, BloodPressure, SkinThickness) y sustitución por la mediana por variable para evitar sesgos sin perder muestras.
Estandarización: Escalado de variables mediante StandardScaler para algoritmos basados en distancias y gradientes.
Estructura de Datos: División de conjuntos en 80% entrenamiento y 20% test con estratificación de la clase objetivo.
3. Evaluación y Optimización de Modelos
Algoritmos Evaluados: Regresión Logística, K-Nearest Neighbors (KNN), Support Vector Machines (SVM), Random Forest y Red Neuronal Artificial (ANN).
Validación Cruzada (k=5): Implementación de k-fold cross-validation y ajuste mediante GridSearchCV para corregir problemas de sobreajuste (overfitting) detectados en el entrenamiento inicial.
Resultados:
La Regresión Logística demostró ser el modelo más equilibrado (Accuracy=0.80,Especificidad=0.82), ofreciendo alta interpretabilidad de los coeficientes clínicos.
La Red Neuronal (ANN) alcanzó un elevado Recall (0.90), posicionándose como una opción sólida para campañas de cribado masivo donde prima no dejar ningún caso positivo sin detectar.