Pipeline de clasificación predictiva de riesgo coronario utilizando SMOTE y ensambles de árboles.
Ficha Técnica
Rol: Junior Data Analyst
Dataset: Heart Disease Dataset
Tecnologías: Python, Scikit-Learn, Imbalanced-Learn (SMOTE), Seaborn
1. Contexto
En bases de datos de salud, las patologías graves suelen estar infrarrepresentadas (clase minoritaria). Entrenar un modelo sin tratar el desbalance genera algoritmos sesgados hacia la clase sana.
2. Pipeline de Desarrollo
Tratamiento de Datos: Imputación de datos faltantes vía SimpleImputer y selección de las k=8 mejores características mediante SelectKBest (f-classif).
Balanceo de Clases: Aplicación del algoritmo SMOTE (Synthetic Minority Over-sampling Technique) sobre el conjunto de entrenamiento para generar muestras sintéticas de la clase con riesgo cardíaco.
Modelado Comparativo: Evaluación del impacto del balanceo comparando un DecisionTreeClassifier estándar frente a un RandomForestClassifier optimizado sobre el dataset transformado por SMOTE.