Portfolio

Análisis de datos

Machine Learning, análisis exploratorio y consultas avanzadas. Python y SQL aplicados a problemas reales donde los datos necesitan estructura, limpieza y un modelo que responda preguntas concretas.

Machine Learning

Modelos predictivos y de clasificación aplicados a problemas reales de negocio. Cada proyecto parte de una pregunta concreta y termina con una métrica que mide si la respuesta funciona.

Forecasting · Retail
El problema
Una cadena de supermercados perdía dinero cada semana: unas veces sobraba producto y acababa en la basura, otras faltaba y perdían ventas. El responsable de compras pedía basándose en su experiencia, pero no conseguía acertar.
La solución
Analicé cinco años de ventas semanales y entrené un modelo SARIMA que captura la tendencia y la estacionalidad oculta en los datos. Ahora el sistema predice la demanda de cada semana antes de hacer el pedido.
El resultado
2,21%MAPE
PythonSARIMAstatsmodels
Ver →
Clustering · Ciencia Política
El problema
Un equipo de investigación encuestó a 3.689 votantes con 9 preguntas sobre política, demografía y opinión. Cuando intentaron segmentarlos, el algoritmo agrupaba por edad y género — no por ideología. Los perfiles no tenían sentido.
La solución
Descarté las variables demográficas y entrené K-Means solo con las 4 preguntas de opinión real. Aparecieron tres perfiles ideológicos con posiciones claras sobre servicios públicos, fiscalidad y seguridad.
El resultado
9→4variables
PythonK-Meansscikit-learn
Ver →
Clasificación · Fitness
El problema
Un gimnasio con 300 socios necesitaba saber quién estaba satisfecho y quién estaba a punto de irse. Lanzaban encuestas, pero las respuestas no revelaban un patrón claro ni permitían actuar a tiempo.
La solución
Entrené un modelo XGBoost con los datos de uso real de cada socio. El resultado fue directo: la frecuencia de asistencia mensual concentra el 80% de la predicción. Ni el precio ni las instalaciones pesaban tanto.
El resultado
9/10aciertos
PythonXGBoostscikit-learn
Ver →
Ver más proyectos de Machine Learning en GitHub

Python

Análisis exploratorio con Python aplicado a problemas reales de negocio. Cada proyecto parte de un dataset, lo limpia, lo analiza y termina con un hallazgo que cambia la conversación.

EDA · Comercial
El problema
Una empresa de servicios con tres departamentos necesita decidir dónde reforzar plantilla. Se asume que los empleados más veteranos venden más, pero nadie lo ha comprobado con datos.
La solución
Diagnóstico de nulos, imputación justificada, ratios de productividad por departamento y matriz de correlación para validar si la edad predice las ventas.
El resultado
-0,1correlación edad–ventas
PandasNumPySeaborn
Ver →
EDA · Educación
El problema
El servicio de orientación de una universidad quiere saber qué hábitos predicen mejor la nota de examen para diseñar un programa de tutorías dirigido a estudiantes en riesgo.
La solución
Categorización con pd.cut(), comparación de grupos por mediana y percentiles, y panel de 6 visualizaciones: histogramas, scatter plots, heatmap y pairplot.
El resultado
+22puntos por estudiar > mediana
PandasMatplotlibSeaborn
Ver →
EDA · Salud
El problema
Una aseguradora de salud quiere reducir costes identificando tempranamente a los pacientes de riesgo cardiovascular alto y decidir si es justo ajustar primas según perfil de riesgo.
La solución
Conversión de categóricas a numéricas, ranking de factores de riesgo con correlación ordenada y segmentación de pacientes con groupby multi-métrica.
El resultado
-0,94correlación pasos–riesgo
PandasNumPyMatplotlib
Ver →
Ver más proyectos Python en GitHub

SQL

Consultas avanzadas, exploración de datos y análisis con T-SQL. Cada proyecto es autocontenido: crea sus tablas, carga datos realistas y resuelve problemas de negocio con CTEs, Window Functions y subqueries.

Análisis de ventas · Automoción
El problema
Una red de 50 concesionarios del Grupo Volkswagen necesita identificar a sus mejores vendedores, comparar rendimiento entre marcas y segmentar concesionarios por volumen de facturación.
La solución
CTEs encadenadas, subqueries correlacionadas, LAG() para variación mensual, PERCENTILE_CONT para distribución y RANK() para rankings. Cada ejercicio resuelto con doble enfoque.
El resultado
10ejercicios · doble enfoque
T-SQLCTEsSubqueries
Ver →
Window Functions · Fabricación
El problema
AdventureWorks necesita analizar el comportamiento de compra de sus clientes, crear rankings de productos por precio y medir el crecimiento interanual por cliente para identificar a los top 10.
La solución
ROW_NUMBER, RANK, DENSE_RANK, NTILE, sumas acumuladas con ROWS BETWEEN, LAG/LEAD para filas consecutivas y CTE + LAG para crecimiento YoY. Examen final tipo entrevista técnica.
El resultado
11+ejercicios progresivos
T-SQLWindow FunctionsLAG/LEAD
Ver →
Análisis de clientes · Retail
El problema
Una tienda de alimentación necesita segmentar clientes, clasificar productos, detectar patrones de compra y construir rankings cruzados por ciudad, categoría y proveedor.
La solución
LEFT JOIN para detectar gaps, CASE para clasificaciones de negocio (VIP/normal, frecuente/ocasional), CTEs + Window Functions y combinaciones avanzadas: top 3 clientes por ciudad, dashboard SQL.
El resultado
40ejercicios · 8 bloques
T-SQLCASERANK
Ver →
Ver más proyectos SQL en GitHub