Proyectos & Casos de Estudio
Arquitecturas de Datos, Data Lakehouses, Orquestación y Soluciones de Inteligencia Artificial
A continuación se presentan los principales proyectos y arquitecturas de ingeniería de datos, analítica y modelos predictivos diseñados e implementados en entornos empresariales:
Arquitectura Moderna de Data Lakehouse Abierto
Diseño y despliegue de una plataforma analítica empresarial moderna basada en el desacoplamiento total de almacenamiento y cómputo. Permite la ingesta masiva de datos estructurados y semiestructurados, reduciendo costos de infraestructura y maximizando la velocidad de consulta SQL.
Componentes Clave:
- Almacenamiento de Objetos: MinIO como capa de almacenamiento compatible con S3 de alto rendimiento.
- Formato de Tablas Abiertas: Apache Iceberg para soporte de transacciones ACID, viajes en el tiempo (time-travel) y evolución de esquemas.
- Transformación & Linaje: dbt (data build tool) para el modelado modular de datos, pruebas de integridad y documentación viva.
- Motor de Consultas Distribuido: Trino para consultas SQL federadas ultra rápidas sobre el Lakehouse y múltiples fuentes de datos.
Tecnologías: Apache Iceberg MinIO dbt Trino SQL Docker
Orquestación de Pipelines con Apache Airflow
Implementación de una plataforma centralizada de orquestación para automatizar la extracción, carga, transformación (ELT) y monitoreo de flujos de datos críticos del negocio con alta tolerancia a fallos.
Componentes Clave:
- Diseño de DAGs Modulares: Flujos de trabajo desacoplados en Python con ejecución paralela y control estricto de dependencias.
- Sensorización & Triggers: Detección automática de disponibilidad de archivos en S3/MinIO y eventos de bases de datos antes de disparar transformaciones.
- Monitoreo & Alertas en Tiempo Real: Notificaciones automáticas de fallos, tiempos de ejecución y auditoría de pipelines hacia canales de comunicación corporativos.
- Calidad de Datos: Integración de pruebas automáticas con dbt y validaciones de esquema previas a la actualización de reportes ejecutivos.
Tecnologías: Apache Airflow Python Bash PostgreSQL Slack Webhooks Linux
Agentes de Inteligencia Artificial (MCP) & Datos Corporativos
Desarrollo e integración de conectores Model Context Protocol (MCP) enlazados directamente a bases de datos y Data Warehouses (SingleStore / PostgreSQL) para dotar a asistentes y agentes de IA de contexto empresarial en tiempo real de forma segura y gobernada.
Componentes Clave:
- Conectividad Segura a Almacenes Analíticos: Exposición de herramientas e interfaces SQL controladas para que modelos de lenguaje consulten métricas de negocio sin comprometer la seguridad.
- Analítica en Lenguaje Natural: Capacidad de realizar consultas complejas de negocio (“¿Cuál fue el churn de clientes este trimestre?”) y obtener respuestas respaldadas por datos oficiales.
- Gobernanza de Esquemas: Catálogo dinámico de metadatos y definiciones de métricas compartidas para garantizar precisión y evitar alucinaciones en modelos de IA.
Tecnologías: MCPs SingleStore Python LLM Agents SQL APIs
Sistemas Predictivos de Churn & Customer Lifetime Value
Construcción y puesta en producción de modelos de aprendizaje automático orientados a predecir la probabilidad de fuga de clientes (Churn) y estimar el valor económico esperado a largo plazo (CLTV).
Componentes Clave:
- Ingeniería de Características (Feature Store): Creación de variables RFM (Recencia, Frecuencia, Valor Monetario), métricas de interacción y comportamiento transaccional.
- Modelos de Clasificación & Regresión: Algoritmos supervisados para scoring periódico de la base de clientes.
- Activación de Negocio: Integración de los puntajes predictivos en cuadros de mando en Power BI para que los equipos comerciales ejecuten campañas de retención preventivas.
Tecnologías: Machine Learning Python R Power BI Scikit-Learn CLTV
Clasificación de Sentimientos en NPS con Modelos Híbridos & BETO
Investigación y desarrollo de modelos avanzados de Procesamiento de Lenguaje Natural para clasificar sentimientos y opiniones no estructuradas en encuestas de satisfacción Net Promoter Score (NPS), comparando arquitecturas recurrentes y transformers en español.
Componentes Clave:
- Preprocesamiento & Balanceo de Clases: Limpieza lingüística, lematización profunda y estrategias ante el desbalance severo en encuestas NPS.
- Redes Neuronales Recurrentes (BiLSTM + Attention): Arquitectura bidireccional con mecanismo de atención para capturar dependencias de contexto y polaridad.
- Transfer Learning con BETO: Ajuste fino (Fine-Tuning) de BERT entrenado en español para maximizar precisión y F1-Score en clientes pasivos y detractores.
- Presentación Revealjs Interactiva: Diapositivas dinámicas con visualizaciones en Altair, comparativa de métricas experimentales y evaluación cualitativa.
Tecnologías: Python PyTorch Transformers (BETO) BiLSTM + Attention NLP Altair Quarto Revealjs