Byronvinu
  • Inicio
  • Proyectos
  • CV

Proyectos & Casos de Estudio

Arquitecturas de Datos, Data Lakehouses, Orquestación y Soluciones de Inteligencia Artificial

A continuación se presentan los principales proyectos y arquitecturas de ingeniería de datos, analítica y modelos predictivos diseñados e implementados en entornos empresariales:


Data Lakehouse Arquitectura

Arquitectura Moderna de Data Lakehouse Abierto

Diseño y despliegue de una plataforma analítica empresarial moderna basada en el desacoplamiento total de almacenamiento y cómputo. Permite la ingesta masiva de datos estructurados y semiestructurados, reduciendo costos de infraestructura y maximizando la velocidad de consulta SQL.

Componentes Clave:
  • Almacenamiento de Objetos: MinIO como capa de almacenamiento compatible con S3 de alto rendimiento.
  • Formato de Tablas Abiertas: Apache Iceberg para soporte de transacciones ACID, viajes en el tiempo (time-travel) y evolución de esquemas.
  • Transformación & Linaje: dbt (data build tool) para el modelado modular de datos, pruebas de integridad y documentación viva.
  • Motor de Consultas Distribuido: Trino para consultas SQL federadas ultra rápidas sobre el Lakehouse y múltiples fuentes de datos.

Tecnologías: Apache Iceberg MinIO dbt Trino SQL Docker

Orquestación Data Pipelines

Orquestación de Pipelines con Apache Airflow

Implementación de una plataforma centralizada de orquestación para automatizar la extracción, carga, transformación (ELT) y monitoreo de flujos de datos críticos del negocio con alta tolerancia a fallos.

Componentes Clave:
  • Diseño de DAGs Modulares: Flujos de trabajo desacoplados en Python con ejecución paralela y control estricto de dependencias.
  • Sensorización & Triggers: Detección automática de disponibilidad de archivos en S3/MinIO y eventos de bases de datos antes de disparar transformaciones.
  • Monitoreo & Alertas en Tiempo Real: Notificaciones automáticas de fallos, tiempos de ejecución y auditoría de pipelines hacia canales de comunicación corporativos.
  • Calidad de Datos: Integración de pruebas automáticas con dbt y validaciones de esquema previas a la actualización de reportes ejecutivos.

Tecnologías: Apache Airflow Python Bash PostgreSQL Slack Webhooks Linux

Inteligencia Artificial Model Context Protocol

Agentes de Inteligencia Artificial (MCP) & Datos Corporativos

Desarrollo e integración de conectores Model Context Protocol (MCP) enlazados directamente a bases de datos y Data Warehouses (SingleStore / PostgreSQL) para dotar a asistentes y agentes de IA de contexto empresarial en tiempo real de forma segura y gobernada.

Componentes Clave:
  • Conectividad Segura a Almacenes Analíticos: Exposición de herramientas e interfaces SQL controladas para que modelos de lenguaje consulten métricas de negocio sin comprometer la seguridad.
  • Analítica en Lenguaje Natural: Capacidad de realizar consultas complejas de negocio (“¿Cuál fue el churn de clientes este trimestre?”) y obtener respuestas respaldadas por datos oficiales.
  • Gobernanza de Esquemas: Catálogo dinámico de metadatos y definiciones de métricas compartidas para garantizar precisión y evitar alucinaciones en modelos de IA.

Tecnologías: MCPs SingleStore Python LLM Agents SQL APIs

Machine Learning Analítica Predictiva

Sistemas Predictivos de Churn & Customer Lifetime Value

Construcción y puesta en producción de modelos de aprendizaje automático orientados a predecir la probabilidad de fuga de clientes (Churn) y estimar el valor económico esperado a largo plazo (CLTV).

Componentes Clave:
  • Ingeniería de Características (Feature Store): Creación de variables RFM (Recencia, Frecuencia, Valor Monetario), métricas de interacción y comportamiento transaccional.
  • Modelos de Clasificación & Regresión: Algoritmos supervisados para scoring periódico de la base de clientes.
  • Activación de Negocio: Integración de los puntajes predictivos en cuadros de mando en Power BI para que los equipos comerciales ejecuten campañas de retención preventivas.

Tecnologías: Machine Learning Python R Power BI Scikit-Learn CLTV

NLP & Deep Learning Presentación Interactiva

Clasificación de Sentimientos en NPS con Modelos Híbridos & BETO

Investigación y desarrollo de modelos avanzados de Procesamiento de Lenguaje Natural para clasificar sentimientos y opiniones no estructuradas en encuestas de satisfacción Net Promoter Score (NPS), comparando arquitecturas recurrentes y transformers en español.

Componentes Clave:
  • Preprocesamiento & Balanceo de Clases: Limpieza lingüística, lematización profunda y estrategias ante el desbalance severo en encuestas NPS.
  • Redes Neuronales Recurrentes (BiLSTM + Attention): Arquitectura bidireccional con mecanismo de atención para capturar dependencias de contexto y polaridad.
  • Transfer Learning con BETO: Ajuste fino (Fine-Tuning) de BERT entrenado en español para maximizar precisión y F1-Score en clientes pasivos y detractores.
  • Presentación Revealjs Interactiva: Diapositivas dinámicas con visualizaciones en Altair, comparativa de métricas experimentales y evaluación cualitativa.

Tecnologías: Python PyTorch Transformers (BETO) BiLSTM + Attention NLP Altair Quarto Revealjs

Abrir Presentación Interactiva (Revealjs) →

© 2026 Byron Vinueza. Desarrollado con Quarto.