Descripción
Resumen del Puesto:
El/La Data Engineer en Credicorp Capital asegurará la disponibilidad, calidad y escalabilidad de datos para soluciones de IA Generativa, construyendo pipelines ligeros y confiables.
Puntos Destacados:
1. Diseñar, construir y mantener pipelines de ingestión y transformación.
2. Modelar datos orientados a IA y preparar datasets para RAG/embeddings.
3. Orquestar workflows y exponer feeds/endpoints para consumo de IA.
**Credicorp Capital** te invita a Convertir Desafíos en Oportunidades y ser nuestro/a próximo/a **AI** **Data Engineer** para el equipo de **Gen AI Innovación**, en **Lima, Perú.**
***Misión:***
El Data Engineer asegura la disponibilidad, calidad y escalabilidad de los datos para soluciones de IA Generativa, mediante la construcción de pipelines ligeros y confiables. Su propósito es preparar, transformar y exponer datos que habiliten la operación óptima de agentes, copilotos y automatizaciones, en coordinación con equipos de IA y negocio.
***Funciones:***
* Diseñar, construir y mantener pipelines de ingestión, transformación y orquestación.
* Modelar datos orientados a IA y preparar datasets para RAG/embeddings.
* Aplicar controles de calidad y trazabilidad.
* Mantener CI/CD de pipelines de datos y documentación versionada.
* Orquestar workflows y exponer feeds/endpoints para consumo de agentes/copilotos y productos analíticos.
***Requisitos:***
* Profesional universitario de las carreras de Ingeniería de Sistemas, Computación, Ciencia de Datos o afines.
* Experiencia de 3–5 años en ingeniería de datos o integración de datos cloud.
* Experiencia construyendo pipelines y modelos de datos para analítica o IA (incluye preparación de datasets para RAG/LLMs).
* Participación en migraciones on‑prem cloud y orquestación de workflows de datos.
* Manejo de Inglés Técnico (Deseable Intermedio).
***Softwares y Tecnologías:***
* Azure Data Factory, Databricks, PySpark/Spark SQL, Delta Lake, Azure Synapse/Storage.
* SQL avanzado (SQL Server, PostgreSQL) y Python (intermedio–avanzado).
* Control de versiones y CI/CD: Git, GitHub/Bitbucket, GitHub Actions / Azure DevOps / Jenkins.
* Integración: APIs REST/JSON; consumo desde fuentes internas y externas.
* Deseable manejo de Airflow para orquestación adicional; Power BI para visualizaciones de soporte.
***Otros conocimientos:***
* Conceptos de linaje, calidad y gobierno de datos (solo para alineamiento).
* Diseño de modelos de datos orientados a IA (tabulares, semiestructurados) e implementación técnica con formatos optimizados (Parquet/Delta), particionamiento, esquemas y metadatos.
* Batch y streaming sobre Delta Lake; patrones de auditoría/versionado.
* Seguridad y privacidad (PII: anonimización/pseudonimización básica; controles de acceso).
* Integración de datos desde APIs, bases de datos y fuentes externas.
* Optimización de performance y costos en plataformas cloud.
***Conocimientos Deseables:***
* Exposición general a AWS o GCP (lectura de servicios equivalentes, despliegues simples o conocimientos básicos).
* Nociones de LLMOps para preparar datos y habilitar inferencia.
* Familiaridad con orquestación ligera (GitHub Actions, Data Factory, Airflow).
* Certificación AZ‑900; DP‑203, Databricks Data Engineer Associate, DP‑900, PL‑300\.
***Este anuncio se encuentra abierto para personas con discapacidad.***