Chat rápido, mejores ofertas — Descargar

Arquitecto de Plataforma (Infraestructura de IA/ML, centrado en GCP)

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoPresencial
Nivel de experienciaSin requisito de experiencia
Nivel educativoSin requisito de título

Descripción

Resumen: Buscamos un Arquitecto de Plataforma para establecer el estándar en la construcción, implementación y operación de sistemas de ML e IA a gran escala, asumiendo la responsabilidad del recorrido desde el modelo hasta un servicio de producción confiable, con rigor DevOps. Aspectos destacados: 1. Dar forma a cómo evoluciona la plataforma con nuevas escalas y dominios arquitectónicos 2. Abordar problemas complejos en sistemas de ML/IA con un alcance significativo para resolverlos 3. Impulsar la eficiencia de costos en ML y operar cargas de trabajo agénticas/LLM en producción EL ROL Buscamos un Arquitecto de Plataforma capaz de establecer el estándar sobre cómo construimos, implementamos y operamos sistemas de ML e IA a gran escala. Usted se sitúa en la intersección entre infraestructura de ML y SRE. Asumirá la responsabilidad del recorrido desde el modelo y la canalización hasta un servicio de producción confiable, y aplicará rigor DevOps a sistemas que históricamente han estado subingenierizados. El enfoque inmediato es la infraestructura de IA/ML en Google Cloud. Este no es un rol centrado en el procesamiento de tickets, ni un rol de investigación. Usted abordará problemas complejos: confiabilidad en la prestación de modelos, costo y latencia de inferencia, canalizaciones reproducibles y operaciones de cargas de trabajo agénticas. Contará con el alcance necesario para resolverlos adecuadamente. Los profesionales senior aquí identifican problemas antes de que se les soliciten y elevan el nivel de lo que la plataforma puede lograr. EN QUÉ TRABAJARÁ * Construir y operar infraestructura para la prestación de modelos e inferencia, gestionando latencia, rendimiento, escalado automático y confiabilidad para inferencia en tiempo real y por lotes en múltiples inquilinos. * Asumir el ciclo de vida de implementación de ML: registro de modelos, control de versiones, flujos de promoción, estrategias de lanzamiento (canary, shadow, A/B) y retrocesos seguros. * Operar cargas de trabajo agénticas y LLM en producción, gestionando proveedores y pasarelas de inferencia, comportamiento de cuotas y limitación (límites de TPS/TUPS), salvaguardias, gestión de prompts/versiones y degradación elegante bajo carga. * Construir canalizaciones de ML reproducibles y automatizadas: canalizaciones de entrenamiento, evaluación e implementación como código, incorporando trazabilidad y reproducibilidad. * Extender la infraestructura como código (IaC) a los sistemas de ML, utilizando patrones de Terraform y diseños multi-proyecto que sometan la infraestructura de ML a los mismos estándares que el resto de la plataforma. * Operar GitOps para cargas de trabajo de ML, asumiendo la configuración de ArgoCD y los flujos de promoción entre entornos e inquilinos. * Ejecutar cargas de trabajo de ML e IA en Kubernetes multi-inquilino (GKE), gestionando la programación de GPU/acceleradores, la ubicación de cargas de trabajo, el aislamiento entre inquilinos y la capacidad consciente de costos. * Asumir la confiabilidad y observabilidad de ML: SLO para servicios de inferencia, detección de desviación de modelos y datos, monitoreo de regresiones de rendimiento, calidad de alertas, ergonomía del turno de guardia y cultura de manuales de procedimientos. * Impulsar la eficiencia de costos en ML mediante el ajuste adecuado de los aceleradores, la gestión de capacidad con compromiso de uso y máquinas virtuales Spot, y la atribución de costos de inferencia entre inquilinos y cargas de trabajo. * Utilizar herramientas de codificación agéntica para trabajos de infraestructura y canalizaciones: configuración de entornos, generación y revisión de código IaC y de canalizaciones, y aceleración de la automatización. LO QUE NO ENCONTRARÁ AQUÍ Un equipo de plataforma que mantenga el statu quo. Estamos construyendo activamente: nuevos requisitos de escala, nuevos dominios arquitectónicos y una huella de ML/IA que crece rápidamente. Los ingenieros senior aquí dan forma a cómo evoluciona la plataforma, y las herramientas disponibles para hacerlo son mejores que nunca. REQUISITOS OBLIGATORIOS * 5 o más años en ingeniería de plataformas, SRE, MLOps o infraestructura, con experiencia significativa operando sistemas de producción a gran escala. * Experiencia práctica desplegando y operando cargas de trabajo de ML o IA en producción: infraestructura de prestación, inferencia o entrenamiento de la que dependían usuarios reales. * Base sólida en SRE/DevOps. Ha asumido la responsabilidad de la confiabilidad de servicios de producción, definido y medido SLO, realizado análisis post-mortem y liderado mejoras medibles. * Conocimiento profundo de Terraform. Gestiona activamente estados complejos de Terraform, módulos reutilizables y configuraciones multi-proyecto en producción, con flujos de trabajo CI-driven para planificación/aplicación. * Antecedentes sólidos en GitOps (ArgoCD o Flux en producción). Comprende profundamente la gestión declarativa de infraestructura y tiene opiniones fundamentadas sobre cómo hacerla bien. * Conocimiento profundo de Kubernetes. Ha operado clústeres en producción, enfrentado modos reales de fallo y comprende el sistema a nivel del plano de control. Se prefiere fuertemente experiencia en producción con GKE (Standard y/o Autopilot). * Conocimiento sólido de GCP: redes VPC, Compute Engine, IAM, Cloud Storage y diseño multi-proyecto/organización. * Experiencia práctica con servicios de datos de GCP, especialmente BigQuery en producción: particionamiento y agrupamiento, ajuste de costos y rendimiento de consultas, y IAM a nivel de conjunto de datos. Familiaridad con al menos uno de los siguientes: Dataflow, Pub/Sub o Dataproc. * Experiencia práctica construyendo y operando canalizaciones de CI/CD (GitHub Actions, Cloud Build, GitLab CI o equivalente), además de comprensión de cómo difieren las canalizaciones de ML de las CI/CD estándar para aplicaciones. * Mentalidad orientada a la automatización a nivel senior. Implementa sistemas que eliminan categorías enteras de trabajo manual. * Usuario activo de herramientas de codificación agéntica. Sabe dirigirlas eficazmente, revisar críticamente su salida y utilizarlas para multiplicar su productividad. * Excelente comunicador. Puede articular con claridad decisiones operativas, compensaciones de rendimiento de modelos y resúmenes de incidentes tanto para ingenieros como para la dirección. DESEABLE * Experiencia en programación de GPU/acceleradores y gestión del ciclo de vida de nodos en producción (por ejemplo, aprovisionamiento automático de nodos en GKE, compartición temporal de GPU u otros equivalentes). * Experiencia operando inferencia de LLM a gran escala, gestionando cuotas/limitaciones de proveedores (TPS/TUPS), pasarelas, caché y salvaguardias (por ejemplo, Vertex AI, Gemini API u otros equivalentes). * Experiencia con herramientas de canalización y orquestación de ML como Argo Workflows, Kubeflow, Cloud Composer/Airflow, Vertex AI Pipelines u otras equivalentes. * Experiencia con registros de modelos, almacenes de características y seguimiento de experimentos (por ejemplo, MLflow, Feast u otros equivalentes). * Familiaridad con monitoreo de desviación de modelos y datos, y observabilidad específica para ML. * Antecedentes en FinOps: atribución de costos de inferencia, planificación de descuentos por compromiso de uso (CUD) y reservas, y pronóstico de capacidad de aceleradores. * Familiaridad con infraestructura de datos como almacenamiento de objetos, canalizaciones CDC o patrones lakehouse. * Experiencia con infraestructura multi-inquilino: patrones de aislamiento, mitigación de vecinos ruidosos y gestión del ciclo de vida de inquilinos. * Experiencia previa escalando infraestructura de ML o plataforma en una startup que avanza hacia requisitos empresariales.

Parte del contenido se ha traducido automáticamente

Publicado por

María García

Indeed · HR

Ubicación

María García

Indeed · HR

Empleos similares

Arquitecto de Plataforma (Infraestructura de IA/ML, centrado en GCP) empleo de Indeed en 2026 | ok.com