Descripción
Resumen:
Buscamos un Arquitecto de Plataforma para establecer el estándar en la construcción, implementación y operación de sistemas de ML e IA a gran escala, asumiendo la responsabilidad del recorrido desde el modelo hasta un servicio de producción confiable, con rigor DevOps.
Aspectos destacados:
1. Dar forma a cómo evoluciona la plataforma con nuevas escalas y dominios arquitectónicos
2. Abordar problemas complejos en sistemas de ML/IA con un alcance significativo para resolverlos
3. Impulsar la eficiencia de costos en ML y operar cargas de trabajo agénticas/LLM en producción
EL ROL
Buscamos un Arquitecto de Plataforma capaz de establecer el estándar sobre cómo construimos, implementamos y operamos sistemas de ML e IA a gran escala. Usted se sitúa en la intersección entre infraestructura de ML y SRE. Asumirá la responsabilidad del recorrido desde el modelo y la canalización hasta un servicio de producción confiable, y aplicará rigor DevOps a sistemas que históricamente han estado subingenierizados. El enfoque inmediato es la infraestructura de IA/ML en Google Cloud.
Este no es un rol centrado en el procesamiento de tickets, ni un rol de investigación. Usted abordará problemas complejos: confiabilidad en la prestación de modelos, costo y latencia de inferencia, canalizaciones reproducibles y operaciones de cargas de trabajo agénticas. Contará con el alcance necesario para resolverlos adecuadamente. Los profesionales senior aquí identifican problemas antes de que se les soliciten y elevan el nivel de lo que la plataforma puede lograr.
EN QUÉ TRABAJARÁ
* Construir y operar infraestructura para la prestación de modelos e inferencia, gestionando latencia, rendimiento, escalado automático y confiabilidad para inferencia en tiempo real y por lotes en múltiples inquilinos.
* Asumir el ciclo de vida de implementación de ML: registro de modelos, control de versiones, flujos de promoción, estrategias de lanzamiento (canary, shadow, A/B) y retrocesos seguros.
* Operar cargas de trabajo agénticas y LLM en producción, gestionando proveedores y pasarelas de inferencia, comportamiento de cuotas y limitación (límites de TPS/TUPS), salvaguardias, gestión de prompts/versiones y degradación elegante bajo carga.
* Construir canalizaciones de ML reproducibles y automatizadas: canalizaciones de entrenamiento, evaluación e implementación como código, incorporando trazabilidad y reproducibilidad.
* Extender la infraestructura como código (IaC) a los sistemas de ML, utilizando patrones de Terraform y diseños multi-proyecto que sometan la infraestructura de ML a los mismos estándares que el resto de la plataforma.
* Operar GitOps para cargas de trabajo de ML, asumiendo la configuración de ArgoCD y los flujos de promoción entre entornos e inquilinos.
* Ejecutar cargas de trabajo de ML e IA en Kubernetes multi-inquilino (GKE), gestionando la programación de GPU/acceleradores, la ubicación de cargas de trabajo, el aislamiento entre inquilinos y la capacidad consciente de costos.
* Asumir la confiabilidad y observabilidad de ML: SLO para servicios de inferencia, detección de desviación de modelos y datos, monitoreo de regresiones de rendimiento, calidad de alertas, ergonomía del turno de guardia y cultura de manuales de procedimientos.
* Impulsar la eficiencia de costos en ML mediante el ajuste adecuado de los aceleradores, la gestión de capacidad con compromiso de uso y máquinas virtuales Spot, y la atribución de costos de inferencia entre inquilinos y cargas de trabajo.
* Utilizar herramientas de codificación agéntica para trabajos de infraestructura y canalizaciones: configuración de entornos, generación y revisión de código IaC y de canalizaciones, y aceleración de la automatización.
LO QUE NO ENCONTRARÁ AQUÍ
Un equipo de plataforma que mantenga el statu quo. Estamos construyendo activamente: nuevos requisitos de escala, nuevos dominios arquitectónicos y una huella de ML/IA que crece rápidamente. Los ingenieros senior aquí dan forma a cómo evoluciona la plataforma, y las herramientas disponibles para hacerlo son mejores que nunca.
REQUISITOS OBLIGATORIOS
* 5 o más años en ingeniería de plataformas, SRE, MLOps o infraestructura, con experiencia significativa operando sistemas de producción a gran escala.
* Experiencia práctica desplegando y operando cargas de trabajo de ML o IA en producción: infraestructura de prestación, inferencia o entrenamiento de la que dependían usuarios reales.
* Base sólida en SRE/DevOps. Ha asumido la responsabilidad de la confiabilidad de servicios de producción, definido y medido SLO, realizado análisis post-mortem y liderado mejoras medibles.
* Conocimiento profundo de Terraform. Gestiona activamente estados complejos de Terraform, módulos reutilizables y configuraciones multi-proyecto en producción, con flujos de trabajo CI-driven para planificación/aplicación.
* Antecedentes sólidos en GitOps (ArgoCD o Flux en producción). Comprende profundamente la gestión declarativa de infraestructura y tiene opiniones fundamentadas sobre cómo hacerla bien.
* Conocimiento profundo de Kubernetes. Ha operado clústeres en producción, enfrentado modos reales de fallo y comprende el sistema a nivel del plano de control. Se prefiere fuertemente experiencia en producción con GKE (Standard y/o Autopilot).
* Conocimiento sólido de GCP: redes VPC, Compute Engine, IAM, Cloud Storage y diseño multi-proyecto/organización.
* Experiencia práctica con servicios de datos de GCP, especialmente BigQuery en producción: particionamiento y agrupamiento, ajuste de costos y rendimiento de consultas, y IAM a nivel de conjunto de datos. Familiaridad con al menos uno de los siguientes: Dataflow, Pub/Sub o Dataproc.
* Experiencia práctica construyendo y operando canalizaciones de CI/CD (GitHub Actions, Cloud Build, GitLab CI o equivalente), además de comprensión de cómo difieren las canalizaciones de ML de las CI/CD estándar para aplicaciones.
* Mentalidad orientada a la automatización a nivel senior. Implementa sistemas que eliminan categorías enteras de trabajo manual.
* Usuario activo de herramientas de codificación agéntica. Sabe dirigirlas eficazmente, revisar críticamente su salida y utilizarlas para multiplicar su productividad.
* Excelente comunicador. Puede articular con claridad decisiones operativas, compensaciones de rendimiento de modelos y resúmenes de incidentes tanto para ingenieros como para la dirección.
DESEABLE
* Experiencia en programación de GPU/acceleradores y gestión del ciclo de vida de nodos en producción (por ejemplo, aprovisionamiento automático de nodos en GKE, compartición temporal de GPU u otros equivalentes).
* Experiencia operando inferencia de LLM a gran escala, gestionando cuotas/limitaciones de proveedores (TPS/TUPS), pasarelas, caché y salvaguardias (por ejemplo, Vertex AI, Gemini API u otros equivalentes).
* Experiencia con herramientas de canalización y orquestación de ML como Argo Workflows, Kubeflow, Cloud Composer/Airflow, Vertex AI Pipelines u otras equivalentes.
* Experiencia con registros de modelos, almacenes de características y seguimiento de experimentos (por ejemplo, MLflow, Feast u otros equivalentes).
* Familiaridad con monitoreo de desviación de modelos y datos, y observabilidad específica para ML.
* Antecedentes en FinOps: atribución de costos de inferencia, planificación de descuentos por compromiso de uso (CUD) y reservas, y pronóstico de capacidad de aceleradores.
* Familiaridad con infraestructura de datos como almacenamiento de objetos, canalizaciones CDC o patrones lakehouse.
* Experiencia con infraestructura multi-inquilino: patrones de aislamiento, mitigación de vecinos ruidosos y gestión del ciclo de vida de inquilinos.
* Experiencia previa escalando infraestructura de ML o plataforma en una startup que avanza hacia requisitos empresariales.