Descripción
Resumen:
Buscamos un Ingeniero de Aseguramiento de la Calidad (QA) (nivel intermedio o senior) para asumir la responsabilidad de la calidad en sistemas impulsados por IA, probando funciones basadas en modelos de lenguaje grande (LLM) y definiendo métodos de verificación para sistemas no deterministas.
Aspectos destacados:
1. Realizar pruebas de extremo a extremo para agentes de IA, tuberías de indicaciones (prompts) e integraciones.
2. Diseñar estrategias de prueba para sistemas de IA no deterministas.
3. Trabajar en problemas novedosos de aseguramiento de la calidad (QA) de sistemas de IA, inventando nuevos enfoques.
### **El puesto**
Buscamos un Ingeniero de Aseguramiento de la Calidad (QA) (nivel intermedio o senior) capaz de asumir la responsabilidad de la calidad en sistemas impulsados por IA y en las integraciones asociadas. Este no es un rol tradicional de QA de aplicaciones. Probarás funciones impulsadas por LLM, tuberías de indicaciones (prompts), flujos de trabajo de agentes, integraciones con el protocolo de contexto de modelos (MCP) y las tuberías de entrega basadas en GitHub que los sustentan. Trabajarás directamente dentro de nuestros repositorios (incluidos degen\-engine y skeleton), colaborarás con ingenieros que utilizan Claude Code y Gemini Code Assist, y contribuirás a definir cómo verificamos sistemas no deterministas.
Si la pregunta «¿cómo se realiza el QA de un LLM?» es una que ya has comenzado a responder, ¡sigue leyendo!
### **Tus responsabilidades**
* Asumir la responsabilidad de extremo a extremo del QA para Skeleton: agentes de IA, tuberías de indicaciones (prompts), integraciones con el servidor MCP, trabajos programados (Vercel Cron), ingesta de datos (Apify) y flujos de base de datos (Drizzle ORM).
* Diseñar estrategias de prueba para sistemas no deterministas: entornos de evaluación, conjuntos de datos de referencia (golden datasets), suites de regresión para indicaciones (prompts), puntuación de calidad de salidas, detección de alucinaciones y desviaciones (drift).
* Escribir y mantener pruebas de integración en toda nuestra pila tecnológica (Next.js, TypeScript, pnpm, Vercel, Sentry, Jira), incluidas pruebas de contrato de API para integraciones con terceros.
* Ejecutar pruebas directamente en GitHub: revisar solicitudes de extracción (PR), ejecutar suites de pruebas en CI/CD, validar despliegues automáticos en la rama principal (main) y verificar correcciones antes de su lanzamiento.
* Colaborar con ingenieros que utilizan Claude Code, Gemini Code Assist y nuestro flujo general de desarrollo con IA —incluida la redacción de indicaciones (prompts) para pruebas, la validación de salidas del uso de herramientas (tool-use) y las pruebas de estrés sobre estrategias de caché de indicaciones (prompt caching).
* Construir y mantener monitoreo y observabilidad para funciones de IA en producción (Sentry, paneles de evaluación personalizados, seguimiento de costos y latencia).
* Definir umbrales de calidad (quality gates) y criterios de lanzamiento para funciones impulsadas por IA, y colaborar con el equipo de ingeniería en la respuesta ante incidencias cuando las salidas en producción presenten desviaciones.
* Diagnosticar y reproducir incidencias en sistemas integrados: cuando algo falle, rastrearás su origen desde la notificación en Slack, pasando por los registros de Vercel, las trazas de Sentry, la base de datos y hasta la indicación (prompt) original.
### **Qué buscamos**
### **Nivel intermedio (3–5 años)**
* 3 o más años de experiencia en QA / SDET / Ingeniería de pruebas en software en producción.
* Experiencia práctica probando funciones impulsadas por IA / LLM en producción (OpenAI, Anthropic, Gemini o similares) — evaluaciones de indicaciones (prompt evals), validación de salidas, pruebas de regresión.
* Conocimientos sólidos de TypeScript / JavaScript; capacidad para leer y escribir código, no solo realizar pruebas de caja negra.
* Experiencia con pilas tecnológicas web modernas: Next.js, APIs REST/GraphQL, arquitecturas sin servidor (Vercel / AWS Lambda) y al menos un ORM (Drizzle, Prisma, etc.).
* Dominio de Git y flujos de trabajo en GitHub: revisión de PR, protección de ramas, tuberías CI/CD y comprobaciones de estado.
* Experiencia escribiendo pruebas automatizadas con frameworks modernos (Vitest, Jest, Playwright, Cypress).
* Capacidad para trabajar en repositorios junto a ingenieros y contribuir directamente con código de pruebas —no limitarse únicamente a reportar incidencias.
### **Nivel senior (5+ años)**
* Todo lo requerido para el nivel intermedio, además de: experiencia profunda definiendo estrategias de QA para sistemas de IA / ML en producción.
* Historial comprobado construyendo frameworks de evaluación para salidas de LLM (LLM\-as\-judge, conjuntos de datos de referencia, pruebas A/B de indicaciones, suites de regresión para sistemas no deterministas).
* Experiencia con MCP (Model Context Protocol), uso de herramientas (function calling), frameworks de agentes o flujos de trabajo multi-paso con LLM.
* Capacidad para trabajar con pilas de observabilidad (Sentry, Datadog, paneles personalizados) y construirlas cuando no existan.
* Experiencia mentorizando a ingenieros en prácticas de calidad y moldeando la cultura general de pruebas en el equipo.
* Conocimiento de técnicas como caché de indicaciones (prompt caching), selección de modelos, gestión de contexto y otras estrategias para mantener los sistemas de IA rápidos y económicos en producción.
### **Deseable**
* Experiencia directa con Claude (API, Claude Code, SDK de Anthropic), Gemini Code Assist u otras herramientas de desarrollo con IA.
* Experiencia con Apify, Playwright u otros frameworks de raspado web o automatización de navegadores.
* Antecedentes en pruebas de tuberías de datos, flujos ETL o sistemas analíticos.
* Experiencia con automatización de Jira, aplicaciones de Slack o API de Notion.
* Contribuciones a proyectos de código abierto relacionados con herramientas de IA o frameworks de pruebas.
* Curiosidad por la ingeniería de indicaciones (prompt engineering), el diseño de agentes o la ciencia de la evaluación de modelos de lenguaje.
### **Por qué te encantará trabajar aquí**
* Trabajar en problemas verdaderamente novedosos: el QA para sistemas de IA se está inventando ahora mismo, y tú ayudarás a inventarlo aquí.
* Acceso directo a un pequeño equipo senior que construye desde cero tuberías de IA en producción —no es un rol de mantenimiento, sino uno de vanguardia.
* Pila tecnológica moderna, herramientas actuales y sin deuda técnica heredada que ralentice el progreso.