Empresa busca un Ingeniero de Confiabilidad de Sitio (SRE) con experiencia en Azure, Kubernetes, observabilidad y scripting para asegurar la confiabilidad y escalabilidad de plataformas cloud-native. Se requiere experiencia en producción y manejo de herramientas como Azure Monitor, Prometheus, Grafana y Terraform/Bicep.
Si te apasiona la confiabilidad y escalabilidad de plataformas cloud en Azure y Kubernetes, este puesto remoto es para vos. Podrás aplicar tu experiencia en observabilidad y automatización para mejorar sistemas en producción.
Jalasoft busca un Ingeniero de Confiabilidad de Sitio (SRE) para unirse a nuestro equipo y ayudar a garantizar la confiabilidad, escalabilidad y rendimiento de las plataformas cloud-native que se ejecutan en Microsoft Azure y Kubernetes. El candidato ideal es un apasionado de la observabilidad, la automatización y la excelencia operativa, con experiencia en la mejora de la disponibilidad del sistema, el monitoreo, la respuesta a incidentes y la automatización de infraestructura en entornos de producción. Años de experiencia requeridos: - 6+ años de experiencia - 3+ años de experiencia operando Kubernetes en producción Requisitos indispensables: - Ingeniería de confiabilidad de sitio u operaciones de producción para cargas de trabajo de Kubernetes a escala. - Azure Monitor, Log Analytics y KQL, incluyendo diseño de espacios de trabajo, reglas de recopilación de datos y estrategia de retención. - Prometheus y Grafana: métricas y exportadores, reglas de grabación y alerta, y diseño de paneles. - Definición e implementación de indicadores de nivel de servicio (SLI), objetivos (SLO) y presupuestos de error (error budgets). - Diseño de alertas y respuesta a incidentes, incluyendo redacción de runbooks y práctica de guardia (on-call). - Diseño y pruebas de backup, restauración y recuperación ante desastres, incluyendo validación contra objetivos de RPO y RTO. - Operaciones de Kubernetes: solución de problemas de cargas de trabajo, gestión de recursos y actualizaciones de clúster. - Capacidad para leer y modificar infraestructura como código (Terraform o Bicep) y pipelines de Azure DevOps. - Scripting en Python, PowerShell o Bash. - Inglés profesional funcional. Requisitos deseables: - Azure Managed Prometheus y Azure Managed Grafana. - Instrumentación con OpenTelemetry y tracing distribuido. - Azure Backup, Azure Site Recovery y recuperación basada en snapshots de máquinas virtuales. - Ingeniería del caos o práctica estructurada de game day. - Observabilidad a nivel de base de datos, particularmente para Oracle. - Gestión de costos y capacidad para entornos AKS. - Herramientas de gestión de incidentes y práctica de postmortems. - Certificación: CKA, AZ-400 o equivalente. Beneficios: - Trabajo remoto - 13 días feriados flotantes - 15 días de vacaciones por año cumplido - Buen ambiente de trabajo Cada candidato calificado que cumpla con los requisitos descritos en la descripción del puesto será considerado en este proceso de contratación sin distinción. Además, Jalasoft es un empleador que ofrece igualdad de oportunidades. Aceptamos de todo corazón nuestra responsabilidad de tomar decisiones de empleo sin distinción de raza, edad, estado civil o social, origen nacional, discapacidad, sexo, identidad o expresión de género, o cualquier otra característica o grupo de candidatos o empleados que no esté relacionado con sus calificaciones y idoneidad para el puesto. Nuestra gerencia se compromete a defender esta política con respeto.