Buscamos un/a Ingeniero/a Sr de Plataforma/Infraestructura para fortalecer nuestro equipo de plataforma e impulsar iniciativas de infraestructura cloud-native. Este rol se enfoca en desplegar y mantener servicios de Kubernetes, integrar plataformas de monitoreo y almacenamiento, y solucionar problemas de sistemas distribuidos para asegurar operaciones escalables y resilientes.
Trabajarás con herramientas basadas en Python, monitoreo basado en Prometheus, almacenamiento respaldado por Ceph y entornos de nube pública (AWS y Azure) para modernizar y operar nuestra plataforma. Esta es una oportunidad para dar forma a la confiabilidad y el rendimiento de la plataforma en un rol de ingeniería práctico.
Responsabilidades
- Diseñar, desplegar y mantener clústeres de Kubernetes en producción y servicios relacionados.
- Construir y mantener automatización y herramientas usando Python para soportar las operaciones de la plataforma.
- Integrar y operar Prometheus para monitoreo, alertas y observabilidad.
- Desplegar y gestionar soluciones de almacenamiento Ceph para cargas de trabajo distribuidas.
- Apoyar iniciativas de modernización de la plataforma y migrar servicios a patrones cloud-native.
- Solucionar y resolver problemas en sistemas distribuidos en las capas de cómputo, almacenamiento y red.
- Colaborar con los equipos de desarrollo, SRE y operaciones para definir requisitos de plataforma y SLAs.
- Documentar diseños de plataforma, runbooks y procedimientos operativos.
- Participar en rotaciones de guardia y respuesta a incidentes para mantener la disponibilidad de la plataforma.
Requisitos
- Más de 5 años de experiencia en roles de plataforma, infraestructura o ingeniería de confiabilidad de sitios (SRE).
- Experiencia comprobada desplegando y operando Kubernetes en producción.
- Sólidas habilidades en Python para automatización, herramientas y scripts operativos.
- Experiencia implementando y operando monitoreo y alertas basados en Prometheus.
- Experiencia práctica con Ceph o sistemas de almacenamiento distribuido similares.
- Experiencia en la nube con AWS y Azure (diseño, despliegue y operación de servicios).
- Capacidad demostrada para solucionar problemas de sistemas distribuidos y resolver incidentes de producción.
- Experiencia colaborando entre equipos para entregar mejoras y migraciones de plataforma.
Se valorará
- Experiencia con OpenSearch.
- Dominio de scripting Bash.
- Familiaridad con servicios basados en Java.
- Experiencia con Fluent Bit para recolección de logs.
- Experiencia trabajando con PostgreSQL.