Empresa busca Ingeniero/a de Plataforma/Infraestructura Senior con 5+ años de experiencia para unirse a su equipo y liderar iniciativas de infraestructura cloud-native, incluyendo Kubernetes, monitoreo con Prometheus y almacenamiento Ceph.
Buscamos un/a Ingeniero/a Sr de Plataforma/Infraestructura para fortalecer nuestro equipo de plataforma e impulsar iniciativas de infraestructura cloud-native. Este rol se enfoca en desplegar y mantener servicios de Kubernetes, integrar plataformas de monitoreo y almacenamiento, y solucionar problemas de sistemas distribuidos para asegurar operaciones escalables y resilientes. Trabajarás con herramientas basadas en Python, monitoreo basado en Prometheus, almacenamiento respaldado por Ceph y entornos de nube pública (AWS y Azure) para modernizar y operar nuestra plataforma. Esta es una oportunidad para dar forma a la confiabilidad y el rendimiento de la plataforma en un rol de ingeniería práctico. Responsabilidades: - Diseñar, desplegar y mantener clústeres de Kubernetes en producción y servicios relacionados. - Construir y mantener automatización y herramientas usando Python para soportar las operaciones de la plataforma. - Integrar y operar Prometheus para monitoreo, alertas y observabilidad. - Desplegar y gestionar soluciones de almacenamiento Ceph para cargas de trabajo distribuidas. - Apoyar iniciativas de modernización de la plataforma y migrar servicios a patrones cloud-native. - Solucionar y resolver problemas en sistemas distribuidos en las capas de cómputo, almacenamiento y red. - Colaborar con los equipos de desarrollo, SRE y operaciones para definir requisitos de plataforma y SLAs. - Documentar diseños de plataforma, runbooks y procedimientos operativos. - Participar en rotaciones de guardia y respuesta a incidentes para mantener la disponibilidad de la plataforma. Requisitos: - Más de 5 años de experiencia en roles de plataforma, infraestructura o ingeniería de confiabilidad de sitios (SRE). - Experiencia comprobada desplegando y operando Kubernetes en producción. - Sólidas habilidades en Python para automatización, herramientas y scripts operativos. - Experiencia implementando y operando monitoreo y alertas basados en Prometheus. - Experiencia práctica con Ceph o sistemas de almacenamiento distribuido similares. - Experiencia en la nube con AWS y Azure (diseño, despliegue y operación de servicios). - Capacidad demostrada para solucionar problemas de sistemas distribuidos y resolver incidentes de producción. - Experiencia colaborando entre equipos para entregar mejoras y migraciones de plataforma. Se valorará: - Experiencia con OpenSearch. - Dominio de scripting Bash. - Familiaridad con servicios basados en Java. - Experiencia con Fluent Bit para recolección de logs. - Experiencia trabajando con PostgreSQL.