Empresa de infraestructura financiera busca un Ingeniero de Confiabilidad de Sitio (SRE) para su plataforma de telemetría compartida, enfocándose en métricas, logs, traces y alertas.
Si te apasionan los sistemas distribuidos y la observabilidad, este puesto remoto en Kraken es para vos. Podrás trabajar en la plataforma de telemetría de una empresa líder en infraestructura financiera, mejorando prácticas operativas y resolviendo problemas de producción.
BUILDING THE FUTURE OF OPEN FINANCE Payward, la empresa matriz detrás de Kraken, NinjaTrader, Breakout, xStocks, Payward Services y CF Benchmarks, ha pasado los últimos 15 años construyendo una de las plataformas de infraestructura financiera más modernas y accesibles a nivel mundial, diseñada para promover un sistema financiero global y abierto. Antes de postularte, te animamos a explorar nuestra página de cultura https://www.kraken.com/culture para entender qué nos impulsa y cómo trabajamos. EL EQUIPO Fundado en 2011, Kraken es una de las plataformas de criptomonedas más antiguas del mundo, confiada por más de 10 millones de personas e instituciones en todo el globo. Ofrece trading spot, margen, futuros, staking y servicios OTC, con productos diseñados tanto para inversores individuales como para clientes institucionales. Únete a nuestro equipo de ingeniería como Ingeniero de Confiabilidad de Sitios (Site Reliability Engineer) enfocado en la plataforma de telemetría compartida que ayuda a los equipos a entender, operar y mejorar los servicios de producción. Trabajarás con métricas, logs, traces, alertas, dashboards y sistemas de profiling que hacen que nuestra plataforma sea observable a escala. Como miembro del equipo de Telemetría, ayudarás a mantener la confiabilidad y escalabilidad de los sistemas que recopilan, almacenan, consultan y enrutan datos operativos. Este es un rol práctico para un ingeniero que disfruta de los sistemas distribuidos, la automatización, la observabilidad y la resolución de problemas de producción. Trabajarás con Ingenieros de Software, equipos de Plataforma, Ingenieros de Seguridad e Ingenieros de Confiabilidad de Sitios para mejorar las prácticas operativas y dar soporte a servicios críticos para la misión. El rol incluye respuesta a incidentes, guardias (on-call), mejoras de plataforma y ayuda a los equipos a usar la telemetría de manera efectiva. LA OPORTUNIDAD - Operar y mejorar la plataforma compartida para métricas, logs, traces, alertas, dashboards y profiling. - Mantener la recopilación de métricas, almacenamiento a largo plazo, consultas, dashboards y alertas utilizando sistemas compatibles con Prometheus, VictoriaMetrics, Grafana y herramientas de alerta modernas. - Operar pipelines de logs utilizando Vector, Splunk y Loki, incluyendo confiabilidad, rendimiento y troubleshooting. - Operar capacidades de distributed tracing y profiling utilizando Grafana Alloy, Tempo, OpenTelemetry y Pyroscope. - Desplegar y gestionar servicios de telemetría utilizando Terraform, Terragrunt y orquestación de contenedores en múltiples entornos. - Solucionar problemas de datos faltantes, consultas lentas, alertas rotas, backpressure en pipelines y problemas de capacidad. - Construir configuraciones reutilizables y automatización que ayuden a los equipos a gestionar dashboards, alertas e integraciones de telemetría de forma segura. - Participar en respuesta a incidentes y guardias (on-call), escribir runbooks y mejorar la plataforma utilizando lo aprendido de los incidentes. QUÉ APORTAS - Más de 3 años de experiencia como Ingeniero de Confiabilidad de Sitios, Ingeniero de Plataforma/Infraestructura, Ingeniero de Observabilidad o un rol similar de ingeniería de producción. - Comodidad gestionando sistemas de producción a escala que recopilan, procesan, almacenan y sirven telemetría como métricas, logs, traces o perfiles. - Experiencia con Prometheus o un stack de monitoreo compatible con Prometheus, incluyendo recopilación de métricas, consultas y alertas. - Experiencia en la resolución de problemas de sistemas de producción distribuidos, incluyendo disponibilidad, latencia, flujo de datos y problemas de capacidad. - Experiencia con Infraestructura como Código (Infrastructure as Code), particularmente Terraform, y CI/CD. - Experiencia operando cargas de trabajo contenerizadas con Nomad, Kubernetes o plataformas similares. - Sólida habilidad de scripting/programación y comodidad utilizando herramientas y agentes de IA (ej. Claude) para acelerar la entrega. - Fuertes habilidades en respuesta a incidentes, documentación y colaboración. DESEABLES - Experiencia con VictoriaMetrics, Grafana, Tempo, Loki, Vector, Splunk, Alertmanager u OpenTelemetry. - Experiencia con PromQL o LogQL, dashboards o alertas como código. - Experiencia en el mantenimiento de operadores y sus CRDs relacionados en Kubernetes. - Experiencia con Consul, Vault, AWS e infraestructura on-premises o de centro de datos. - Experiencia operando pipelines de logging, streaming o datos de alto volumen. - Experiencia tomando decisiones prácticas sobre el volumen de datos de observabilidad, rendimiento y costo. - Experiencia en entornos altamente regulados o de servicios financieros donde la gestión de cambios y las pistas de auditoría son críticas. Salvo que se indique una fecha límite específica en la publicación del empleo, las postulaciones se aceptan de forma continua. Por favor, tené en cuenta que se permite a los postulantes tachar o eliminar información de su CV que identifique la edad, fecha de nacimiento o fechas de asistencia o graduación de una institución educativa. Consideramos postulantes calificados con historial penal para empleo en nuestro equipo, evaluando a los candidatos de manera consistente con los requisitos de la Ordenanza de Oportunidades Justas de San Francisco. NUESTRO COMPROMISO Payward está impulsado por personas de todo el mundo y celebramos los diversos talentos, orígenes, contribuciones y perspectivas únicas que cada uno aporta. Contratamos por mérito, buscando personas con las habilidades, conocimientos y capacidades adecuadas para el puesto. Te animamos a postularte a roles donde no cumplas completamente con los requisitos listados, especialmente si te apasiona o tenés conocimientos sobre cripto. Podríamos pedir a los candidatos que completen evaluaciones de habilidades relacionadas con el trabajo o de estilo de trabajo como parte de nuestro proceso de contratación. Estas evaluaciones evalúan competencias relevantes para el rol y se aplican de manera consistente entre candidatos para puestos similares. Los resultados se consideran junto con la experiencia y las entrevistas, y no son la única base para ninguna decisión de empleo. Como empleador que ofrece igualdad de oportunidades, no toleramos la discriminación o el acoso de ningún tipo, ya sea por motivos de raza, etnia, edad, identidad de género, ciudadanía, religión, orientación sexual, discapacidad, embarazo, estado de veterano o cualquier otra característica protegida según las leyes federales, estatales o locales. Mantente conectado Seguinos en Twitter https://twitter.com/krakenfx Aprendé en el Blog de Kraken https://blog.kraken.com/#:~:text=Enter%20your%20email%20address Conectate en LinkedIn https://www.linkedin.com/company/kraken-exchange/ Aviso de Privacidad del Candidato https://www.kraken.com/legal/candidate-privacy-notice