Empresa busca un Ingeniero/a de Confiabilidad de Sitio (SRE) con 3-5 años de experiencia para unirse a su equipo de Plataforma y Confiabilidad de Producción. El rol es 100% remoto para las Américas, con foco en sistemas de trading .NET/C# en Windows y AWS.
Si buscás un rol remoto 100% en sistemas de trading .NET/C# y AWS, esta es tu oportunidad. Podrás mejorar la confiabilidad y automatizar operaciones en sistemas críticos, con impacto directo en la experiencia del cliente.
Únete a nuestro equipo de Confiabilidad de Plataforma y Producción y ayuda a garantizar la confiabilidad, el rendimiento y la disponibilidad de nuestros sistemas de trading de misión crítica. Como Ingeniero de Confiabilidad de Sitio (SRE) de Aplicaciones, serás responsable de la confiabilidad diaria de nuestros servicios .NET/C# que se ejecutan en Windows, comenzando con nuestro puente de liquidez interno que conecta los servidores de trading de MetaTrader con proveedores de liquidez externos. Con el tiempo, expandirás tu impacto a servicios relacionados de trading y back-office. Este es un rol práctico para un ingeniero que disfruta resolviendo desafíos de producción, mejorando la observabilidad, automatizando operaciones y construyendo sistemas resilientes donde el tiempo de actividad impacta directamente la experiencia del cliente. Detalles del puesto: Equipo: Confiabilidad de Plataforma y Producción Ubicación: Remoto (preferentemente Américas, LatAm) Horario de trabajo: Zonas horarias de América (UTC-3 a UTC-8) Rotación de guardia: Alineada con el día de trading de Londres Tipo de empleo: Tiempo completo, permanente Nivel de experiencia: Intermedio (3–5 años) Tecnologías: - .NET/C# - Windows Server - AWS - Aurora PostgreSQL - Prometheus - Grafana - Terraform Sobre el rol: Nuestra plataforma de trading impulsa cada interacción del cliente, lo que hace de la confiabilidad una preocupación de primer nivel del producto. Serás responsable de mantener y mejorar la confiabilidad operativa de nuestros servicios .NET/C# en Windows, asegurando que sigan siendo altamente disponibles, observables y resilientes. Colaborarás estrechamente con los ingenieros de software para mejorar el monitoreo, la seguridad de las implementaciones, la automatización, el aislamiento de fallas y la respuesta a incidentes, al mismo tiempo que impulsas mejoras continuas en la confiabilidad de la plataforma y la excelencia operativa. Qué harás: - Participar en la rotación de guardia para sistemas de trading en producción y liderar la respuesta a incidentes durante interrupciones del servicio. - Investigar incidentes de producción, realizar análisis de causa raíz e implementar acciones preventivas para eliminar problemas recurrentes. - Construir y mantener paneles de Grafana, alertas de Prometheus y vistas de salud operativa en aplicaciones, infraestructura y bases de datos. - Instrumentar servicios .NET para mejorar la telemetría, métricas, registro y visibilidad del estado del servicio y el impacto en el cliente. - Definir, implementar y monitorear Indicadores de Nivel de Servicio (SLI), Objetivos de Nivel de Servicio (SLO) y presupuestos de error. - Solucionar problemas en: - Aplicaciones .NET/C# - Windows Server - Bases de datos Aurora PostgreSQL - Infraestructura AWS - Pipelines CI/CD y despliegues - Mejorar la seguridad de los despliegues, la automatización de lanzamientos y las estrategias de reversión. - Colaborar con los desarrolladores para mejorar la operabilidad, resiliencia y aislamiento de fallas de las aplicaciones. - Automatizar tareas operativas mediante scripting y automatización de infraestructura. - Crear y mantener runbooks, documentación operativa y procedimientos de respuesta a incidentes. - Mejorar continuamente el monitoreo, la calidad de las alertas, la automatización y la confiabilidad de la plataforma. Habilidades técnicas requeridas: .NET & Windows - Fuerte experiencia depurando y dando soporte a aplicaciones .NET/C# en producción. - Experiencia práctica con entornos Windows Server. Scripting & Automatización - Fuertes habilidades de scripting en PowerShell. - Experiencia con Python o Bash. Observabilidad - Experiencia con Grafana, Prometheus y Loki (o herramientas equivalentes de monitoreo y observabilidad). - Sólida comprensión de las mejores prácticas de métricas, registro, rastreo y alertas. CI/CD & DevOps - Experiencia con pipelines CI/CD modernos. - Conocimiento de estrategias de despliegue, automatización de lanzamientos y mecanismos de reversión. Cloud & Infraestructura - Experiencia trabajando con AWS. - Experiencia práctica con Terraform u otras herramientas de Infraestructura como Código (IaC). Bases de datos - Experiencia solucionando y dando soporte a Aurora PostgreSQL u otras plataformas de bases de datos relacionales. Ingeniería de Confiabilidad - Experiencia práctica con: - SLI y SLO - Presupuestos de error - Respuesta a incidentes - Análisis de causa raíz (RCA) - Diseño de alertas - Operaciones de producción Calificaciones preferidas: - Experiencia dando soporte a sistemas financieros o de trading de alta disponibilidad o baja latencia. - Familiaridad con entornos MetaTrader o plataformas de tecnología financiera. - Experiencia con sistemas distribuidos y microservicios. - Conocimiento de OpenTelemetry o frameworks de observabilidad similares. - Exposición a Docker, Kubernetes o entornos contenerizados. ¿Por qué unirte a nosotros? - Trabaja en infraestructura de trading de misión crítica que impacta directamente a los clientes. - Resuelve desafiantes problemas de confiabilidad y escalabilidad en un entorno en tiempo real. - Construye prácticas de observabilidad, automatización y despliegue de clase mundial. - Colabora con ingenieros experimentados en una cultura de ingeniería moderna. - Influye en la estrategia de confiabilidad y las mejores prácticas de ingeniería en toda la plataforma. Si te apasiona la ingeniería de producción, la automatización y la construcción de sistemas confiables a escala, nos encantaría saber de ti.
J.P. Morgan · Buenos Aires · Presencial