Responsabilidades clave
- Ser dueño de los resultados de confiabilidad para servicios de red de misión crítica (disponibilidad, rendimiento, recuperabilidad) y impulsar mejoras medibles.
- Liderar la respuesta a incidentes mayores: establecer rigor en la respuesta, coordinar mitigaciones técnicas, entrenar a los respondedores y asegurar aprendizajes post-incidente de alta calidad.
- Gestionar el ciclo de vida completo de la gestión de problemas: redactar/aprobar RCA (análisis de causa raíz), identificar causas raíz sistémicas y promover remediaciones y prevenciones duraderas.
- Diseñar frameworks de automatización utilizando Python, Shell y Ansible (ej. patrones de autocuración donde sea apropiado, remediación automatizada con guardarraíles, pipelines de validación, herramientas estandarizadas).
- Proveer liderazgo técnico profundo en:
- SD-WAN, SDA y redes definidas por software (SND)
- Routing y Switching
- Firewalls, Balanceadores de Carga, Proxies
- Fuerte preferencia por Cisco ACI / Fabrics; VMware NSX como plus.
- Colaborar con equipos de desarrollo/plataforma para desarrollar insights de observabilidad: definir señales operacionales, reducir el ruido de alertas, mejorar la accionabilidad y alinear el monitoreo con la salud del servicio.
- Integrar prácticas de ingeniería SRE (Site Reliability Engineering) en el diseño y la entrega:
- Traducir NFRs (Non-Functional Requirements) en controles, estándares y objetivos medibles.
- Aplicar análisis de riesgo tipo FMEA a diseños/cambios para reducir el impacto de fallos.
- Impulsar revisiones de preparación operacional, pruebas de resiliencia y mecanismos de seguridad de cambios.
- Mentorear ingenieros, establecer estándares técnicos, influir en roadmaps inter-equipo y entregar resultados con mínima supervisión.
Requisitos
- Amplia experiencia operando e ingeniando redes a gran escala con profunda capacidad de troubleshooting.
- Liderazgo comprobado en incidentes mayores, RCA y entrega de soluciones a largo plazo que reduzcan incidentes recurrentes.
- Trayectoria avanzada en automatización utilizando Python, Shell y Ansible, con demostrable reducción de toil (tareas repetitivas) y mejoras en confiabilidad.
- Fuerte comprensión aplicada de conceptos SRE, NFRs y FMEA (o análisis de riesgo/fallos equivalente).
- Fuerte mentalidad de propiedad, gestión de stakeholders y capacidad para impulsar la entrega de forma independiente.
Requisitos
deseables
- Fuerte expertise con Cisco ACI / Fabrics.
- Experiencia con VMware NSX (deseable).
- Certificaciones como CCNP/CCIE (o equivalente), más otras certificaciones de vendors.
- Experiencia previa en instituciones financieras (ventaja).
J.P. Morgan es un líder global en servicios financieros, brindando asesoramiento estratégico y productos a las corporaciones, gobiernos, individuos adinerados e inversores institucionales más prominentes del mundo. Nuestro enfoque de "negocio de primera clase de manera de primera clase" para servir a los clientes impulsa todo lo que hacemos. Nos esforzamos por construir alianzas confiables y a largo plazo para ayudar a nuestros clientes a alcanzar sus objetivos comerciales. Reconocemos que nuestra gente es nuestra fortaleza y los diversos talentos que aportan a nuestra fuerza laboral global están directamente vinculados a nuestro éxito. Somos un empleador que ofrece igualdad de oportunidades y valoramos mucho la diversidad y la inclusión en nuestra empresa. No discriminamos por ningún atributo protegido, incluyendo raza, religión, color, origen nacional, género, orientación sexual, identidad de género, expresión de género, edad, estado civil o de veterano, embarazo o discapacidad, o cualquier otra base protegida por la ley aplicable. También hacemos adaptaciones razonables para las prácticas y creencias religiosas de los solicitantes y empleados, así como para las necesidades de salud mental o discapacidad física. Visite nuestras preguntas frecuentes para obtener más información sobre cómo solicitar una adaptación.