Elevá tu destreza en ingeniería a niveles sin precedentes uniéndote a un equipo de profesionales excepcionalmente talentosos y posicionate entre la élite en confiabilidad de sitios. Como Senior Lead Site Reliability Engineer en JPMorgan Chase, dentro del equipo de Infrastructure Platforms and Foundational Services (IPFS), trabajarás con tus colegas para definir los requisitos no funcionales (NFRs) y los objetivos de disponibilidad para los servicios de tus líneas de aplicación y producto. Te asegurarás de que estos NFRs se tengan en cuenta en las fases de diseño y prueba de tus productos, que tus indicadores de nivel de servicio (SLIs) midan eficazmente la experiencia del cliente, y que los objetivos de nivel de servicio (SLOs) se definan con los stakeholders y se implementen en producción.
Responsabilidades del puesto
- Crear y entregar diseños, hojas de ruta y cartas de programa de alta calidad junto con el equipo de ingeniería.
- Actuar como un recurso clave y mentor para los tecnólogos de tu área que buscan asesoramiento sobre temas técnicos y de negocio, y ser un portador de cultura y un campeón de la adopción de la confiabilidad del sitio para tu equipo.
- Colaborar con otros para crear e implementar diseños de observabilidad y confiabilidad para sistemas complejos que sean robustos, estables y no generen carga de trabajo adicional (toil) o deuda técnica.
- Utilizar capacidades de IA autorizadas por la empresa dentro del entorno de trabajo para acelerar el diseño de confiabilidad y la toma de decisiones operativas (por ejemplo, análisis de incidentes/post-incidentes y trazabilidad de requisitos), validando resultados y manejando datos operativos según los requisitos de sensibilidad y seguridad.
- Impulsar la evolución y depuración de componentes críticos comprendiendo las interdependencias y limitaciones de las aplicaciones y plataformas.
- Proporcionar orientación, herramientas y soluciones integrales y continuas para apoyar el crecimiento de la firma.
- Realizar contribuciones significativas a la comunidad de confiabilidad de sitios de JPMorgan Chase a través de foros internos, comunidades de práctica, gremios y conferencias.
- Liderar la adopción de flujos de trabajo de confiabilidad asistidos por IA en las prácticas de SDLC/cadena de herramientas (por ejemplo, automatización de pruebas/validación y preparación para producción), asegurando la trazabilidad/auditoría, la resiliencia y los controles de seguridad.
Requisitos, capacidades y
habilidades
- Formación formal o certificación en conceptos de ingeniería de confiabilidad de sitios y más de 5 años de experiencia aplicada.
- Conocimiento avanzado en cultura y principios de confiabilidad de sitios con capacidad demostrada para implementar la confiabilidad de sitios dentro de una aplicación o plataforma.
- Conocimiento y experiencia avanzados en observabilidad, como monitoreo de caja blanca y negra, objetivos de nivel de servicio, alertas y recopilación de telemetría utilizando herramientas como Grafana, Dynatrace, Prometheus, Datadog, Splunk, etc.
- Dominio experto en Java, Go (Golang), Python y Terraform para construir aplicaciones de nivel empresarial, sistemas de alto rendimiento, automatización e infraestructura como código.
- Experiencia demostrada en el uso de capacidades de IA autorizadas por la empresa dentro del entorno de trabajo para mejorar los flujos de trabajo de ingeniería de confiabilidad, con sólidos hábitos de validación y conciencia de la sensibilidad de los datos.
- Capacidad para establecer prácticas de equipo para el uso seguro de IA en operaciones (por ejemplo, expectativas de revisión/aprobación y rutas de escalada) manteniendo la resiliencia, la seguridad y los resultados de auditoría.
- Conocimiento avanzado de aplicaciones de software y procesos técnicos con una profundidad considerable en múltiples disciplinas técnicas, incluidos sistemas distribuidos, arquitectura de microservicios y tecnologías nativas de la nube.
- Experiencia práctica en la construcción de Agentes de IA y sistemas autónomos con dominio en frameworks de IA (LangChain, LangGraph, AutoGen, CrewAI) y aprovechando herramientas de desarrollo de IA (GitHub Copilot, Claude, etc.) para acelerar el desarrollo y la innovación.
- Experiencia en el diseño e implementación de pipelines de logging (Fluentd, Logstash, Vector) y sistemas para la recopilación, análisis y trazado distribuido de métricas.
- Sólida experiencia en la construcción de APIs RESTful de nivel de producción y en el diseño de arquitecturas de colas de mensajes (Kafka, RabbitMQ, SQS) para sistemas orientados a eventos; y experiencia en bases de datos de grafos (Neo4j, TigerGraph), bases de datos vectoriales (Pinecone, Weaviate, Chroma) e integración de múltiples almacenes de datos para sistemas impulsados por IA.
- Dominio de la contenerización (Docker, Kubernetes), pipelines de CI/CD y flujos de trabajo de GitOps.
- Capacidad para comunicar soluciones basadas en datos con métodos complejos de informes y visualización, reconocido como un contribuyente activo de la comunidad de ingeniería, y continúa expandiendo su red y lidera sesiones de evaluación con proveedores para ver cómo las ofertas pueden encajar en la estrategia de la firma.
Requisitos preferidos, capacidades y
habilidades
- Experiencia con servidores MCP (Model Context Protocol) o frameworks de agentes similares para construir sistemas autónomos, y comprensión de la integración de LLM, ingeniería de prompts y RAG (Retrieval-Augmented Generation).
- Familiaridad con la construcción, implementación y gestión del ciclo de vida de modelos de IA/ML utilizando frameworks como TensorFlow, PyTorch o scikit-learn.
- Experiencia con tecnologías de big data (Hadoop, Spark, Flink), bases de datos analíticas, bases de datos NoSQL (MongoDB, Cassandra, DynamoDB) y bases de datos de series temporales (InfluxDB, TimescaleDB).
- Conocimiento de las mejores prácticas de seguridad y requisitos de cumplimiento en industrias altamente reguladas, con experiencia en herramientas de ingeniería del caos (Chaos Monkey, Gremlin, LitmusChaos) y ejercicios GameDay.
- Contribuciones a proyectos de código abierto, particularmente en dominios de SRE, observabilidad o IA/ML, y certificaciones en plataformas en la nube (AWS, Azure, GCP).
- Sólidas habilidades de comunicación con capacidad para mentorizar y educar a otros sobre principios y prácticas de confiabilidad de sitios, y capacidad para anticipar, identificar y solucionar defectos encontrados durante las pruebas.
J.P. Morgan es un líder mundial en servicios financieros, que brinda asesoramiento estratégico y productos a las corporaciones, gobiernos, individuos adinerados e inversores institucionales más prominentes del mundo. Nuestro enfoque de "negocio de primera clase de manera de primera clase" para servir a los clientes impulsa todo lo que hacemos. Nos esforzamos por construir asociaciones confiables y a largo plazo para ayudar a nuestros clientes a alcanzar sus objetivos comerciales. Reconocemos que nuestra gente es nuestra fortaleza y los diversos talentos que aportan a nuestra fuerza laboral global están directamente relacionados con nuestro éxito. Somos un empleador que ofrece igualdad de oportunidades y valoramos la diversidad y la inclusión en nuestra empresa. No discriminamos por ningún atributo protegido, incluyendo raza, religión, color, origen nacional, género, orientación sexual, identidad de género, expresión de género, edad, estado civil o de veterano, embarazo o discapacidad, o cualquier otra base protegida por la ley aplicable. También hacemos adaptaciones razonables para las prácticas y creencias religiosas de los solicitantes y empleados, así como para las necesidades de salud mental o discapacidad física. Visite nuestras preguntas frecuentes para obtener más información sobre cómo solicitar una adaptación.