Mercado Libre busca un Experto/a en SRE con 5+ años de experiencia para diseñar y escalar sistemas innovadores y seguros, enfocándose en resiliencia, alta disponibilidad y automatización con IA.
Si te apasiona la ingeniería de confiabilidad y querés escalar sistemas de alto impacto en América Latina, este puesto en Mercado Libre es para vos. Vas a trabajar con tecnología de punta y IA para asegurar la resiliencia y disponibilidad de plataformas líderes.
Como Software Expert en Mercado Libre, diseñarás y escalarás sistemas innovadores y seguros que resuelven problemas reales y de alto impacto. Trabajarás en un entorno dinámico con tecnología de vanguardia, aplicando buenas prácticas de ingeniería, modelos de IA propios y aprendizaje continuo, con el propósito de democratizar el comercio electrónico y los servicios financieros en América Latina. Imagináte emprendiendo proyectos desafiantes, dinámicos e innovadores y siendo responsable de: - Liderar iniciativas estructurales para mejorar la resiliencia, uptime y escalabilidad, y gobernar patrones de diseño resiliente y mejores prácticas transversales. - Diseñar arquitecturas seguras, resilientes y adaptadas al negocio, y diseñar e integrar soluciones basadas en inteligencia artificial para optimizar la confiabilidad de sistemas, incluyendo detección proactiva de anomalías, predicción de incidentes y automatización inteligente de respuestas operativas. - Modelar y priorizar uptime con base en la criticidad del servicio, y evaluar la madurez técnica y diseñar planes de evolución por dominio. - Impulsar prácticas avanzadas de observabilidad e instrumentación custom, e impulsar la adopción de herramientas de IA aplicada a tareas y automatizaciones. - Identificar cuellos de botella técnicos mediante profiling y troubleshooting profundo. - Ejecutar y elevar el nivel técnico en war rooms y postmortems, y mentorear equipos y TLs, desarrollando una cultura sólida de SRE. ¿Qué buscamos en vos? - Contar con 5 años o más de experiencia en desarrollo, y experiencia en sistemas distribuidos, microservicios, APIs escalables y arquitecturas cloud. - Gestionar uptime, alta disponibilidad y escalabilidad, con enfoque tanto preventivo como reactivo ante incidentes, y contar con conocimiento profundo en uptime, incident response y prácticas de ingeniería de confiabilidad SRE. - Liderar procesos de mejora continua, incluyendo la gestión de fallas y problemas operativos, y dominar la elaboración de resúmenes ejecutivos, gestión de KPIs y definición de objetivos técnicos. - Manejar de forma avanzada herramientas de observabilidad y troubleshooting: Datadog, New Relic, Kibana, entre otras, y diseñar y evolucionar sistemas de observabilidad avanzados, incluyendo estrategias de instrumentación custom, trazabilidad end-to-end, correlación de métricas técnicas y de negocio, definición de thresholds efectivos para alertamiento, y foco en diagnóstico efectivo. - Contar con experiencia con event sourcing, experiencia en el diseño e integración de soluciones de IA/ML aplicadas a operaciones: detección de anomalías, forecasting de capacidad, clasificación automática de incidentes o generación de runbooks asistida por modelos de lenguaje LLMs, capacidad para diseñar sistemas que incorporen captura y almacenamiento de eventos clave del negocio con trazabilidad completa de datos como insumo para modelos de IA, y familiaridad con frameworks y herramientas del ecosistema de IA orientadas a casos de uso de confiabilidad e infraestructura, por ejemplo Python, scikit-learn y plataformas de MLOps. ¿Te animás a dejar huella en la tecnología de América Latina? ¡Postulate y sumate a nuestro propósito! Modalidad de trabajo híbrida. Site: Polo Dot, Saavedra, Buenos Aires.
Mercado Libre · Buenos Aires · Presencial
Mercado Libre · Buenos Aires · Presencial
Cubi · Buenos Aires · Presencial
GeoVictoria · Buenos Aires · Presencial
Swiss Medical Group · Buenos Aires · Presencial