Somos Domino, construimos software que ayuda a las organizaciones más grandes impulsadas por IA a crear y operar soluciones avanzadas de ciencia de datos e IA a escala. Nuestra plataforma integra un entorno de desarrollo de modelos optimizado, capacidades de MLOps y funciones novedosas para la colaboración, la reutilización y la reproducibilidad, todo lo cual hace que los equipos de ciencia de datos sean más productivos, reduce el tiempo de obtención de valor y garantiza el cumplimiento. Nuestros clientes —como Johnson & Johnson, GSK, Bristol Myers, UBS, FINRA y la Marina de los EE. UU.— utilizan nuestro software para resolver algunos de los desafíos más importantes del mundo, como el desarrollo de nuevos medicamentos, la protección de nuestros mercados financieros o la defensa de nuestro país. Respaldados por Sequoia Capital, Coatue Management, NVIDIA, Snowflake y otros inversores líderes, llevamos una década en el negocio, pero seguimos siendo un equipo pequeño que opera con el espíritu de una startup. Especialmente en el mundo de la IA actual, creemos que el futuro aún se está inventando, y queremos ser quienes lo construyamos. Para más información, visitá www.domino.ai.
El equipo de Cloud Operations en Domino está construyendo la capacidad operativa que nos ayuda a administrar de manera segura y confiable una flota creciente de entornos de nube de clientes.
A medida que la huella de la nube de Domino crece, queremos que las operaciones de producción rutinarias sean cada vez más estandarizadas, observables y fáciles de ejecutar de manera segura. Cloud Operations se encuentra en la intersección de Customer Experience, Platform Services, Support y SRE, asumiendo la propiedad del sistema operativo diario en torno a los cambios en la nube, mientras se asocia con los equipos de ingeniería para mejorar continuamente las herramientas subyacentes.
Este es un rol fundacional con la oportunidad de dar forma a cómo funciona la función. Ayudarás a convertir el trabajo de producción recurrente en rutas operativas claras y repetibles; identificarás dónde mejores herramientas o automatización pueden eliminar la fricción operativa; y crearás un modelo que pueda escalar sin requerir la participación de ingeniería en cada cambio rutinario.
Tu impacto
- Establecer y ayudar a dar forma a la capacidad de Cloud Operations de Domino, creando una propiedad clara y prácticas operativas para los cambios de producción rutinarios en nuestros entornos de nube.
- Construir un catálogo de servicios inicial para nuestras operaciones más comunes, con procedimientos claros, límites de riesgo, pasos de verificación, rutas de reversión y puntos de escalamiento.
- Asumir la propiedad práctica de las operaciones de nube apropiadas y las campañas recurrentes, asegurando que el trabajo se lleve a cabo hasta la verificación y finalización.
- Reducir la cantidad de trabajo operativo rutinario que requiere la participación ad hoc de ingenieros de Platform Services y SRE.
- Asociarse estrechamente con Platform Services, SRE y Support para identificar la fricción recurrente y convertirla en mejoras en la automatización, herramientas, documentación y autoservicio.
- Mejorar la visibilidad de cómo está funcionando Cloud Operations a través de medidas útiles como el volumen operativo, las excepciones, el tiempo de verificación, las escalaciones de ingeniería y la cobertura de "paved-road".
- Ayudar a construir los controles operativos y las prácticas de evidencia necesarias a medida que Domino admite entornos de clientes cada vez más complejos y regulados.
- Dejar el servicio más fácil de operar de lo que lo encontraste: los problemas recurrentes deberían convertirse cada vez más en algo estandarizado, automatizado, delegado o eliminado, en lugar de simplemente manejado más rápido.
Lo que buscamos en este rol
- Experiencia trabajando con entornos de nube o SaaS en producción en roles como Cloud Operations, Production Operations, Site Reliability Engineering, Platform Operations, DevOps, Application Operations o una función técnica de operaciones similar.
- Familiaridad con tecnologías y conceptos cloud-native. La experiencia con AWS y Kubernetes es especialmente útil, pero nos importa más tu capacidad para comprender sistemas de producción y tomar decisiones operativas sólidas que la experiencia en cada tecnología que utilizamos.
- Experiencia tomando trabajo operativo recurrente o vagamente definido y ayudando a hacerlo más estructurado, documentado y repetible.
- Fuerte juicio operativo: podés seguir un camino conocido con confianza, reconocer cuándo la realidad ya no coincide con el procedimiento y saber cuándo detenerte, investigar o involucrar a un socio de ingeniería.
- Comodidad usando logs, monitoreo, salida de despliegue, configuración y otras señales técnicas para comprender el estado de un sistema y comunicarte eficazmente con los ingenieros que lo construyen.
- Una mentalidad de sistemas. Mirás más allá de resolver la solicitud de hoy y preguntás si el trabajo repetido se puede simplificar, estandarizar, automatizar o evitar por completo.
- Fuerte sentido de propiedad y seguimiento, incluida la atención a la verificación, la documentación y el cierre después de que se haya ejecutado un cambio de producción.
- Capacidad para colaborar entre equipos de ingeniería y de cara al cliente, hacer visible la propiedad poco clara y ayudar a convertir los problemas operativos en mejoras accionables.
- Comunicación escrita y verbal clara, especialmente al documentar procedimientos, explicar riesgos, coordinar cambios o escalar excepciones.
- No necesitás ser un ingeniero de software o plataforma dedicado. Algo de experiencia en scripting o infraestructura como código es útil, pero este rol se trata principalmente de operaciones técnicas, juicio sólido, propiedad del servicio y mejora continua.
Lo que
valoramos
- Creemos firmemente en el valor de hacer crecer un equipo diverso y alentamos a personas de todos los orígenes, géneros, etnias, habilidades y orientaciones sexuales a postularse.
- Valoramos una mentalidad de crecimiento. Individuos creativos de alto rendimiento que profundizan en los problemas y ven las oportunidades de éxito.
- Creemos en personas que buscan la verdad y dicen la verdad, y que pueden ser ellas mismas en el trabajo.
- Valoramos a todos los que creen que la mejora siempre es posible. En Domino, todo es un trabajo en progreso – podemos mejorar en todo.
- Enfatizamos un entorno de enseñanza y aprendizaje para equipar a los empleados con las herramientas necesarias para tener éxito en su función y en la empresa.
#LI-Remote