Empresa de IA busca Ingeniero de Rendimiento de Inferencia para optimizar el costo y la eficiencia de su stack de inferencia, trabajando en estrecha colaboración con ingenieros de serving y enfocándose en la mejora de latencia y throughput.
Si te apasiona la IA y querés optimizar la eficiencia de modelos de lenguaje a gran escala, este puesto remoto es para vos. Podrás mejorar latencia y throughput trabajando con tecnologías de punta en inferencia.
EL ROL Serás responsable del costo y rendimiento de nuestra pila de inferencia. Tu trabajo determinará la eficiencia con la que servimos modelos a medida que cambian las cargas de trabajo, el tráfico y el hardware. Trabajarás en estrecha colaboración con los ingenieros que operan la flota de servicio, mientras te encargas de las palancas de rendimiento principales: caché, procesamiento por lotes (batching), cuantización, decodificación y optimización a nivel de kernel. El éxito significará mejorar el rendimiento (throughput) y la latencia sin comprometer la confiabilidad o la calidad del modelo. RESPONSABILIDADES - Mejorar el rendimiento (throughput), el costo y la latencia de cola a través de la gestión de caché KV, el procesamiento por lotes continuo (continuous batching), la decodificación especulativa y la cuantización. - Optimizar las cargas de trabajo de pre-llenado (prefill) y decodificación de contexto largo basadas en el tráfico de producción real. - Ajustar el enrutamiento entre nuestra infraestructura y proveedores externos según el costo, la capacidad y el rendimiento. - Trabajar dentro de motores de servicio como vLLM, SGLang y TensorRT-LLM, yendo por debajo del framework cuando sea necesario. - Construir sistemas de perfilado y medición que muestren dónde se está gastando el tiempo, la memoria y la computación. CALIFICACIONES - Más de 5 años en sistemas de ML, infraestructura de inferencia o ingeniería de rendimiento, con mejoras medibles en costo o latencia. - Profundo conocimiento del servicio de modelos, incluyendo pre-llenado (prefill) y decodificación, ancho de banda de memoria, procesamiento por lotes (batching) y concurrencia. - Experiencia en producción con motores de servicio como vLLM, SGLang o TensorRT-LLM. - Sólidas habilidades en Python y dominio de C++, Rust u otro lenguaje de sistemas. - Experiencia con rendimiento de GPU, incluyendo CUDA, NCCL, precisión mixta, diseño de memoria, kernels o cuantización. Por encima de todo, buscamos compañeros de equipo geniales que hagan que el trabajo se sienta más liviano y que no teman arriesgarse con ideas audaces. No necesitas ser perfecto, pero sí adaptable. Te animamos a postularte, incluso si no cumples con todos los requisitos. SOBRE NOSOTROS La mayoría de la IA está estancada, no se adapta al mundo. Creemos que eso está mal. Nuestro mandato es construir inteligencia eficiente que evoluciona en tiempo real. Nuestra visión son sistemas de IA flexibles, personalizados y accesibles para todos. Creemos que la eficiencia es lo que hace esto posible: es cómo expandimos el acceso y aseguramos que la innovación beneficie a muchos, no a unos pocos. Creemos en la densidad de talento: reunir a los individuos más brillantes y motivados para superar los límites de la adaptación continua. Buscamos constructores y pensadores creativos listos para dar forma a la próxima era de la inteligencia. BENEFICIOS - Trabajo flexible: Colaboración presencial en el Área de la Bahía (Bay Area), un equipo distribuido globalmente y encuentros presenciales (offsites) del equipo. - Adaptation Passport: Estipendio anual de viaje para explorar un país que nunca hayas visitado. Estamos construyendo una inteligencia que evoluciona junto a vos, por lo que te animamos a seguir expandiendo tus horizontes. - Estipendio de Almuerzo: Asignación semanal de comidas para llevar o entrega de comestibles. - Bienestar: Beneficios médicos integrales y generoso tiempo libre remunerado (paid time off).
Tether Operations Limited · Buenos Aires
Remotohace 3 meses