Empresa busca Ingeniero de Software Senior (SR+) para evaluar la calidad de interacciones con agentes de codificación de IA como OpenAI Codex y Claude Code. El rol se enfoca en el juicio de ingeniería y la calidad de las respuestas, no en la escritura de código de producción. Es un puesto por proyecto, remoto, con pago por hora.
SENIOR AI INTERACTION EVALUATOR (CODEX / CLAUDE CODE) Contrato | $50-200/hr | 10+ hrs/semana | Basado en proyecto Las vacantes se abren de forma continua. Postulate para unirte a nuestra base de talentos y te contactaremos cuando surja una oportunidad que coincida con tu perfil. Se esperan 40+ horas semanales una vez que un proyecto comience; el momento depende de la disponibilidad, pero incorporamos a las personas en la primera oportunidad genuina. Estos roles se cubren de forma continua a medida que se abren nuevos proyectos. Postulate ahora para unirte a nuestra base de talentos; los candidatos calificados serán contactados directamente cuando los roles estén disponibles. ¡Mirá este video de Loom para más detalles! https://www.loom.com/share/b0d1b0bf24c44ae8b95dca84b9db60e5 Buscamos ingenieros de software con alta experiencia (SR+) para ayudar a evaluar la calidad de las interacciones con agentes de codificación modernos como OpenAI Codex y Claude Code. Este no es un rol de ingeniería tradicional. No escribirás código de producción. Evaluarás algo más difícil: si el modelo piensa como un gran ingeniero. QUÉ IMPLICA ESTE ROL Evaluarás cómo se comportan los agentes de IA de codificación en escenarios del mundo real, centrándote en: - Si la respuesta tiene sentido. - Si el preámbulo y el razonamiento son útiles. - Si la salida refleja un sólido juicio de ingeniería. - Si la interacción se siente correcta para un desarrollador experimentado. Este rol se trata de "gusto" de ingeniería, no de corrección sintáctica. QUÉ HARÁS - Evaluar interacciones de codificación generadas por IA de principio a fin. - Juzgar si las salidas son: - Útiles. - Correctas (a alto nivel). - Alineadas con la forma en que pensaría un ingeniero fuerte. - Evaluar la calidad de las explicaciones y el razonamiento, no solo el código. - Distinguir entre diferentes niveles de calidad de respuesta (por ejemplo, qué hace que algo sea un 2 vs. un 4). - Proporcionar feedback claro y fundamentado sobre: - Qué funcionó. - Qué no funcionó. - Qué se sintió "raro" o engañoso. - Ayudar a definir qué significa "excelente" al interactuar con herramientas como Cursor. QUÉ QUEREMOS DECIR CON """GUSTO""" Buscamos específicamente ingenieros que puedan responder preguntas como: - ¿Esto se siente como algo que un ingeniero fuerte diría? - ¿Esta explicación es útil o solo técnicamente correcta? - ¿El modelo está guiando bien al usuario o simplemente volcando resultados? - ¿Esta interacción generaría o erosionaría la confianza? Deberías sentirte cómodo tomando juicios subjetivos pero rigurosos. QUIÉN ERES - Ingeniero de nivel Staff / Principal (o experiencia equivalente). - Sólida experiencia en uno de los siguientes: - TypeScript / JavaScript. - Python. - Experiencia práctica utilizando: - OpenAI Codex. - Claude Code. - Cursor. - Profunda familiaridad con flujos de trabajo modernos de desarrollo asistido por IA. - Capacidad para evaluar código sin necesidad de ejecutarlo completamente o revisar detalladamente cada línea. - Comodidad al dar feedback directo y fundamentado. - Alto estándar de lo que constituye "buena ingeniería". DESEABLE - Experiencia con herramientas como Cursor o IDEs similares centrados en IA. - Exposición previa a flujos de trabajo de diseño o evaluación de prompts. - Experiencia en mentoría de ingenieros senior o definición de estándares de ingeniería. DETALLES DEL COMPROMISO - EE. UU. y Canadá hasta $200/hr. - UE y Latam hasta $150/hr. - Otras ubicaciones hasta $100/hr. - Horas: ~10–20 horas/semana. - Duración: Continua, basada en proyecto. - Proceso: - Ejercicio de evaluación para llevar a casa. - Una entrevista conductual.