Empresa busca Ingeniero de Software Senior (SR+) para evaluar la calidad de interacciones con agentes de codificación de IA como OpenAI Codex y Claude Code. El rol se enfoca en el juicio de ingeniería y la calidad de las respuestas, no en la escritura de código de producción. Es un puesto por proyecto, remoto, con pago por hora.
Si sos un ingeniero de software con experiencia y te interesa la IA, este puesto remoto es para vos. Podrás evaluar la calidad de las interacciones con agentes de codificación de IA, aplicando tu juicio de ingeniería. Es un rol por proyecto con pago por hora.
SENIOR AI INTERACTION EVALUATOR (CODEX / CLAUDE CODE) Contrato | $50-200/hr | 10+ hrs/semana | Basado en proyecto Las vacantes se abren de forma continua. Postulate para unirte a nuestra base de talentos y te contactaremos cuando surja una oportunidad que coincida con tu perfil. Se esperan 40+ horas semanales una vez que un proyecto comience; el momento depende de la disponibilidad, pero incorporamos a las personas en la primera oportunidad genuina. Estos roles se cubren de forma continua a medida que se abren nuevos proyectos. Postulate ahora para unirte a nuestra base de talentos; los candidatos calificados serán contactados directamente cuando los roles estén disponibles. ¡Mirá este video de Loom para más detalles! https://www.loom.com/share/b0d1b0bf24c44ae8b95dca84b9db60e5 Buscamos ingenieros de software con alta experiencia (SR+) para ayudar a evaluar la calidad de las interacciones con agentes de codificación modernos como OpenAI Codex y Claude Code. Este no es un rol de ingeniería tradicional. No escribirás código de producción. Evaluarás algo más difícil: si el modelo piensa como un gran ingeniero. QUÉ IMPLICA ESTE ROL Evaluarás cómo se comportan los agentes de IA de codificación en escenarios del mundo real, centrándote en: - Si la respuesta tiene sentido. - Si el preámbulo y el razonamiento son útiles. - Si la salida refleja un sólido juicio de ingeniería. - Si la interacción se siente correcta para un desarrollador experimentado. Este rol se trata de "gusto" de ingeniería, no de corrección sintáctica. QUÉ HARÁS - Evaluar interacciones de codificación generadas por IA de principio a fin. - Juzgar si las salidas son: - Útiles. - Correctas (a alto nivel). - Alineadas con la forma en que pensaría un ingeniero fuerte. - Evaluar la calidad de las explicaciones y el razonamiento, no solo el código. - Distinguir entre diferentes niveles de calidad de respuesta (por ejemplo, qué hace que algo sea un 2 vs. un 4). - Proporcionar feedback claro y fundamentado sobre: - Qué funcionó. - Qué no funcionó. - Qué se sintió "raro" o engañoso. - Ayudar a definir qué significa "excelente" al interactuar con herramientas como Cursor. QUÉ QUEREMOS DECIR CON """GUSTO""" Buscamos específicamente ingenieros que puedan responder preguntas como: - ¿Esto se siente como algo que un ingeniero fuerte diría? - ¿Esta explicación es útil o solo técnicamente correcta? - ¿El modelo está guiando bien al usuario o simplemente volcando resultados? - ¿Esta interacción generaría o erosionaría la confianza? Deberías sentirte cómodo tomando juicios subjetivos pero rigurosos. QUIÉN ERES - Ingeniero de nivel Staff / Principal (o experiencia equivalente). - Sólida experiencia en uno de los siguientes: - TypeScript / JavaScript. - Python. - Experiencia práctica utilizando: - OpenAI Codex. - Claude Code. - Cursor. - Profunda familiaridad con flujos de trabajo modernos de desarrollo asistido por IA. - Capacidad para evaluar código sin necesidad de ejecutarlo completamente o revisar detalladamente cada línea. - Comodidad al dar feedback directo y fundamentado. - Alto estándar de lo que constituye "buena ingeniería". DESEABLE - Experiencia con herramientas como Cursor o IDEs similares centrados en IA. - Exposición previa a flujos de trabajo de diseño o evaluación de prompts. - Experiencia en mentoría de ingenieros senior o definición de estándares de ingeniería. DETALLES DEL COMPROMISO - EE. UU. y Canadá hasta $200/hr. - UE y Latam hasta $150/hr. - Otras ubicaciones hasta $100/hr. - Horas: ~10–20 horas/semana. - Duración: Continua, basada en proyecto. - Proceso: - Ejercicio de evaluación para llevar a casa. - Una entrevista conductual.