Empresa busca Ingeniero de Software Senior (SR+) para evaluar la calidad de interacciones con agentes de codificación de IA como OpenAI Codex y Claude Code. El rol se enfoca en el juicio de ingeniería y la calidad de las respuestas, no en la escritura de código de producción. Es un puesto por proyecto, remoto, con pago por hora.
Si sos un ingeniero de software con experiencia y te interesa evaluar la calidad de las interacciones con IA de codificación, este puesto remoto por proyecto es para vos. Podés trabajar con tecnologías de punta y aplicar tu juicio de ingeniería en un rol flexible.
SENIOR AI INTERACTION EVALUATOR (CODEX / CLAUDE CODE) Contrato | $50-200/hora | 10+ horas/semana | Basado en proyecto Las vacantes se abren de forma continua. Postulate para unirte a nuestra base de talentos y te contactaremos cuando surja una oportunidad que coincida con tu perfil. Se esperan 40+ horas semanales una vez que un proyecto comience; el momento exacto depende de la disponibilidad, pero incorporamos al personal en la primera oportunidad genuina. Actualmente estos roles están cubiertos, pero contratamos de forma continua a medida que se abren nuevos proyectos. Postulate ahora para unirte a nuestra base de talentos; los candidatos calificados serán contactados directamente cuando los roles estén disponibles. ¡Mirá este video de Loom para más detalles! https://www.loom.com/share/b0d1b0bf24c44ae8b95dca84b9db60e5 Buscamos ingenieros de software con alta experiencia (SR+) para ayudar a evaluar la calidad de las interacciones con agentes de codificación modernos como OpenAI Codex y Claude Code. Este no es un rol de ingeniería tradicional. No escribirás código de producción. Evaluarás algo más difícil: si el modelo piensa como un gran ingeniero. QUÉ IMPLICA ESTE ROL Evaluarás el comportamiento de los agentes de codificación de IA en escenarios del mundo real, centrándote en: - Si la respuesta tiene sentido. - Si el preámbulo y el razonamiento son útiles. - Si la salida refleja un sólido juicio de ingeniería. - Si la interacción se siente adecuada para un desarrollador experimentado. Este rol se trata de criterio de ingeniería, no de corrección sintáctica. QUÉ HARÁS - Evaluar interacciones de codificación generadas por IA de principio a fin. - Juzgar si las salidas son: - Útiles. - Correctas (a alto nivel). - Alineadas con la forma de pensar de un ingeniero fuerte. - Evaluar la calidad de las explicaciones y el razonamiento, no solo el código. - Distinguir entre diferentes niveles de calidad de respuesta (por ejemplo, qué hace que algo sea un 2 vs. un 4). - Proporcionar feedback claro y fundamentado sobre: - Qué funcionó. - Qué no funcionó. - Qué se sintió "raro" o engañoso. - Ayudar a definir qué significa "excelente" al interactuar con herramientas como Cursor. QUÉ QUEREMOS DECIR CON "CRITERIO" Buscamos específicamente ingenieros que puedan responder preguntas como: - ¿Esto se siente como algo que un ingeniero fuerte diría realmente? - ¿Esta explicación es útil o solo técnicamente correcta? - ¿El modelo está guiando bien al usuario o simplemente volcando resultados? - ¿Esta interacción generaría o erosionaría la confianza? Deberías sentirte cómodo tomando juicios subjetivos pero rigurosos. QUIÉN ERES - Ingeniero Staff / Principal (o experiencia equivalente). - Sólida experiencia en una de las siguientes áreas: - TypeScript / JavaScript - Python - Experiencia práctica utilizando: - OpenAI Codex - Claude Code - Cursor - Profunda familiaridad con flujos de trabajo modernos de desarrollo asistido por IA. - Capacidad para evaluar código sin necesidad de ejecutarlo completamente o revisar detalladamente cada línea. - Comodidad al dar feedback directo y fundamentado. - Alto estándar de lo que constituye "buena ingeniería". VALORADO (NICE TO HAVE) - Experiencia con herramientas como Cursor o IDEs similares centrados en IA. - Exposición previa a flujos de trabajo de diseño o evaluación de prompts. - Experiencia en mentoría de ingenieros senior o definición de estándares de ingeniería. DETALLES DEL COMPROMISO - Estados Unidos y Canadá: hasta $200/hora. - Unión Europea y Latam: hasta $150/hora. - Otras ubicaciones: hasta $100/hora. - Horas: ~10–20 horas/semana. - Duración: Continuo, basado en proyecto. - Proceso: - Ejercicio de evaluación para llevar a casa. - Una entrevista conductual.