Empresa busca un Ingeniero de Evaluación Freelance con experiencia en desarrollo de software y testing para un proyecto de mejora de agentes de IA. El rol implica la creación de entornos de desarrollo simulados, diseño de tareas desafiantes y escritura de tests para evaluar soluciones de IA. Se ofrece pago por tarea completada, con una tasa equivalente de hasta $30/hora.
Si sos desarrollador con experiencia en testing y querés meterte en el mundo de la IA, esta es tu chance. Podés trabajar remoto en un proyecto desafiante para una empresa tech, evaluando agentes de IA y ganando hasta 30 USD la hora por tarea.
Mindrift conecta especialistas con oportunidades de proyectos de IA para empresas tecnológicas líderes, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente. Estamos construyendo un dataset para evaluar agentes de codificación de IA: qué tan bien un modelo maneja tareas de desarrollador del mundo real. Crearás tareas desafiantes y criterios de evaluación dentro de entornos simulados realistas: - Construir entornos de desarrollador realistas: una empresa virtual con codebase, infraestructura y contexto (tickets, docs, conversaciones) que forma un historial de desarrollo creíble. - Diseñar tareas a partir de estados intermedios de estos entornos: elaborar el prompt, definir qué significa "resuelto" y asegurar que la tarea sea resoluble por un agente de IA. - Escribir tests que verifiquen las soluciones del agente: aceptar todos los enfoques válidos y rechazar los incorrectos, sin ser demasiado estrictos ni demasiado laxos. - Iterar sobre tareas y tests basándose en feedback de QA: revisar soluciones de agentes, analizar fallos y refinar hasta que la evaluación sea justa y robusta. Lo que NO es: - No es etiquetado de datos. - No es prompt engineering. - No es escribir código desde cero: el agente escribe la mayor parte del código; vos guiás y evaluás. Qué buscamos: - Más de 5 años en desarrollo de software. - Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis. - Experiencia escribiendo tests (funcionales, de integración). - Dominio del inglés: B2+. Por qué esto es difícil: Los modelos de frontera ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. Necesitas entender profundamente dónde fallan los modelos y qué escenarios revelan la diferencia entre una solución buena y una mala. Las tareas tienen muchas soluciones válidas: escribir tests que acepten todas las soluciones correctas y rechacen las incorrectas es más difícil de lo que parece. Requisitos y beneficios: - Título de Máster en Ciencias de la Computación, Ingeniería de Software, Ciencia de Datos / Análisis de Datos, Inteligencia Artificial / Machine Learning, Lingüística Computacional / Procesamiento del Lenguaje Natural (NLP), Sistemas de Información o campos relacionados. Se acepta título de grado si el candidato tiene 5 años de experiencia en el campo. - Experiencia académica y/o profesional: Los candidatos deben tener un mínimo de 3 años de experiencia profesional en roles o dominios relacionados, específicamente para roles de QA-automatización/testing o ciberseguridad. Cómo funciona: 1. Postulate. 2. Pasá las cualificaciones. 3. Uníte a un proyecto. 4. Completá tareas. 5. Recibí el pago. Compensación: Pago por tarea aceptada. Tu tarifa depende del nivel de cualificación que alcances y la eficiencia con la que completes las tareas, hasta el equivalente a $30/hora. Dado que el pago es por tarea, un ritmo más rápido aumenta tu tarifa horaria efectiva. ¿Por qué esta oportunidad freelance podría ser ideal para vos? - Participá en un proyecto freelance, remoto y de medio tiempo que se adapta a tus compromisos profesionales o académicos principales. - Trabajá en proyectos avanzados de IA y ganá experiencia valiosa que mejore tu portafolio. - Influenciá cómo los futuros modelos de IA entienden y se comunican en tu campo de expertise. Por favor, enviá tu CV en inglés e indicá tu nivel de dominio del idioma inglés.