Empresa busca Ingeniero de Evaluación de Agentes Freelance para unirse a proyectos de IA, enfocado en la creación y evaluación de tareas para agentes de codificación de IA. Se requiere experiencia en desarrollo de software y dominio del inglés.
Si sos desarrollador con experiencia y te copa la IA, esta es tu chance de meterte en proyectos de vanguardia. Podés laburar remoto y aplicar tus skills de testing en la evaluación de agentes de codificación.
Mindrift conecta especialistas con oportunidades de proyectos basados en IA para empresas líderes de tecnología, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente. Estamos construyendo un conjunto de datos para evaluar agentes de codificación de IA: qué tan bien un modelo maneja tareas de desarrollador del mundo real. Crearás tareas desafiantes y criterios de evaluación dentro de entornos simulados realistas: - Construir entornos de desarrollo realistas: una empresa virtual con codebase, infraestructura y contexto (tickets, docs, conversaciones) que forma un historial de desarrollo creíble. - Diseñar tareas a partir de estados intermedios de estos entornos: elaborar el prompt, definir qué significa "resuelto" y asegurar que la tarea sea resoluble por un agente de IA. - Escribir pruebas que verifiquen las soluciones del agente: aceptar todos los enfoques válidos y rechazar los incorrectos, sin ser demasiado estrictos ni demasiado laxos. - Iterar sobre tareas y pruebas basándose en feedback de QA: revisar soluciones de agentes, analizar fallos y refinar hasta que la evaluación sea justa y robusta. Lo que esto NO es: - No es etiquetado de datos. - No es prompt engineering. - No es escribir código desde cero: el agente escribe la mayor parte del código; tú guías y evalúas. Qué buscamos: - Más de 5 años en desarrollo de software. - Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis. - Experiencia escribiendo tests (funcionales, de integración). - Dominio del inglés: B2+. Por qué esto es difícil: Los modelos de frontera ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. Necesitas entender profundamente dónde fallan los modelos y qué escenarios revelan la diferencia entre una solución buena y una mala. Las tareas tienen muchas soluciones válidas: escribir pruebas que acepten todas las soluciones correctas y rechacen las incorrectas es más difícil de lo que parece. Requisitos y beneficios: - Calificaciones educativas: Título de Máster en Ciencias de la Computación, Ingeniería de Software, Ciencia de Datos / Análisis de Datos, Inteligencia Artificial / Aprendizaje Automático, Lingüística Computacional / Procesamiento del Lenguaje Natural (NLP), Sistemas de Información o campos relacionados. Se acepta título de Grado si el candidato tiene 5 años de experiencia en el campo. - Experiencia académica y/o profesional: Los candidatos deben tener un mínimo de 3 años de experiencia profesional en roles o dominios relacionados, específicamente para roles de QA-automatización/testing o ciberseguridad. Cómo funciona: Aplicar → Aprobar calificación(es) → Unirse a un proyecto → Completar tareas → Recibir pago. Compensación: Pago por tarea aceptada. Tu tarifa depende del nivel de calificación que alcances y la eficiencia con la que completes las tareas, hasta el equivalente a $30/hora. Dado que el pago es por tarea, un ritmo más rápido aumenta tu tarifa horaria efectiva. ¿Por qué esta oportunidad freelance podría ser una gran opción para ti? - Participa en un proyecto freelance, remoto y a tiempo parcial que se adapta a tus compromisos profesionales o académicos principales. - Trabaja en proyectos avanzados de IA y obtén experiencia valiosa que mejore tu portafolio. - Influye en cómo los futuros modelos de IA entienden y se comunican en tu campo de especialización.