Mindrift conecta especialistas con oportunidades de proyectos de IA para empresas tecnológicas líderes, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente.
Estamos construyendo un dataset para evaluar agentes de codificación de IA: qué tan bien un modelo maneja tareas de desarrollador del mundo real. Crearás tareas desafiantes y criterios de evaluación dentro de entornos simulados realistas:
- Construir entornos de desarrollador realistas: una empresa virtual con codebase, infraestructura y contexto (tickets, docs, conversaciones) que forma un historial de desarrollo creíble.
- Diseñar tareas a partir de estados intermedios de estos entornos: elaborar el prompt, definir qué significa "resuelto" y asegurar que la tarea sea resoluble por un agente de IA.
- Escribir tests que verifiquen las soluciones del agente: aceptar todos los enfoques válidos y rechazar los incorrectos, sin ser demasiado estrictos ni demasiado laxos.
- Iterar sobre tareas y tests basándose en feedback de QA: revisar soluciones de agentes, analizar fallos y refinar hasta que la evaluación sea justa y robusta.
Lo que NO es
- No es etiquetado de datos.
- No es prompt engineering.
- No es escribir código desde cero: el agente escribe la mayor parte del código; vos guiás y evaluás.
Qué
buscamos
- Más de 5 años en desarrollo de software.
- Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis.
- Experiencia escribiendo tests (funcionales, de integración).
- Dominio del inglés: B2+.
Por qué esto es difícil
Los modelos de frontera ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. Necesitas entender profundamente dónde fallan los modelos y qué escenarios revelan la diferencia entre una solución buena y una mala. Las tareas tienen muchas soluciones válidas: escribir tests que acepten todas las soluciones correctas y rechacen las incorrectas es más difícil de lo que parece.
Requisitos y
beneficios
- Título de Máster en Ciencias de la Computación, Ingeniería de Software, Ciencia de Datos / Análisis de Datos, Inteligencia Artificial / Machine Learning, Lingüística Computacional / Procesamiento del Lenguaje Natural (NLP), Sistemas de Información o campos relacionados. Se acepta título de grado si el candidato tiene 5 años de experiencia en el campo.
- Experiencia académica y/o profesional: Los candidatos deben tener un mínimo de 3 años de experiencia profesional en roles o dominios relacionados, específicamente para roles de QA-automatización/testing o ciberseguridad.
Cómo funciona
1. Postulate.
2. Pasá las cualificaciones.
3. Uníte a un proyecto.
4. Completá tareas.
5. Recibí el pago.
Compensación: Pago por tarea aceptada. Tu tarifa depende del nivel de cualificación que alcances y la eficiencia con la que completes las tareas, hasta el equivalente a $30/hora. Dado que el pago es por tarea, un ritmo más rápido aumenta tu tarifa horaria efectiva.
¿Por qué esta oportunidad freelance podría ser ideal para vos?
- Participá en un proyecto freelance, remoto y de medio tiempo que se adapta a tus compromisos profesionales o académicos principales.
- Trabajá en proyectos avanzados de IA y ganá experiencia valiosa que mejore tu portafolio.
- Influenciá cómo los futuros modelos de IA entienden y se comunican en tu campo de expertise.
Por favor, enviá tu CV en inglés e indicá tu nivel de dominio del idioma inglés.