Empresa busca Ingeniero Python Senior para evaluar agentes de codificación de IA en proyectos freelance. Se requiere experiencia en Python, JavaScript/TypeScript, Docker, bases de datos y testing, con un nivel de inglés B2+.
Si sos un Python Engineer con experiencia y te copa la IA, esta es tu chance de laburar en proyectos freelance para empresas top. Vas a evaluar agentes de codificación de IA, creando entornos y tests para mejorar su performance. Ideal si buscás sumar experiencia en el mundo AI.
Mindrift conecta especialistas con oportunidades de proyectos de IA para empresas líderes de tecnología, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente. **Sobre esta oportunidad:** Estamos creando un conjunto de datos para evaluar agentes de codificación de IA: qué tan bien un modelo maneja tareas de desarrollador del mundo real. Crearás tareas desafiantes y criterios de evaluación dentro de entornos simulados realistas: - Construir entornos de desarrollador realistas: una empresa virtual con codebase, infraestructura y contexto (tickets, docs, conversaciones) que forman un historial de desarrollo creíble. - Diseñar tareas a partir de estados intermedios de estos entornos: elaborar el prompt, definir qué significa "resuelto" y asegurar que la tarea sea resoluble por un agente de IA. - Escribir tests que verifiquen las soluciones del agente: aceptar todos los enfoques válidos y rechazar los incorrectos, sin ser demasiado estrictos ni demasiado laxos. - Iterar sobre tareas y tests basándose en feedback de QA: revisar soluciones de agentes, analizar fallos y refinar hasta que la evaluación sea justa y robusta. **Lo que NO es:** - No es etiquetado de datos. - No es prompt engineering. - No es escribir código desde cero: el agente escribe la mayor parte del código; vos guiás y evaluás. **Qué buscamos:** - Más de 8 años de experiencia en desarrollo de software. - Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis. - Experiencia escribiendo tests (funcionales, de integración). - Dominio del idioma inglés (nivel B2+). **Por qué es desafiante:** Los modelos de frontera ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. Necesitás entender profundamente dónde fallan los modelos y qué escenarios revelan la diferencia entre una solución buena y una mala. Las tareas tienen muchas soluciones válidas: escribir tests que acepten todas las soluciones correctas y rechacen las incorrectas es más difícil de lo que parece. **Cómo funciona:** 1. Postulá. 2. Pasá las cualificaciones. 3. Uníte a un proyecto. 4. Completá tareas. 5. Recibí el pago. **Estimación de esfuerzo:** Las tareas para este proyecto se estiman en 30 horas de trabajo, dependiendo de la complejidad. Esta es una estimación y no un requisito de horario; vos elegís cuándo y cómo trabajar. Las tareas deben enviarse antes de la fecha límite y cumplir con los criterios de aceptación listados para ser aprobadas. **Compensación:** Hasta $150 por hora equivalente, dependiendo del nivel y el ritmo. Las tareas se estiman en ~30 horas cada una; vos establecés tu propio horario.