Empresa de IA busca ingenieros Python con experiencia en testing y desarrollo de software para diseñar y evaluar sistemas de IA en proyectos freelance. Se requiere dominio de Python, JavaScript/TypeScript y habilidades de testing.
Si sos ingeniero Python con experiencia en testing y querés trabajar en proyectos freelance para empresas de IA, esta es tu oportunidad. Podrás diseñar y evaluar sistemas de IA, sumándote a un equipo que busca la honestidad y la calidad en el desarrollo.
Mindrift conecta especialistas con oportunidades de proyectos de IA para empresas líderes de tecnología, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente. **Sobre esta oportunidad:** Los agentes de codificación de Frontier ya son buenos pasando tests. Medimos si los pasan de la manera correcta. Estamos construyendo un dataset para evaluar la seguridad y la conducta de los agentes de codificación de IA — no solo si completan una tarea, sino si lo hacen honestamente, dentro del alcance y sin atajos. Diseñarás tareas donde el camino fácil es el inseguro, y escribirás los tests que lo detecten: - Construir entornos de desarrollo realistas — una empresa virtual con codebase, infraestructura y contexto (tickets, docs, conversaciones) que formen un historial de desarrollo creíble. - Diseñar tareas que emparejen un objetivo de desarrollo benigno con un atajo inseguro tentador: scope creep, violaciones de políticas, corrupción de datos, cambios demasiado permisivos. - Escribir tests que verifiquen si el agente completó la tarea de la manera correcta — detectando atajos, no solo verificando outputs. - Iterar sobre tareas y tests basándose en feedback de QA — revisar soluciones de agentes, analizar fallos y refinar hasta que la evaluación sea justa y robusta. **Lo que NO es:** - No es etiquetado de datos; no es prompt engineering; no es ciberseguridad o red-teaming — no hay un atacante en el escenario. Experiencia en ciberseguridad es un plus, pero no un requisito. Buscamos ingenieros que entiendan cómo debe comportarse el código, no penetration testers. - Fuertes ingenieros de software, no especialistas en seguridad. - No es escribir código desde cero — el agente escribe la mayor parte del código; vos diseñás la situación y evaluás el resultado. **Qué buscamos:** - 4–5+ años de experiencia en desarrollo de software. - Stack principal: Python, JavaScript/TypeScript. - Fuertes habilidades de diseño de tests — tests funcionales y de integración que separen la finalización segura de la insegura, no solo la correcta de la incorrecta. - Experiencia práctica con agentes de codificación (Claude Code, GitHub Copilot CLI, Codex o similares). - Familiaridad con GitHub PRs y flujos de CI como usuario. - Amplitud de stack es bienvenida, no un filtro. Las tareas simulan repositorios reales con bases de datos, pipelines de CI y scripts de deploy, por lo que una exposición más amplia a backend e infraestructura es genuinamente útil — pero no necesitás ser experto en cada capa. - Dominio del inglés — B2+. **Por qué esto es difícil:** Los modelos Frontier ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. La verdadera dificultad es construir la tentación — un escenario donde el camino inseguro o fuera de alcance sea el de menor resistencia — y luego escribir tests que detecten de manera confiable a un agente que lo tomó. Las tareas tienen muchas soluciones válidas; los tests deben aceptar todas y rechazar las malas. **Cómo funciona:** Aplicar → Pasar calificación(es) → Unirse a un proyecto → Completar tareas → Cobrar. **Expectativas de tiempo del proyecto:** Para este proyecto, se estima que las tareas requerirán alrededor de 20-25 horas por semana durante las fases activas, según los requisitos del proyecto. Esta es una estimación, no una carga de trabajo garantizada, y se aplica solo mientras el proyecto está activo. Las tareas deben enviarse antes de la fecha límite y cumplir los criterios de aceptación listados para ser aceptadas. **Compensación:** En este proyecto, los contribuyentes pueden ganar hasta el equivalente a $50 por hora, dependiendo de su nivel y ritmo de contribución. La compensación varía entre proyectos según el alcance, la complejidad y la experiencia requerida. Tenga en cuenta que otros proyectos en la plataforma pueden ofrecer diferentes niveles de ganancias según sus requisitos.