Empresa busca un Especialista en Evaluación de Ingeniería de Software para diseñar y crear tareas de codificación para agentes de IA, trabajando de forma remota y con dedicación part-time. Se requiere experiencia en desarrollo backend, pytest y Docker.
Si te copa el mundo de la IA y tenés experiencia en desarrollo backend, esta es tu chance. Podés laburar remoto y diseñar desafíos de código para que los agentes de IA los resuelvan. Ideal para quienes buscan un proyecto interesante y flexible.
Mindrift conecta especialistas con oportunidades de proyectos de IA para empresas líderes en tecnología, enfocados en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es empleo permanente. **Sobre el rol** Diseñarás tareas de codificación que desafíen a los agentes de codificación de IA de vanguardia. Cada tarea es un entorno Docker autocontenido con un fragmento de software defectuoso; un agente de IA intenta la corrección; pruebas automatizadas verifican el resultado. Tu entregable es el paquete completo de la tarea: código defectuoso, pruebas, instrucciones y una solución de referencia que demuestre que la tarea es resoluble. **Responsabilidades** - Inventar un escenario realista de desarrollador: un bug real, un ETL defectuoso, una funcionalidad faltante, no un problema trivial. - Construir un entorno Docker reproducible con dependencias fijadas. - Escribir un `pytest` que verifique resultados, no comandos específicos: determinista, sin fallos y que no revele la solución. - Escribir un `instruction.md` que suene como un ticket de Jira que recibiría un desarrollador. - Escribir un `solve.sh` de referencia que demuestre que la tarea es resoluble. - Calibrar la dificultad para que los agentes de última generación resuelvan la tarea entre el 20% y el 60% de las veces. - Iterar basándose en la retroalimentación de revisores de QA expertos. - Más adelante: revisar tareas de otros autores como revisor de QA. **No incluye** - Etiquetado de datos, ingeniería de prompts. - Código de producción para lanzar: diseñas problemas y verificación para agentes de IA. - Puzzles tipo Leetcode: los escenarios deben parecer trabajo real de desarrollador. - No todas las tareas de candidatos se lanzan: calidad sobre cantidad. **Requisitos** - Más de 3 años de desarrollo de software en producción en un stack backend: Python, Go, Node.js, Java o Rust. La profundidad en un stack supera la amplitud. - Fluidez en Python + `pytest`: requerido independientemente del stack principal. El *task harness* se basa en `pytest` incluso cuando la aplicación defectuosa está en otro idioma. `fixtures`, `parametrize`, `monkeypatch`, `timeouts`, `conftest.py`. - Autoría de Docker: `Dockerfiles` reproducibles, dependencias fijadas, builds multi-etapa cuando sea necesario, usuario no root. - Linux y Bash: comodidad para depurar dentro de contenedores (`strace`, `lsof`, `journalctl`); shell más allá de `set -euo pipefail`. - Experiencia con agentes de codificación de IA: Claude Code, Cursor, Roo Code o similar, en trabajos no triviales. Puedes citar un momento específico en que la IA se equivocó con confianza y cómo lo detectaste. - Inglés: B2+ escrito. **No es un buen perfil** - Ingenieros de Data Science, ML o Visión por Computadora sin experiencia en desarrollo backend. - Testers de QA manuales sin automatización o autoría de pruebas. - Frontend solamente, low-code / no-code, Soporte de IT o Analistas de Negocios. - Ingenieros que nunca hayan escrito `pytest` desde cero. - Junior, pasante o asistente como rol más reciente. **Calificaciones preferidas** - Profundidad de dominio en Seguridad, Administración de Sistemas (nginx / systemd / cron), Computación Científica (NumPy / PyTorch / SciPy), DevOps o internos de Git. - Herramientas modernas de Python (`uv`, `poetry`, `pyproject.toml`). - Herramientas de cobertura (`pytest-cov`, `coverage.py`, `gcov`, `llvm-cov`, `kcov`). - Fuzzing o testing basado en propiedades (Hypothesis). - Contribución previa a benchmarks de evaluación de agentes o frameworks relacionados. **Proceso** Postular → Aprobar calificación (evaluación de tarea de muestra de 90 minutos + breve entrevista conductual) → Unirse a un proyecto → Completar tareas → Recibir pago. **Compromiso de tiempo** - Onboarding: ~10 horas por la primera tarea. - Estado estable: ~5 horas por tarea, 2-4 tareas paralelas por autor. - Carga semanal realista: 8-20 horas. Mayor volumen disponible para los mejores. - Eliges cuándo y cómo contribuir; las tareas deben enviarse antes de la fecha límite y cumplir los criterios de aceptación. **Compensación** - Contribuciones pagas, tarifas de hasta $35/hora*. - Compensación basada en tareas equivalente a la tarifa por hora, según el rendimiento y el volumen. Algunos proyectos incluyen pagos de incentivos. *Las tarifas varían según la experiencia, evaluación de habilidades, ubicación, necesidades del proyecto y otros factores. Se pueden ofrecer tarifas más altas a expertos altamente especializados. Tarifas más bajas pueden aplicarse durante el onboarding o fases de proyectos no centrales. Los detalles de pago se comparten por proyecto. **Postular** Envía tu CV a través de la plataforma Mindrift. Indica tu nivel de inglés, menciona este rol (Software Engineering Evaluation Specialist — Terminal Bench) e incluye un enlace a tu perfil de GitHub si está disponible.