Empresa busca un Ingeniero de Web Scraping freelance con experiencia en Python para unirse al proyecto Tendem, enfocado en la extracción y procesamiento de datos de sitios web complejos. Se requiere experiencia en Python (BeautifulSoup, Selenium), manejo de contenido dinámico y APIs, y habilidades de limpieza y validación de datos. El rol es remoto, a tiempo parcial (10-20 horas/semana), con una compensación de hasta $20 USD por hora.
Si te copa el mundo del web scraping y tenés experiencia en Python, este puesto freelance remoto es para vos. Podés sumar horas a tu semana trabajando en proyectos de extracción y procesamiento de datos para Tendem, una iniciativa de Mindrift.
Mindrift busca especialistas en Web Scraping para unirse al proyecto Tendem (https://tendem.ai/) y desarrollar flujos de trabajo especializados de extracción de datos para casos de uso reales. Buscamos Ingenieros de Python para Data Scraping altamente calificados que se unan al proyecto Tendem y desarrollen flujos de trabajo especializados de extracción de datos para aplicaciones del mundo real. En este rol, aplicarás tu experiencia en web scraping, extracción y procesamiento de datos para entregar resultados precisos, confiables y de alta calidad. Esta oportunidad remota a tiempo parcial es ideal para profesionales técnicos con experiencia práctica en web scraping, extracción y procesamiento de datos. ¿Qué hacemos? La plataforma Mindrift conecta especialistas con proyectos de tecnología innovadores. Nuestra misión es ayudar a desarrollar tecnologías de IA de alta calidad combinando la experiencia del mundo real de profesionales de todo el mundo con esfuerzos avanzados de desarrollo de IA. Sobre el rol Este es un rol freelance para un proyecto de Tendem. Como Ingeniero de Python para Data Scraping, manejarás tareas de extracción de datos que requieren precisión técnica para la extracción y procesamiento web, utilizando herramientas como Apify, OpenRouter y otras tecnologías, junto con tu propia experiencia técnica y enfoques. Responsabilidades clave: - Liderar flujos de trabajo de extracción de datos de extremo a extremo en sitios web complejos, asegurando una cobertura completa, precisión y entrega confiable de conjuntos de datos estructurados. - Aprovechar las herramientas disponibles y los flujos de trabajo personalizados para acelerar la recopilación, validación y ejecución de tareas de datos, cumpliendo con los requisitos definidos. - Asegurar la extracción confiable de fuentes web dinámicas e interactivas, adaptando los enfoques según sea necesario para manejar contenido renderizado por JavaScript y cambios en el comportamiento del sitio. - Aplicar estándares de calidad de datos a través de verificaciones de validación, controles de consistencia entre fuentes, cumplimiento de especificaciones de formato y verificación sistemática antes de la entrega. - Escalar las operaciones de scraping para grandes conjuntos de datos utilizando lotes eficientes o paralelización, monitorear fallos y mantener la estabilidad frente a cambios menores en la estructura del sitio. Requisitos académicos: - Al menos 3 años de experiencia relevante en ingeniería de datos, web scraping, automatización o desarrollo de software (requerido). - Título de Grado o Máster en Ingeniería, Matemáticas Aplicadas, Ciencias de la Computación o campos técnicos relacionados es un plus. Experiencia académica y/o profesional: Los candidatos deben tener una sólida base técnica y experiencia práctica con scripting, automatización y flujos de trabajo de extracción de datos. Buscamos especialistas que puedan resolver problemas no triviales, trabajar con confianza con tecnologías web modernas y herramientas de procesamiento de datos, y recopilar, estructurar y validar datos de diversas fuentes de manera sistemática. Un enfoque metódico y detallista, y la capacidad de trabajar de forma independiente son esenciales. Habilidades técnicas (esenciales): - Fuerte experiencia en Python para web scraping (BeautifulSoup, Selenium o similar), incluyendo contenido dinámico (JS, AJAX, scroll infinito) y APIs a través de proxies. - Capacidad probada para extraer datos de estructuras complejas (jerarquías, páginas archivadas, HTML inconsistente). - Sólida experiencia en limpieza, normalización y validación de datos, entregando conjuntos de datos estructurados (CSV, JSON, Google Sheets). Requisitos adicionales: - Experiencia práctica con LLMs y frameworks de IA para mejorar la automatización y la resolución de problemas. - Gran atención al detalle y compromiso con la precisión de los datos. - Ética de trabajo autodirigida con capacidad para solucionar problemas de forma independiente. - Un enlace a GitHub es un plus. - Dominio del inglés: Intermedio-alto (B2) o superior (requerido). Expectativas de tiempo del proyecto: Para este proyecto, las tareas se estiman en alrededor de 10 a 20 horas por semana durante las fases activas, según los requisitos del proyecto. Esta es una estimación, no una carga de trabajo garantizada, y se aplica solo mientras el proyecto esté activo. Compensación: En este proyecto, los colaboradores pueden ganar hasta el equivalente a $20 por hora, dependiendo de su nivel y ritmo de contribución. La compensación varía entre proyectos según el alcance, la complejidad y la experiencia requerida. Ten en cuenta que otros proyectos en la plataforma pueden ofrecer diferentes niveles de ganancias según sus requisitos.