Ingeniero ML / Data Scientist
Lisit · Remote
Skills in this posting
The posting
Excluyente
Python sólido (pandas, scikit-learn) y experiencia real llevando un modelo a producción en NLP en español .
Experiencia con tokenización , normalización de texto y manejo de errores ortográficos .
Experiencia con Transformers / Hugging Face para fine-tuning de BERT (ideal BETO u otro BERT en español) orientado a NER .
Etiquetado programático / weak supervision : construir datasets de entrenamiento sin etiquetado manual masivo.
Evaluación rigurosa : precision/recall/F1, conjuntos held-out y control de fuga de datos .
Cómo evaluamos el enfoque: necesitamos que puedas explicar de forma clara cómo construirías el dataset de entrenamiento cuando no existe corpus etiquetado y hay 1,8 M de pares históricos; y qué significa que un modelo esté calibrado y cómo lo comprobarías.
We valoramos además una forma de trabajo ordenada y comunicable: foco en reproducibilidad, pensamiento crítico sobre métricas (held-out y fuga de datos) y mentalidad de transferencia hacia el cliente.
Misión: construir el corpus de entrenamiento a partir de 1,8 millones de pares históricos; hacer fine-tuning de un modelo NER en español; calibrar el score de confianza; y dejar el pipeline reproducible y traspasable al cliente.
Construir el dataset de entrenamiento sin etiquetado manual masivo (etiquetado programático / weak supervision).
Realizar tokenización y normalización de texto para NLP en español.
Entrenar y ajustar un modelo para NER en español (idealmente BERT en español, como BETO u otro BERT en español) con Transformers / Hugging Face.
Gestionar errores ortográficos y robustez del preprocesamiento.
Evaluar rigurosamente el desempeño con precision/recall/F1 usando conjuntos held-out y control de fuga de datos.
Calibrar probabilidades para que el umbral de confianza sea interpretable (score calibrado con métodos como Platt o isotónica).
Garantizar reproducibilidad: documentación del pipeline, trazabilidad de experimentos y empaquetado para que el cliente pueda replicarlo y operarlo.
XGBoost y calibración de probabilidades (Platt / isotónica): el umbral de 0,82 debe significar probabilidad real.
Embeddings y búsqueda vectorial (pgvector, HNSW, sentence-transformers).
Fuzzy matching : distancias de edición, algoritmos fonéticos, pg_trgm.
MLflow para gestión de experimentos y despliegue.
ONNX y cuantización INT8 para inferencia eficiente en CPU (sin GPU).
libpostal .
Experiencia con direcciones postales , geocodificación o datos geográficos.
100% remoto
Si te interesa construir un pipeline reproducible, entrenar NER en español con enfoque en weak supervision y evaluar/calibrar con rigor, te invitamos a postular.
The PivotHop read
- What a data scientist actually earnsmedian, seniority, by country
- Where data scientists move nextevery measured route out
- Machine Learning Engineer → Data Scientist70% readiness
- All open data scientist rolesthe full board
Where these skills also reach
- 429 open data analyst roles60% readiness from data scientist
- 72 open product analyst roles56% readiness from data scientist
- 508 open research scientist roles55% readiness from data scientist
- 274 open machine learning engineer roles53% readiness from data scientist
More data scientist roles
Data Scientist - AI Safety at ElevenLabsLondon · RemoteTodayApply
Data Scientist at Environmental Protection AgencyWashington, District of Columbia$71k–$111kTodayApply
Staff Applied Scientist at BrazeNew York City$184kTodayApply
Data Scientist - Workday Products at KainosUnited Kingdom · Remote1d agoApply
Senior Data Scientist - Product at LegoraLondon1d agoApply
Backfilled listing, refreshed with the nightly scrape; the employer has not claimed it yet. Are you the employer? Claim this listing and it can be featured to the candidates whose skills already reach it, first month free.