Comportamiento de algoritmos de sobre-muestreo en big data

Main Article Content

Angélica Guzmán Ponce http://orcid.org/0000-0002-7844-1266
César Ferri Ramírez http://orcid.org/0000-0002-8975-1120
José Salvador Sánchez-Garreta http://orcid.org/0000-0003-1053-4658
José Raymundo Marcial-Romero http://orcid.org/0000-0002-5808-5727

Resumen

El desbalance de clases es una de las complejidades de los datos ampliamente estudiada en el campo de la ciencia de datos. A menudo dificulta el proceso de extracción de conocimiento, sesgando el aprendizaje hacia instancias de clase mayoritaria. La creciente generación de datos que estamos viviendo agrava el escenario anterior. Los desafíos en Big Data implica la necesidad de adaptar o crear nuevas técnicas para las restricciones de escalabilidad, dando lugar al desarrollo de técnicas que solventen el desbalance de clases en grandes volúmenes de datos, siendo la mayoría de estas basadas en el algoritmo SMOTE, en razón de tener un mejor desempeño en conjuntos “pequeños”. En este trabajo realizamos un análisis del comportamiento de los métodos de sobre-muestreo en Big Data, a través de medidas de complejidad que permiten conocer las características de los conjuntos de datos procesados. Los resultados obtenidos corroboran que el problema de desbalance de clases en Big Data no es el único problema que debe abordarse; por otro lado, el comportamiento de SMOTE en Big Data no es comparable al logrado en conjuntos de datos pequeños, debido a la presencia de redundancia por parte del proceso de interpolación.

Article Details

Como citar
GUZMÁN PONCE, Angélica et al. Comportamiento de algoritmos de sobre-muestreo en big data. Ideas en Ciencias de la Ingeniería, [S.l.], v. 1, n. 2, p. 53-69, oct. 2022. ISSN 2992-7447. Disponible en: <https://ideasencienciasingenieria.uaemex.mx/article/view/19810>. Fecha de acceso: 26 ago. 2026
Sección
Artículos

Citas

1. Basgall, M. J., Hasperué, W., Naiouf, M., Fernández, A. & Herrera, F. (2018). SMOTE-BD: An Exact and Scalable Oversampling Method for Imbalanced Classification in Big Data. Journal of Computer Science and Technology, 18(03), 23–28. https://doi.org/10.24215/16666038.18.e23

2. Basgall, M. J., Hasperué, W., Naiouf, M., Fernández, A. & Herrera, F. (2019). An Analysis of Local and Global Solutions to Address Big Data Imbalanced Classification: A Case Study with SMOTE Preprocessing. Communications in Computer and Information Science, 75-85. https://doi.org/10.1007/978-3-030-27713-0_7

3. Batista, G. E. A. P. A., Prati, R. C. & Monard, M. C. (2004). A study of the behavior of several methods for balancing machine learning training data. ACM SIGKDD Explorations Newsletter, 6(1), 20-29. https://doi.org/10.1145/1007730.1007735

4. Del Río, S., López, V., Benítez, J. M. & Herrera, F. (2014). On the use of MapReduce for imbalanced big data using Random Forest. Information Sciences, 285, 112-137. https://doi.org/10.1016/j.ins.2014.03.043

5. García, S., Galar, M., Prati, R. C., Krawczyk, B. & Herrera, F. (2018). Learning from Imbalanced Data Sets. Springer. https://doi.org/10.1007/978-3-319-98074-4

6. García, S., Ramírez-Gallego, S., Luengo, J., Benítez, J. M. & Herrera, F. (2016). Big data preprocessing: methods and prospects. Big Data Analytics, 1(9), 1–22. https://doi.org/10.1186/s41044-016-0014-0

7. García, V., Sánchez, J., Marqués, A., Florencia, R. & Rivera, G. (2020). Understanding the apparent superiority of over-sampling through an analysis of local information for class-imbalanced data. Expert Systems with Applications, 158, 113026. https://doi.org/10.1016/j.eswa.2019.113026

8. Gutiérrez, P. D., Lastra, M., Benítez, J. M. & Herrera, F. (2017). SMOTE-GPU: Big Data preprocessing on commodity hardware for imbalanced classification. Progress in Artificial Intelligence, 6(4), 347-354. https://doi.org/10.1007/s13748-017-0128-2

9. Kitchin, R. & Lauriault, T. P. (2015). Small data in the era of big data. GeoJournal, 80(4), 463-475. https://doi.org/10.1007/s10708-014-9601-7

10. Lichman, M. (s. f.). UCI Machine Learning Repository. Recuperado 5 de octubre de 2022, de https://archive.ics.uci.edu/ml/index.php

11. Luengo, J., García-Gil, D., Ramírez-Gallego, S., García, S. & Herrera, F. (2020). Big Data Preprocessing. Cham, Switzerland: Springer International Publishing. https://doi.org/10.1007/978-3-030-39105-8

12. Maillo, J., Ramírez, S., Triguero, I. & Herrera, F. (2017). kNN-IS: An Iterative Spark-based design of the k-Nearest Neighbors classifier for big data. Knowledge-Based Systems, 117, 3-15. https://doi.org/10.1016/j.knosys.2016.06.012

13. Maillo, J., Triguero, I. & Herrera, F. (2020). Redundancy and Complexity Metrics for Big Data Classification: Towards Smart Data. IEEE Access, 8, 87918-87928. https://doi.org/10.1109/access.2020.2991800

14. Maldonado, S., López, J. & Vairetti, C. (2019). An alternative SMOTE oversampling strategy for high-dimensional datasets. Applied Soft Computing, 76, 380-389. https://doi.org/10.1016/j.asoc.2018.12.024

15. Rendón, E., Alejo, R., Castorena, C., Isidro-Ortega, F. J. & Granda-Gutiérrez, E. E. (2020). Data Sampling Methods to Deal With the Big Data Multi-Class Imbalance Problem. Applied Sciences, 10(4), 1276. https://doi.org/10.3390/app10041276