Comportamiento de algoritmos de sobre-muestreo en big data
Main Article Content
Resumen
El desbalance de clases es una de las complejidades de los datos ampliamente estudiada en el campo de la ciencia de datos. A menudo dificulta el proceso de extracción de conocimiento, sesgando el aprendizaje hacia instancias de clase mayoritaria. La creciente generación de datos que estamos viviendo agrava el escenario anterior. Los desafíos en Big Data implica la necesidad de adaptar o crear nuevas técnicas para las restricciones de escalabilidad, dando lugar al desarrollo de técnicas que solventen el desbalance de clases en grandes volúmenes de datos, siendo la mayoría de estas basadas en el algoritmo SMOTE, en razón de tener un mejor desempeño en conjuntos “pequeños”. En este trabajo realizamos un análisis del comportamiento de los métodos de sobre-muestreo en Big Data, a través de medidas de complejidad que permiten conocer las características de los conjuntos de datos procesados. Los resultados obtenidos corroboran que el problema de desbalance de clases en Big Data no es el único problema que debe abordarse; por otro lado, el comportamiento de SMOTE en Big Data no es comparable al logrado en conjuntos de datos pequeños, debido a la presencia de redundancia por parte del proceso de interpolación.
Article Details

Esta obra está bajo licencia internacional Creative Commons Reconocimiento-NoComercial-SinObrasDerivadas 4.0.
Citas
2. Basgall, M. J., Hasperué, W., Naiouf, M., Fernández, A. & Herrera, F. (2019). An Analysis of Local and Global Solutions to Address Big Data Imbalanced Classification: A Case Study with SMOTE Preprocessing. Communications in Computer and Information Science, 75-85. https://doi.org/10.1007/978-3-030-27713-0_7
3. Batista, G. E. A. P. A., Prati, R. C. & Monard, M. C. (2004). A study of the behavior of several methods for balancing machine learning training data. ACM SIGKDD Explorations Newsletter, 6(1), 20-29. https://doi.org/10.1145/1007730.1007735
4. Del Río, S., López, V., Benítez, J. M. & Herrera, F. (2014). On the use of MapReduce for imbalanced big data using Random Forest. Information Sciences, 285, 112-137. https://doi.org/10.1016/j.ins.2014.03.043
5. García, S., Galar, M., Prati, R. C., Krawczyk, B. & Herrera, F. (2018). Learning from Imbalanced Data Sets. Springer. https://doi.org/10.1007/978-3-319-98074-4
6. García, S., Ramírez-Gallego, S., Luengo, J., Benítez, J. M. & Herrera, F. (2016). Big data preprocessing: methods and prospects. Big Data Analytics, 1(9), 1–22. https://doi.org/10.1186/s41044-016-0014-0
7. García, V., Sánchez, J., Marqués, A., Florencia, R. & Rivera, G. (2020). Understanding the apparent superiority of over-sampling through an analysis of local information for class-imbalanced data. Expert Systems with Applications, 158, 113026. https://doi.org/10.1016/j.eswa.2019.113026
8. Gutiérrez, P. D., Lastra, M., Benítez, J. M. & Herrera, F. (2017). SMOTE-GPU: Big Data preprocessing on commodity hardware for imbalanced classification. Progress in Artificial Intelligence, 6(4), 347-354. https://doi.org/10.1007/s13748-017-0128-2
9. Kitchin, R. & Lauriault, T. P. (2015). Small data in the era of big data. GeoJournal, 80(4), 463-475. https://doi.org/10.1007/s10708-014-9601-7
10. Lichman, M. (s. f.). UCI Machine Learning Repository. Recuperado 5 de octubre de 2022, de https://archive.ics.uci.edu/ml/index.php
11. Luengo, J., García-Gil, D., Ramírez-Gallego, S., García, S. & Herrera, F. (2020). Big Data Preprocessing. Cham, Switzerland: Springer International Publishing. https://doi.org/10.1007/978-3-030-39105-8
12. Maillo, J., Ramírez, S., Triguero, I. & Herrera, F. (2017). kNN-IS: An Iterative Spark-based design of the k-Nearest Neighbors classifier for big data. Knowledge-Based Systems, 117, 3-15. https://doi.org/10.1016/j.knosys.2016.06.012
13. Maillo, J., Triguero, I. & Herrera, F. (2020). Redundancy and Complexity Metrics for Big Data Classification: Towards Smart Data. IEEE Access, 8, 87918-87928. https://doi.org/10.1109/access.2020.2991800
14. Maldonado, S., López, J. & Vairetti, C. (2019). An alternative SMOTE oversampling strategy for high-dimensional datasets. Applied Soft Computing, 76, 380-389. https://doi.org/10.1016/j.asoc.2018.12.024
15. Rendón, E., Alejo, R., Castorena, C., Isidro-Ortega, F. J. & Granda-Gutiérrez, E. E. (2020). Data Sampling Methods to Deal With the Big Data Multi-Class Imbalance Problem. Applied Sciences, 10(4), 1276. https://doi.org/10.3390/app10041276
http://orcid.org/0000-0002-7844-1266