Balanceamento de Classes com Seleção de Paráfrases para Classificação Binária de Textos

Balanceamento de Classes com Seleção de Paráfrases para Classificação Binária de Textos

Defesa de: Dissertação de Mestrado
Candidato(a): Arthur Bittencourt Vasconcelos
Data: 31 de agosto de 2026, às 9h30
Local: Por videoconferência
Link para a defesa: https://meet.google.com/uir-vmzk-bkq

Resumo

O desbalanceamento de classes é um desafio recorrente na tarefa de classificação de textos. Embora estratégias tradicionais sejam aplicadas para mitigar o problema, a área tem evoluído para métodos baseados em Modelo de Linguagem de Larga Escala, do inglês Large Language Model (LLM). Todavia, a falta de comparativos amplos entre as diferentes abordagens levanta dúvidas quanto à sua vantagem real em relação a métodos tradicionais. Este trabalho investiga os métodos de balanceamento em duas etapas. Na primeira, realiza um estudo que compara abordagens tradicionais de balanceamento, como SMOTE e EDA em relação a abordagens baseadas em LLMs, como PREDATOR e paráfrases geradas por LLMs. Avaliando o efeito da aplicação dessas técnicas em classificadores lineares e modelos modernos baseados na arquitetura Transformers. Os resultados dessa etapa demonstram que a geração indiscriminada de paráfrases não se traduz em ganho preditivo consistente, atingindo o melhor desempenho preditivo em uma das nove bases avaliadas. Por outro lado, o outro método representativo da abordagem baseada em LLMs, o PREDATOR, demonstra uma vantagem marginal em relação aos demais métodos, indicando que a inclusão de um filtro de qualidade pode ser o diferencial do método. Portanto, apresente dissertação propõe um método de aumento de dados denominado Aumento por Paráfrases Selecionadas (APS). O método utiliza a capacidade generativa de LLMs para criar sentenças e introduz mecanismos heurísticos de seleção baseados em duas vertentes:a primeira vertente fundamenta-se na similaridade semântica entre o exemplo gerado e os exemplos minoritários da base, priorizando as paráfrases semanticamente mais próximas da representação central da classe minoritária real. A segunda vertente baseia-se na amostragem por meio da incerteza oriunda do aprendizado ativo, que sugere que os exemplos mais valiosos para o treinamento do modelo são justamente aqueles que o classificador apresenta maior dificuldade em categorizar. A avaliação do APS demonstra que a inserção do mecanismo de seleção incrementa significativamente a efetividade do método proposto, alcançando melhorias nos valores absolutos de desempenho preditivo (em média 11,28%) e atingindo o topo no ranking de desempenho entre os métodos avaliados.

Abstract

Class imbalance is a recurring challenge in the text classification task. Although traditional strategies such as SMOTE and EDA are applied to mitigate this problem, the field has been evolving toward methods based on Large Language Models (LLMs). However, the lack of comprehensive comparisons among different approaches, raises doubts regarding their real advantage over traditional methods. This work investigates class balancing methods in two stages. In the first stage, it presents a study comparing traditional balancing approaches, such as SMOTE and EDA, with LLM-based approaches, such as PREDATOR and LLM-generated paraphrases, evaluating the impact of applying these techniques to linear classifiers and modern models based on the Transformer architecture. The results of this stage demonstrate that the indiscriminate generation of paraphrases does not translate into consistent predictive gains, achieving top predictive performance in only one of the nine evaluated datasets. On the other hand, PREDATOR shows a marginal advantage over other methods, indicating that the inclusion of a quality filter may be the key differentiator of the method. Therefore this dissertation proposes a data augmentation method called Augmentation by Paraphrase Selection (APS, or Aumento por Paráfrases Selecionadas in portuguese). The method leverages the generative capability of LLMs to synthesize sentences and introduces heuristic selection mechanisms based on two fronts: the first front is grounded in the semantic similarity between the generated sample and the minority instances in the dataset, prioritizing paraphrases that are semantically closest to the central representation of the actual minority class. The second front relies on uncertainty sampling derived from active learning, which posits that the most valuable samples for model training are precisely those that the classifier finds most difficult to categorize. The evaluation of APS demonstrates that the incorporation of the selection mechanism significantly alters the effectiveness of the method, achieving improvements in absolute predictive performance metrics (11,28% on average) and reaching top rank among the evaluated methods.

Banca Examinadora

  • Profa. Aline Marins Paes Carvalho, UFF
  • Prof. Alexandre Plastino de Carvalho, UFF
  • Profa. Mariza Ferro, UFF
  • Prof. Washington Luiz Miranda da Cunha, UFMG
  • Prof. Eduardo Bezerra da Silva, CEFET-RJ

Leitura Recomendada em Metodologia de Pesquisa

Para quem está iniciando ou revisando os fundamentos metodológicos de uma pesquisa em Ciência da Computação, seguem algumas referências clássicas e amplamente utilizadas em Mestrados e Doutorados da área:

  1. Wazlawick, R. S. (2017). Metodologia de Pesquisa para Ciência da Computação. Editora Campus/Elsevier.
  2. Creswell, J. W., & Creswell, J. D. (2018). Research Design: Qualitative, Quantitative, and Mixed Methods Approaches. SAGE Publications.
  3. Yin, R. K. (2018). Case Study Research and Applications: Design and Methods. SAGE Publications.
  4. Wohlin, C., Runeson, P., Höst, M., Ohlsson, M. C., Regnell, B., & Wesslén, A. (2012). Experimentation in Software Engineering. Springer.
  5. Basili, V. R., Caldiera, G., & Rombach, H. D. (1994). The Goal Question Metric Approach. Encyclopedia of Software Engineering, Wiley.
  6. Glass, R. L., Ramesh, V., & Vessey, I. (2004). An Analysis of Research in Computing Disciplines. Communications of the ACM, 47(6).
  7. Shaw, M. (2003). Writing Good Software Engineering Research Papers. Proceedings of the 25th International Conference on Software Engineering (ICSE).
  8. Easterbrook, S., Singer, J., Storey, M.-A., & Damian, D. (2008). Selecting Empirical Methods for Software Engineering Research. In Guide to Advanced Empirical Software Engineering, Springer.
  9. Kitchenham, B., & Charters, S. (2007). Guidelines for Performing Systematic Literature Reviews in Software Engineering. EBSE Technical Report.
  10. Booth, W. C., Colomb, G. G., & Williams, J. M. (2016). The Craft of Research. University of Chicago Press.

Publicado por Maiquel Gomes — maiquelgomes.com.br

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Are you human? Please solve:Captcha