
Balanceamento de Classes com Seleção de Paráfrases para Classificação Binária de Textos
Resumo:
O desbalanceamento de classes é um desafio recorrente na tarefa de classificação de textos. Embora estratégias tradicionais sejam aplicadas para mitigar o problema, a área tem evoluído para métodos baseados em Modelo de Linguagem de Larga Escala, do inglês Large Language Model (LLM). Todavia, a falta de comparativos amplos entre as diferentes abordagens levanta dúvidas quanto à sua vantagem real em relação a métodos tradicionais. Este trabalho investiga os métodos de balanceamento em duas etapas. Na primeira, realiza um estudo que compara abordagens tradicionais de balanceamento, como SMOTE e EDA em relação a abordagens baseadas em LLMs, como PREDATOR e paráfrases geradas por LLMs. Avaliando o efeito da aplicação dessas técnicas em classificadores lineares e modelos modernos baseados na arquitetura Transformers. Os resultados dessa etapa demonstram que a geração indiscriminada de paráfrases não se traduz em ganho preditivo consistente, atingindo o melhor desempenho preditivo em uma das nove bases avaliadas. Por outro lado, o outro método representativo da abordagem baseada em LLMs, o PREDATOR, demonstra uma vantagem marginal em relação aos demais métodos, indicando que a inclusão de um filtro de qualidade pode ser o diferencial do método. Portanto, apresente dissertação propõe um método de aumento de dados denominado Aumento por Paráfrases Selecionadas (APS). O método utiliza a capacidade generativa de LLMs para criar sentenças e introduz mecanismos heurísticos de seleção baseados em duas vertentes:a primeira vertente fundamenta-se na similaridade semântica entre o exemplo gerado e os exemplos minoritários da base, priorizando as paráfrases semanticamente mais próximas da representação central da classe minoritária real. A segunda vertente baseia-se na amostragem por meio da incerteza oriunda do aprendizado ativo, que sugere que os exemplos mais valiosos para o treinamento do modelo são justamente aqueles que o classificador apresenta maior dificuldade em categorizar. A avaliação do APS demonstra que a inserção do mecanismo de seleção incrementa significativamente a efetividade do método proposto, alcançando melhorias nos valores absolutos de desempenho preditivo (em média 11,28%) e atingindo o topo no ranking de desempenho entre os métodos avaliados.
Abstract:
Class imbalance is a recurring challenge in the text classification task. Although traditional strategies such as SMOTE and EDA are applied to mitigate this problem, the field has been evolving toward methods based on Large Language Models (LLMs). However, the lack of comprehensive comparisons among different approaches, raises doubts regarding their real advantage over traditional methods. This work investigates class balancing methods in two stages. In the first stage, it presents a study comparing traditional balancing approaches, such as SMOTE and EDA, with LLM-based approaches, such as PREDATOR and LLM-generated paraphrases, evaluating the impact of applying these techniques to linear classifiers and modern models based on the Transformer architecture. The results of this stage demonstrate that the indiscriminate generation of paraphrases does not translate into consistent predictive gains, achieving top predictive performance in only one of the nine evaluated datasets. On the other hand, PREDATOR shows a marginal advantage over other methods, indicating that the inclusion of a quality filter may be the key differentiator of the method. Therefore this dissertation proposes a data augmentation method called Augmentation by Paraphrase Selection (APS, or Aumento por Paráfrases Selecionadas in portuguese). The method leverages the generative capability of LLMs to synthesize sentences and introduces heuristic selection mechanisms based on two fronts: the first front is grounded in the semantic similarity between the generated sample and the minority instances in the dataset, prioritizing paraphrases that are semantically closest to the central representation of the actual minority class. The second front relies on uncertainty sampling derived from active learning, which posits that the most valuable samples for model training are precisely those that the classifier finds most difficult to categorize. The evaluation of APS demonstrates that the incorporation of the selection mechanism significantly alters the effectiveness of the method, achieving improvements in absolute predictive performance metrics (11,28% on average) and reaching top rank among the evaluated methods.
Banca examinadora:
Profa. Aline Marins Paes Carvalho, UFF
Prof. Alexandre Plastino de Carvalho, UFF
Profa. Mariza Ferro, UFF
Prof. Washington Luiz Miranda da Cunha, UFMG
Prof. Eduardo Bezerra da Silva, CEFET-RJ