Use este identificador para citar ou linkar para este item: http://hdl.handle.net/123456789/10995
Registro completo de metadados
Campo DCValorIdioma
dc.contributor.authorCUTRIM, Patrick Moraes-
dc.date.accessioned2026-09-03T12:37:37Z-
dc.date.available2026-09-03T12:37:37Z-
dc.date.issued2026-07-20-
dc.identifier.urihttp://hdl.handle.net/123456789/10995-
dc.descriptionData imbalance constitutes a fundamental challenge in machine learning, directly affecting the reliability of predictive models in sensitive domains such as the financial sector and healthcare. Although inter-class imbalance has historically been the focus of research, the phenomenon of intra-class imbalance — characterized by the uneven distribution of patterns and difficulty levels within the same category — poses a critical obstacle to the generalization capacity of algorithms. This work explores mitigation strategies for both levels of imbalance, conducting an experimental analysis in two high-criticality domains: fraud detection in credit card transactions and brain tumor classification in magnetic resonance images. The methodology adopts a bimodal approach: for tabular data, hybrid and adaptive resampling techniques such as SMOTE-ENN and ADASYN are employed, combined with high-performance Gradient Boosting models (XGBoost, LightGBM, and CatBoost); for medical images, attention-based architectures are used, including EfficientNet-B0 with CBAM and the Swin Transformer. The effectiveness of the approaches is audited through a stratified cross-validation protocol, grounded in performance metrics suitable for asymmetric distributions, such as F1-Score, AUCROC, and G-Mean. The results demonstrate that incorporating the internal diversity of classes into the training process yields more robust models: in the financial domain, the Gradient Boosting algorithms achieved equivalent performance, with a G-Mean of 0.9245 for CatBoost, while in the oncological diagnosis task the Swin Transformer reached a G-Mean of 0.9773 and an accuracy of 97.74%. We conclude that explicitly addressing intra-class imbalance is decisive for the reliable identification of minority subgroups, reinforcing the robustness and predictive fairness of the systems.pt_BR
dc.description.abstractO desbalanceamento de dados constitui um desafio fundamental no campo do aprendizado de máquina, afetando diretamente a confiabilidade de modelos preditivos em domínios sensíveis como o setor financeiro e a saúde. Embora o desequilíbrio interclasse tenha sido o foco histórico das pesquisas, o fenômeno do desbalanceamento intraclasse — caracterizado pela distribuição desigual de padrões e níveis de dificuldade no interior de uma mesma categoria — apresenta-se como um obstáculo crítico à capacidade de generalização dos algoritmos. Este trabalho explora estratégias de mitigação para ambos os níveis de desbalanceamento, conduzindo uma análise experimental em dois domínios de alta criticidade: a detecção de fraudes em transações de cartão de crédito e a classificação de tumores cerebrais em imagens de ressonância magnética. A metodologia adota uma abordagem bimodal: para os dados tabulares, empregam-se técnicas de reamostragem híbrida e adaptativa, como SMOTE-ENN e ADASYN, combinadas a modelos de Gradient Boosting de alto desempenho (XGBoost, LightGBM e CatBoost); para as imagens médicas, recorre-se a arquiteturas com mecanismos de atenção, incluindo a EfficientNet-B0 com CBAM e o Swin Transformer. A eficácia das abordagens é auditada por meio de um protocolo de validação cruzada estratificada, fundamentado em métricas adequadas a distribuições assimétricas, como F1-Score, AUC-ROC e GMean. Os resultados demonstram que a incorporação da diversidade interna das classes ao processo de treinamento resulta em modelos mais robustos: no domínio financeiro, os algoritmos de Gradient Boosting alcançaram desempenho equivalente, com G-Mean de 0,9245 para o CatBoost, enquanto no diagnóstico oncológico o Swin Transformer atingiu G-Mean de 0,9773 e acurácia de 97,74%. Conclui-se que o tratamento explícito do desbalanceamento intraclasse é determinante para a identificação confiável de subgrupos minoritários, reforçando a robustez e a equidade preditiva dos sistemas.pt_BR
dc.publisherUFMApt_BR
dc.subjectAprendizado de Máquina;pt_BR
dc.subjectMachine Learning;pt_BR
dc.subjectDesbalanceamento Intraclasse;pt_BR
dc.subjectIntra-class Imbalance;pt_BR
dc.subjectDesbalanceamento Interclassept_BR
dc.subjectInter-class Imbalancept_BR
dc.titleEstratégias de Balanceamento de dados em Machine Learning: Uma análise interclasse e intraclassept_BR
dc.title.alternativeData Balancing Strategies in Machine Learning: An Inter-class and Intra-class Analysispt_BR
dc.typeOtherpt_BR
Aparece nas coleções:TCCs de Graduação de Engenharia da Computação do Campus do Bacanga

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
PATRICK MORAES CUTRIM.pdfTCC de Graduação3,22 MBAdobe PDFVisualizar/Abrir


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.