Use este identificador para citar ou linkar para este item:
http://hdl.handle.net/123456789/10995Registro completo de metadados
| Campo DC | Valor | Idioma |
|---|---|---|
| dc.contributor.author | CUTRIM, Patrick Moraes | - |
| dc.date.accessioned | 2026-09-03T12:37:37Z | - |
| dc.date.available | 2026-09-03T12:37:37Z | - |
| dc.date.issued | 2026-07-20 | - |
| dc.identifier.uri | http://hdl.handle.net/123456789/10995 | - |
| dc.description | Data imbalance constitutes a fundamental challenge in machine learning, directly affecting the reliability of predictive models in sensitive domains such as the financial sector and healthcare. Although inter-class imbalance has historically been the focus of research, the phenomenon of intra-class imbalance — characterized by the uneven distribution of patterns and difficulty levels within the same category — poses a critical obstacle to the generalization capacity of algorithms. This work explores mitigation strategies for both levels of imbalance, conducting an experimental analysis in two high-criticality domains: fraud detection in credit card transactions and brain tumor classification in magnetic resonance images. The methodology adopts a bimodal approach: for tabular data, hybrid and adaptive resampling techniques such as SMOTE-ENN and ADASYN are employed, combined with high-performance Gradient Boosting models (XGBoost, LightGBM, and CatBoost); for medical images, attention-based architectures are used, including EfficientNet-B0 with CBAM and the Swin Transformer. The effectiveness of the approaches is audited through a stratified cross-validation protocol, grounded in performance metrics suitable for asymmetric distributions, such as F1-Score, AUCROC, and G-Mean. The results demonstrate that incorporating the internal diversity of classes into the training process yields more robust models: in the financial domain, the Gradient Boosting algorithms achieved equivalent performance, with a G-Mean of 0.9245 for CatBoost, while in the oncological diagnosis task the Swin Transformer reached a G-Mean of 0.9773 and an accuracy of 97.74%. We conclude that explicitly addressing intra-class imbalance is decisive for the reliable identification of minority subgroups, reinforcing the robustness and predictive fairness of the systems. | pt_BR |
| dc.description.abstract | O desbalanceamento de dados constitui um desafio fundamental no campo do aprendizado de máquina, afetando diretamente a confiabilidade de modelos preditivos em domínios sensíveis como o setor financeiro e a saúde. Embora o desequilíbrio interclasse tenha sido o foco histórico das pesquisas, o fenômeno do desbalanceamento intraclasse — caracterizado pela distribuição desigual de padrões e níveis de dificuldade no interior de uma mesma categoria — apresenta-se como um obstáculo crítico à capacidade de generalização dos algoritmos. Este trabalho explora estratégias de mitigação para ambos os níveis de desbalanceamento, conduzindo uma análise experimental em dois domínios de alta criticidade: a detecção de fraudes em transações de cartão de crédito e a classificação de tumores cerebrais em imagens de ressonância magnética. A metodologia adota uma abordagem bimodal: para os dados tabulares, empregam-se técnicas de reamostragem híbrida e adaptativa, como SMOTE-ENN e ADASYN, combinadas a modelos de Gradient Boosting de alto desempenho (XGBoost, LightGBM e CatBoost); para as imagens médicas, recorre-se a arquiteturas com mecanismos de atenção, incluindo a EfficientNet-B0 com CBAM e o Swin Transformer. A eficácia das abordagens é auditada por meio de um protocolo de validação cruzada estratificada, fundamentado em métricas adequadas a distribuições assimétricas, como F1-Score, AUC-ROC e GMean. Os resultados demonstram que a incorporação da diversidade interna das classes ao processo de treinamento resulta em modelos mais robustos: no domínio financeiro, os algoritmos de Gradient Boosting alcançaram desempenho equivalente, com G-Mean de 0,9245 para o CatBoost, enquanto no diagnóstico oncológico o Swin Transformer atingiu G-Mean de 0,9773 e acurácia de 97,74%. Conclui-se que o tratamento explícito do desbalanceamento intraclasse é determinante para a identificação confiável de subgrupos minoritários, reforçando a robustez e a equidade preditiva dos sistemas. | pt_BR |
| dc.publisher | UFMA | pt_BR |
| dc.subject | Aprendizado de Máquina; | pt_BR |
| dc.subject | Machine Learning; | pt_BR |
| dc.subject | Desbalanceamento Intraclasse; | pt_BR |
| dc.subject | Intra-class Imbalance; | pt_BR |
| dc.subject | Desbalanceamento Interclasse | pt_BR |
| dc.subject | Inter-class Imbalance | pt_BR |
| dc.title | Estratégias de Balanceamento de dados em Machine Learning: Uma análise interclasse e intraclasse | pt_BR |
| dc.title.alternative | Data Balancing Strategies in Machine Learning: An Inter-class and Intra-class Analysis | pt_BR |
| dc.type | Other | pt_BR |
| Aparece nas coleções: | TCCs de Graduação de Engenharia da Computação do Campus do Bacanga | |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| PATRICK MORAES CUTRIM.pdf | TCC de Graduação | 3,22 MB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.