Heimdall: an architecture for online machine learning through imbalanced data

Orientador(a) (dc.contributor.advisor)Barbosa, Jorge Luis Victória
Coorientador(a) (dc.contributor.advisor-co1)Pereira, Paulo Ricardo da Silva
Lattes Coorientador(a) (dc.contributor.advisor-co1Lattes)http://lattes.cnpq.br/1997755245309923pt_BR
Lattes Orientador(a) (dc.contributor.advisorLattes)http://lattes.cnpq.br/6754464380129137pt_BR
Autor(a) (dc.contributor.author)Vargas, Vitor Werner de
Autor(a) Lattes (dc.contributor.authorLattes)http://lattes.cnpq.br/4358876704972743pt_BR
Data de Disponibilização (dc.date.accessioned)2025-10-29T17:37:32Z
dc.date.available (dc.date.available)2025-10-29T17:37:32Z
Data da defesa / Data do evento (dc.date.issued)2023-09-26
Abstract (dc.description.abstract)Machine Learning (ML) algorithms have been increasingly applied to domain areas where data is available for process automation. However, in the case of imbalanced data applications, the training process is challenging since ML algorithms intrinsically learn from balanced distributions. This research proposes Heimdall, a resourceful architecture for online ML through imbalanced data. Designed as a service for prediction and analysis requests, Heimdall serves existing applications from external systems, extending artificial intelligence capabilities and automated processes to traditional applications supervised by experts. The architecture focuses on efficiently solving imbalance and improving performance through a set of good practices compiled from mapped studies – such as probability threshold optimization, high-performance sampling, and ensemble learning. Furthermore, Heimdall proposes and evaluates the efficiency of novel functionalities. Firstly, a new performance metric corrects precision-recall balance according to the application’s needs, enhancing probability threshold optimization. Secondly, the architecture independently automates data management and training pipelines through two rule-based reactive agents constantly monitoring data changes and model degradation to trigger processes. These reactive agents compose a strategy for adaptive efficiency, enabling better and more stable performance by sacrificing efficiency in warm-up conditions, and maintaining excellent performance and efficiency in hot conditions. To adequately evaluate the architecture, this study implemented a prototype for one well-studied and severely imbalanced application – Credit Card Fraud Detection (CCFD). Isolating the improvement of each proposed functionality, the analysis evaluated performance over time and overall performance against related works through five scenarios. Namely, the results indicated that the prototype achieved excellent performance even with few anomalies, and improved systemic efficiency over time. Finally, the overall performance achieved comparable results to the best-performing related works.en
Resumo (dc.description.resumo)Algoritmos de aprendizado de máquina têm sido crescentemente utilizado em áreas de aplicação que possuem dados disponíveis para automação de processos. No entanto, no caso de aplicações com dados desbalanceados, o processo de treinamento é desafiador, visto que algoritmos de aprendizado de máquina são desenvolvidos para aprender, intrinsicamente, de distribuições balanceadas. Esta pesquisa propõe Heimdall, uma arquitetura com diversos recursos para aprendizagem de máquina ativa através de dados desbalanceados. Projetado como um serviço para atendimento de requisições de previsões e análises, Heimdall serve aplicações existentes de sistemas externos, estendendo recursos de inteligência artificial e automatização de processos a aplicações tradicionais supervisionadas por especialistas. A arquitetura soluciona o desbalanceamento através de uma série de boas práticas compiladas em mapeamentos de trabalhos relacionados – como otimização do limiar de probabilidade, amostragem de alto desempenho e aprendizado em conjunto. Adicionalmente, Heimdall propõe e avalia a eficiência de funcionalidades inovadoras. Primeiramente, uma nova métrica de performance corrige o equilíbrio entre precision-recall de acordo com as necessidades da aplicação, aprimorando a otimização do limiar de probabilidade. Segundamente, a arquitetura automatiza processos de gerenciamento de dados e aprendizado de máquina, de forma independente, através de dois agentes reativos baseados em regras, os quais monitoram constantemente as mudanças de dados e degradação de performance do modelo para acionar processos. Esses agentes reativos compõem uma estratégia para eficiência adaptativa, habilitando uma performance melhor e mais estável ao sacrificar eficiência em condições iniciais de implantação, e mantendo excelentes performance e eficiência em condições normais da aplicação. Para avaliar a arquitetura de forma adequada, o presente estudo implementou um protótipo para uma aplicação conhecida contendo dados severamente desbalanceados – detecção de fraudes em cartões de crédito. Isolando a melhoria de cada funcionalidade proposta, a análise avaliou a performance no decorrer do tempo e performance global versus trabalhos relacionados através de cinco cenários. Especificamente, os resultados indicam que o protótipo alcançou performance excelente mesmo com poucas anomalias e melhorou a eficiência sistêmica no decorrer do tempo. Por fim, a performance global obteve resultados similares aos melhores resultados em trabalhos relacionados.pt_BR
Agência de fomento (dc.description.sponsorship)CAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superiorpt_BR
URI (dc.identifier.uri)http://repositorio.jesuita.org.br/handle/UNISINOS/13844
Idioma (dc.language)pt_BRpt_BR
Nome da instituição (dc.publisher)Universidade do Vale do Rio dos Sinospt_BR
País da Instituição (dc.publisher.country)Brasilpt_BR
Departamento (dc.publisher.department)Escola Politécnicapt_BR
Sigla da Instituição (dc.publisher.initials)Unisinospt_BR
Programa (dc.publisher.program)Programa de Pós-Graduação em Computação Aplicadapt_BR
Direitos de acesso ao documento (dc.rights)openAccesspt_BR
Assunto (dc.subject)Dados desbalanceadospt_BR
Assunto (dc.subject)Pré-processamentopt_BR
Assunto (dc.subject)Amostragempt_BR
Assunto (dc.subject)Aprendizado de máquinapt_BR
Assunto (dc.subject)Arquitetura de softwarept_BR
Assunto (dc.subject)Agentes reativospt_BR
Assunto (dc.subject)Imbalanced dataen
Assunto (dc.subject)Preprocessingen
Assunto (dc.subject)Samplingen
Assunto (dc.subject)Machine learningen
Assunto (dc.subject)Software architectureen
Assunto (dc.subject)Reactive agentsen
Tema (CNPq) (dc.subject.cnpq)ACCNPQ::Ciências Exatas e da Terra::Ciência da Computaçãopt_BR
Título (dc.title)Heimdall: an architecture for online machine learning through imbalanced datapt_BR
Tipo de arquivo (dc.type)Dissertaçãopt_BR

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Vitor Werner de Vargas_PROTEGIDO.pdf
Tamanho:
4.53 MB
Formato:
Adobe Portable Document Format
Descrição:
Heimdall_architecture

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
2.12 KB
Formato:
Item-specific license agreed upon to submission
Descrição: