Estudo comparativo de métodos de embeddings de grafo para tarefa de agrupamento com foco na análise de robustez ao ruído

dc.contributor.advisor1Valejo, Alan Demétrius Baria
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/9546164790189830
dc.contributor.authorUeno, Igor Kenji Kawai
dc.date.accessioned2026-07-29T20:02:13Z
dc.date.issued2026-07-08
dc.description.abstractThe production of information is currently at its highest level in history, growing year after year with no signs of slowing down in the near future. This massive volume of data originates from a wide variety of sources and formats, ranging from sensor readings collected by Internet of Things (IoT) devices, such as smartwatches, to video sharing on social media platforms. Together, these data constitute the massive body of information and the field of study known as Big Data, which can be characterized by the 5 Vs: volume, velocity, variety, veracity, and value, summarizing the richness of this virtually unlimited source of data. However, not only has data production increased, but the quality and complexity of these data have also evolved, with tables, images, and networks becoming increasingly larger and more detailed. Although these data hold great potential, allowing valuable information and insights to be extracted, their raw form is not suitable for direct use by most Machine Learning algorithms. Therefore, preprocessing is required to refine the data, thereby improving the performance of these models. Among the tasks in this field, clustering aims to identify patterns in data in order to partition them into groups based on their similarity, without relying on external labels that define such a partition. When considered in the context of graphs, clustering can be translated into the task of community detection, in which, besides the possible features associated with the nodes, the connections between them are also taken into account. Another approach to this problem is graph embedding, which transforms graph nodes into numerical vectors in a latent space while preserving notions of proximity from the original space. As a result, clustering and community detection become equivalent tasks. The embedding process can be applied to different types of data and various data components in order to provide a unified vector representation. With this in mind, the objective of this work is to evaluate the performance of different graph embedding and clustering models on a collection of graphs for the task of grouping nodes, with community detection serving as the analogous problem in the graph domain. In addition, robustness analyses were conducted to evaluate the resilience of these models to the presence of noise in graphs, since real-world data frequently contain noisy information that may remain untreated and negatively affect the quality of downstream tasks. The experimental results demonstrate that each graph scenario and combination of embedding and clustering models exhibits distinct behaviors and performance characteristics, requiring different hyperparameter configurations and presenting different levels of robustness to noise. Although promising results were obtained in some cases, the practical viability of this approach requires further investigation before it can be conclusively confirmed or ruled out.eng
dc.description.resumoAtualmente, a produção de informação é a maior da história, crescendo ano após ano, sem mostrar sinais de que irá desacelerar em um futuro próximo. Esse grande volume de dados apresenta diversas origens e formatos, desde a leitura de sensores de dispositivos de IoT, como smartwatches, até o compartilhamento de vídeos em redes sociais. Tudo isso compõe o conjunto massivo de dados e a área de estudo conhecida como Big Data, que pode ser descrita por meio dos 5 Vs: volume, velocidade, variedade, veracidade e valor, os quais resumem a riqueza dessa fonte quase ilimitada de dados. Mas não apenas sua produção foi amplificada; a qualidade e a complexidade desses dados também foram afetadas, com tabelas, imagens e redes cada vez maiores e mais detalhadas. Embora possuam alto potencial, sendo possível extrair informações e valor desses dados, sua forma bruta não é adequada para ser utilizada diretamente pela maioria dos algoritmos de Aprendizado de Máquina. É necessário um pré-processamento para refiná-los, otimizando assim seu desempenho. Dentre as tarefas dessa área, o agrupamento busca identificar padrões nos dados a fim de separá-los em grupos com base em sua similaridade; isso é feito sem a presença de um rótulo externo que ditaria essa distribuição. Quando considerado no contexto de grafos, o agrupamento pode ser traduzido para a tarefa de detecção de comunidades, na qual, além das possíveis features dos nós, também são consideradas as conexões entre eles. Outra maneira de abordar esse problema pode ser encontrada na aplicação do embedding de grafos, que transforma os nós em vetores numéricos em um espaço latente preservando noções de proximidade do espaço original; assim, ambas as tarefas (agrupamento e detecção de comunidades) tornam-se equivalentes. O processo de embedding pode ser aplicado sobre diversos tipos de dados e diferentes componentes a fim de unificar sua representação. Tendo isso em mente, este trabalho tem como objetivo utilizar diferentes modelos de embedding e de agrupamento sobre um conjunto de grafos, a fim de avaliar seus desempenhos na formação de grupos de nós, sendo a detecção de comunidades análoga a este caso. Além disso, foram realizados testes de robustez desses modelos em relação à presença de ruídos nos grafos, tendo em vista que dados reais frequentemente apresentam informações ruidosas que podem acabar não sendo tratadas e afetar a qualidade das tarefas realizadas sobre eles. Ao final do trabalho, foi possível observar que cada cenário de grafo e combinação de modelos apresenta resultados e comportamentos particulares, com diferentes hiperparâmetros a serem definidos e diferentes níveis de robustez ao ruído. Embora haja resultados promissores em alguns casos, a viabilidade dessa abordagem exige um estudo mais aprofundado para ser confirmada ou descartada.por
dc.description.sponsorshipNão recebi financiamento
dc.identifier.citationUENO, Igor Kenji Kawai. Estudo comparativo de métodos de embeddings de grafo para tarefa de agrupamento com foco na análise de robustez ao ruído. 2026. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de São Carlos, Campus São Carlos, 2026. Disponível em: https://repositorio.ufscar.br/handle/20.500.14289/24430.*
dc.identifier.urihttps://hdl.handle.net/20.500.14289/24430
dc.language.isopor
dc.publisherUniversidade Federal de São Carlos
dc.publisher.addressCampus São Carlos
dc.publisher.centerCentro de Ciências Exatas e de Tecnologia - CCET
dc.publisher.courseEngenharia de Computação - EC
dc.publisher.initialsUFSCar
dc.rights.urihttps://creativecommons.org/licenses/by-nc-nd/4.0/
dc.subjectAprendizado de máquinapor
dc.subjectAgrupamentopor
dc.subjectGrafopor
dc.subjectDetecção de comunidadespor
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::SISTEMAS DE COMPUTACAO
dc.subject.ods9. Indústria, Inovação e Infraestrutura
dc.titleEstudo comparativo de métodos de embeddings de grafo para tarefa de agrupamento com foco na análise de robustez ao ruídopor
dc.title.alternativeComparative study of graph embedding methods for the clustering task, focusing on robustness to noiseeng
dc.typeTCC

Arquivos

Pacote Original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
tcc-igor.pdf
Tamanho:
5.56 MB
Formato:
Adobe Portable Document Format

Coleções