Construção de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvem

dc.contributor.advisor1Guardia, Hélio Crestana
dc.contributor.advisor1Latteshttps://lattes.cnpq.br/1780902767520967
dc.contributor.advisor1orcidhttps://orcid.org/0000-0001-5010-747X
dc.contributor.authorLucca, Gabriel Costa de
dc.contributor.authorlatteshttps://lattes.cnpq.br/1118307905730335
dc.date.accessioned2026-07-07T18:09:04Z
dc.date.issued2026-06-25
dc.description.abstractComparing virtual machine costs across multi-cloud environments is a complex task due to the heterogeneity of catalogs, naming conventions, pricing models, and APIs provided by different vendors. This fragmentation makes it difficult to identify technically equivalent instances and to objectively evaluate the cost-benefit ratio among offerings from Amazon Web Services, Microsoft Azure, and Google Cloud Platform, for instance. This paper presents an architecture for collecting, normalizing, and analyzing virtual machine instance prices, combining data engineering and machine learning to support cloud resource comparison and selection decisions. The developed solution features a multi-cloud ETL pipeline capable of extracting public pricing and technical specification data, transforming heterogeneous structures into a common schema, and consolidating them into a unified relational database. The final dataset comprised 34,000 records of On-Demand and Spot instances, with approximately half of these used in the modeling experiments. Two complementary approaches were evaluated using this subset. The first employs clustering techniques to identify similar technical profiles among instances. The second uses regression models to estimate the hourly price of virtual machines. In the clustering phase, K-Means and Gaussian Mixture Model algorithms were compared, with K-Means selected for its superior grouping quality. In the regression phase, Linear Regression, Random Forest, and XGBoost models were evaluated, with XGBoost showing the best marginal performance. Based on the estimates produced by the selected regression model, a cost-benefit indicator was defined, relating an instance's observed price to the price predicted for its configuration. This indicator allows for the assessment of whether an instance is priced potentially below, near, or above the pricing standard learned from the catalog, complementing analyses based solely on absolute price. The integration of clustering, regression, and the cost-benefit indicator was demonstrated through conceptual scenarios focused on analyzing price alignment and identifying equivalent alternatives across providers. Catalog standardization, combined with the clustering of technical profiles and predictive price modeling, proved capable of supporting comparative analyses in multi-cloud environments.eng
dc.description.resumoA comparação de custos entre máquinas virtuais em ambientes multi-cloud é uma tarefa complexa devido à heterogeneidade dos catálogos, das nomenclaturas, dos modelos de precificação e das APIs disponibilizadas pelos provedores. Essa fragmentação dificulta a identificação de instâncias tecnicamente equivalentes e a avaliação objetiva do custobenefício entre ofertas de Amazon Web Service, Microsoft Azure e Google Cloud Platform, por exemplo. Este trabalho apresenta uma arquitetura para coleta, normalização e análise de preços de instâncias de máquinas virtuais, combinando engenharia de dados e aprendizado de máquina para apoiar decisões de comparação e seleção de recursos em nuvem. A solução desenvolvida contempla um pipeline ETL multi-cloud capaz de extrair dados públicos de precificação e especificações técnicas, transformar estruturas heterogêneas em um esquema comum e consolidá-las em uma base relacional unificada. A base final reuniu 34 mil registros de instâncias On-Demand e Spot, sendo aproximadamente metade dessas instâncias utilizadas nos experimentos de modelagem. Sobre esse subconjunto foram avaliadas duas abordagens complementares. A primeira utiliza técnicas de clusterização para identificar perfis técnicos semelhantes entre instâncias. A segunda emprega modelos de regressão para estimar o preço por hora das máquinas virtuais. Na etapa de clusterização foram comparados os algoritmos K-Means e Gaussian Mixture Model, sendo o K-Means selecionado por apresentar melhor qualidade de agrupamento. Na etapa de regressão foram avaliados os modelos de Regressão Linear, Random Forest e XGBoost, com melhor desempenho marginal para o XGBoost. A partir das estimativas produzidas pelo modelo de regressão selecionado foi definido o indicador de custo-benefício, que relaciona o preço observado de uma instância ao preço previsto para sua configuração. Esse indicador permite avaliar se uma instância se encontra potencialmente abaixo, próxima ou acima do padrão de preço aprendido a partir do catálogo, complementando análises baseadas apenas no preço absoluto. A integração entre clusterização, regressão e o custo-benefício foi demonstrada em cenários conceituais voltados à análise de aderência de preços e à busca de alternativas equivalentes entre provedores. A padronização dos catálogos, associada à clusterização de perfis técnicos e à modelagem preditiva de preços, mostrou-se capaz de apoiar análises comparativas em ambientes multi-cloud.por
dc.description.sponsorshipNão recebi financiamento
dc.identifier.citationLUCCA, Gabriel Costa de. Construção de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvem. 2026. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de São Carlos, Campus São Carlos, 2026. Disponível em: https://repositorio.ufscar.br/handle/20.500.14289/24317.*
dc.identifier.urihttps://hdl.handle.net/20.500.14289/24317
dc.language.isopor
dc.publisherUniversidade Federal de São Carlos
dc.publisher.addressCampus São Carlos
dc.publisher.centerCentro de Ciências Exatas e de Tecnologia - CCET
dc.publisher.courseEngenharia de Computação - EC
dc.publisher.initialsUFSCar
dc.rights.urihttps://creativecommons.org/licenses/by-nc-sa/4.0/
dc.subjectcomputação em nuvempor
dc.subjectmulti-cloudeng
dc.subjectETLpor
dc.subjectaprendizado de máquinapor
dc.subjectFinOps.eng
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO
dc.subject.ods9. Indústria, Inovação e Infraestrutura
dc.titleConstrução de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvempor
dc.title.alternativeConstruction of a multi-cloud database and application of machine learning for comparative analysis of cloud computing resourceseng
dc.typeTCC

Arquivos

Pacote Original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
TCC_Gabriel_Costa_de_Lucca.pdf
Tamanho:
1.96 MB
Formato:
Adobe Portable Document Format

Coleções