Construção de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvem
| dc.contributor.advisor1 | Guardia, Hélio Crestana | |
| dc.contributor.advisor1Lattes | https://lattes.cnpq.br/1780902767520967 | |
| dc.contributor.advisor1orcid | https://orcid.org/0000-0001-5010-747X | |
| dc.contributor.author | Lucca, Gabriel Costa de | |
| dc.contributor.authorlattes | https://lattes.cnpq.br/1118307905730335 | |
| dc.date.accessioned | 2026-07-07T18:09:04Z | |
| dc.date.issued | 2026-06-25 | |
| dc.description.abstract | Comparing virtual machine costs across multi-cloud environments is a complex task due to the heterogeneity of catalogs, naming conventions, pricing models, and APIs provided by different vendors. This fragmentation makes it difficult to identify technically equivalent instances and to objectively evaluate the cost-benefit ratio among offerings from Amazon Web Services, Microsoft Azure, and Google Cloud Platform, for instance. This paper presents an architecture for collecting, normalizing, and analyzing virtual machine instance prices, combining data engineering and machine learning to support cloud resource comparison and selection decisions. The developed solution features a multi-cloud ETL pipeline capable of extracting public pricing and technical specification data, transforming heterogeneous structures into a common schema, and consolidating them into a unified relational database. The final dataset comprised 34,000 records of On-Demand and Spot instances, with approximately half of these used in the modeling experiments. Two complementary approaches were evaluated using this subset. The first employs clustering techniques to identify similar technical profiles among instances. The second uses regression models to estimate the hourly price of virtual machines. In the clustering phase, K-Means and Gaussian Mixture Model algorithms were compared, with K-Means selected for its superior grouping quality. In the regression phase, Linear Regression, Random Forest, and XGBoost models were evaluated, with XGBoost showing the best marginal performance. Based on the estimates produced by the selected regression model, a cost-benefit indicator was defined, relating an instance's observed price to the price predicted for its configuration. This indicator allows for the assessment of whether an instance is priced potentially below, near, or above the pricing standard learned from the catalog, complementing analyses based solely on absolute price. The integration of clustering, regression, and the cost-benefit indicator was demonstrated through conceptual scenarios focused on analyzing price alignment and identifying equivalent alternatives across providers. Catalog standardization, combined with the clustering of technical profiles and predictive price modeling, proved capable of supporting comparative analyses in multi-cloud environments. | eng |
| dc.description.resumo | A comparação de custos entre máquinas virtuais em ambientes multi-cloud é uma tarefa complexa devido à heterogeneidade dos catálogos, das nomenclaturas, dos modelos de precificação e das APIs disponibilizadas pelos provedores. Essa fragmentação dificulta a identificação de instâncias tecnicamente equivalentes e a avaliação objetiva do custobenefício entre ofertas de Amazon Web Service, Microsoft Azure e Google Cloud Platform, por exemplo. Este trabalho apresenta uma arquitetura para coleta, normalização e análise de preços de instâncias de máquinas virtuais, combinando engenharia de dados e aprendizado de máquina para apoiar decisões de comparação e seleção de recursos em nuvem. A solução desenvolvida contempla um pipeline ETL multi-cloud capaz de extrair dados públicos de precificação e especificações técnicas, transformar estruturas heterogêneas em um esquema comum e consolidá-las em uma base relacional unificada. A base final reuniu 34 mil registros de instâncias On-Demand e Spot, sendo aproximadamente metade dessas instâncias utilizadas nos experimentos de modelagem. Sobre esse subconjunto foram avaliadas duas abordagens complementares. A primeira utiliza técnicas de clusterização para identificar perfis técnicos semelhantes entre instâncias. A segunda emprega modelos de regressão para estimar o preço por hora das máquinas virtuais. Na etapa de clusterização foram comparados os algoritmos K-Means e Gaussian Mixture Model, sendo o K-Means selecionado por apresentar melhor qualidade de agrupamento. Na etapa de regressão foram avaliados os modelos de Regressão Linear, Random Forest e XGBoost, com melhor desempenho marginal para o XGBoost. A partir das estimativas produzidas pelo modelo de regressão selecionado foi definido o indicador de custo-benefício, que relaciona o preço observado de uma instância ao preço previsto para sua configuração. Esse indicador permite avaliar se uma instância se encontra potencialmente abaixo, próxima ou acima do padrão de preço aprendido a partir do catálogo, complementando análises baseadas apenas no preço absoluto. A integração entre clusterização, regressão e o custo-benefício foi demonstrada em cenários conceituais voltados à análise de aderência de preços e à busca de alternativas equivalentes entre provedores. A padronização dos catálogos, associada à clusterização de perfis técnicos e à modelagem preditiva de preços, mostrou-se capaz de apoiar análises comparativas em ambientes multi-cloud. | por |
| dc.description.sponsorship | Não recebi financiamento | |
| dc.identifier.citation | LUCCA, Gabriel Costa de. Construção de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvem. 2026. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de São Carlos, Campus São Carlos, 2026. Disponível em: https://repositorio.ufscar.br/handle/20.500.14289/24317. | * |
| dc.identifier.uri | https://hdl.handle.net/20.500.14289/24317 | |
| dc.language.iso | por | |
| dc.publisher | Universidade Federal de São Carlos | |
| dc.publisher.address | Campus São Carlos | |
| dc.publisher.center | Centro de Ciências Exatas e de Tecnologia - CCET | |
| dc.publisher.course | Engenharia de Computação - EC | |
| dc.publisher.initials | UFSCar | |
| dc.rights.uri | https://creativecommons.org/licenses/by-nc-sa/4.0/ | |
| dc.subject | computação em nuvem | por |
| dc.subject | multi-cloud | eng |
| dc.subject | ETL | por |
| dc.subject | aprendizado de máquina | por |
| dc.subject | FinOps. | eng |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO | |
| dc.subject.ods | 9. Indústria, Inovação e Infraestrutura | |
| dc.title | Construção de uma base de dados multi-cloud e aplicação de aprendizado de máquina para análise comparativa de recursos de computação em nuvem | por |
| dc.title.alternative | Construction of a multi-cloud database and application of machine learning for comparative analysis of cloud computing resources | eng |
| dc.type | TCC |
Arquivos
Pacote Original
1 - 1 de 1
Carregando...
- Nome:
- TCC_Gabriel_Costa_de_Lucca.pdf
- Tamanho:
- 1.96 MB
- Formato:
- Adobe Portable Document Format