O RI UFSCar ficará fora do ar no dia 29 de setembro para manutenção. Agradecemos a compreensão!

Reconhecimento de expressões faciais usando deep learning: uma análise comparativa sistemática em cenários de mundo real

dc.contributor.advisor1Levada, Alexandre Luis Magalhães
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/3341441596395463
dc.contributor.authorPacini, João Victor
dc.date.accessioned2026-09-21T16:51:01Z
dc.date.issued2026-09-04
dc.description.abstractThis work presents a systematic investigation into the performance and robustness of deep learning architectures applied to Facial Expression Recognition (FER) in real-world scenarios. The central motivation lies in the importance of emotion recognition as a fundamental component of human-computer interaction, with applications ranging from telehealth to social robotics, focusing on performance in real-world scenarios. The main objective is to analyze the impact of the domain shift phenomenon on the transition from controlled laboratory data to dynamic real-world environments, as well as to mitigate the effects of occlusions and class imbalance. To this end, a comparative evaluation of spatial feature extraction models was conducted, including the ResNet50V2, EfficientNetB0, and ConvNeXt Tiny networks, as well as a temporal hybrid model composed of a ConvNeXt architecture integrated with an LSTM recurrent network equipped with attention mechanisms. Spatial modeling experiments revealed the superiority of the ConvNeXt Tiny model pre-trained with large datasets, which achieved an overall accuracy of 87.16% on the RAF-DB dataset, highlighting the crucial role of the statistical normalization step and sequential pre-training. In contrast, cross-validation tests revealed a drastic 53% drop in model performance when exposed to domain transfer between RAF-DB and CK+ (with accuracy declining to 34.05%), highlighting the conceptual fragility in the face of variations in poses and occlusions. In temporal experiments with the CK+ dataset, the hybrid architecture demonstrated high performance under strict subject-independent validation, reaching 95.14% overall accuracy when tracking facial muscle dynamics to the peak of expression. Additionally, ablation studies focused on class imbalance indicated that simple weighting methods in the loss function (Class Weights) outperformed synthetic interpolation strategies in latent space (SMOTE) and pixel space (MixUp), preventing overfitting and preserving subtle facial distortions. It is concluded that, although modern deep architectures exhibit high hierarchical representation capabilities, practical generalization is still severely limited by domain shift, highlighting the future relevance of domain adaptation and explainability techniques.eng
dc.description.resumoEste trabalho apresenta uma investigação sistemática sobre o desempenho e a robustez de arquiteturas de aprendizado profundo (Deep Learning) aplicadas ao Reconhecimento de Expressões Faciais (FER) em cenários reais (in-the-wild). A motivação central reside na importância do reconhecimento de emoções como peça fundamental para a interação humano-computador, com aplicações que abrangem desde telessaúde até robótica social, focando na performance em cenários do mundo real. O objetivo principal consiste em analisar o impacto do fenômeno de deslocamento de domínio (domain shift) na transição de dados controlados de laboratório para ambientes dinâmicos do mundo real, bem como mitigar os efeitos de oclusões e desbalanceamento de classes. Para tanto, conduziu-se uma avaliação comparativa de modelos espaciais de extração de características, contemplando as redes ResNet50V2, EfficientNetB0 e ConvNeXt Tiny, além de um modelo híbrido temporal composto por uma arquitetura ConvNeXt integrada a uma rede recorrente LSTM equipada com mecanismos de atenção. Os experimentos de modelagem espacial revelaram a superioridade do modelo ConvNeXt Tiny pré-treinado com conjuntos de dados amplos, que alcançou acurácia global de 87,16% na base RAF-DB, evidenciando o papel crucial da etapa de normalização estatística e do pré-treinamento sequencial. Em contrapartida, testes de validação cruzada revelaram uma queda drástica de 53% na performance do modelo ao ser exposto à transferência de domínio entre RAF-DB e CK+ (com acurácia declinando para 34,05%), ressaltando a fragilidade conceitual diante de variações de poses e oclusões. Nos experimentos temporais com a base CK+, a arquitetura híbrida demonstrou alto desempenho sob validação estrita sujeito-independente, atingindo 95,14% de acurácia global ao rastrear a dinâmica muscular facial até o ápice da expressão. Adicionalmente, estudos de ablação voltados ao desequilíbrio de classes indicaram que métodos simples de balanceamento por peso na função de perda (Class Weights) superaram estratégias de interpolação sintética no espaço latente (SMOTE) e de pixel (MixUp), prevenindo o sobreajuste e conservando deformações faciais sutis. Conclui-se que, embora as arquiteturas profundas modernas apresentem alta capacidade de representação hierárquica, a generalização prática ainda é severamente limitada pelo domain shift, apontando para a relevância futura de técnicas de adaptação de domínio e explicabilidade.por
dc.description.sponsorshipNão recebi financiamento
dc.identifier.urihttps://hdl.handle.net/20.500.14289/24729
dc.language.isopor
dc.publisherUniversidade Federal de São Carlos
dc.publisher.addressCampus São Carlos
dc.publisher.centerCentro de Ciências Exatas e de Tecnologia - CCET
dc.publisher.courseEngenharia de Computação - EC
dc.publisher.initialsUFSCar
dc.rights.urihttps://creativecommons.org/licenses/by-nc-sa/4.0/
dc.subjectReconhecimento de expressões faciaispor
dc.subjectAprendizado profundopor
dc.subjectDeslocamento de domíniopor
dc.subjectRedes neurais convolucionaispor
dc.subjectMecanismos de atençãopor
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO
dc.subject.ods9. Indústria, Inovação e Infraestrutura
dc.titleReconhecimento de expressões faciais usando deep learning: uma análise comparativa sistemática em cenários de mundo realpor
dc.title.alternativeFacial expression recognition using deep learning: a systematic comparative analysis in real-world scenarioseng
dc.typeTCC

Arquivos

Pacote Original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
tcc_corrigido.pdf
Tamanho:
7.07 MB
Formato:
Adobe Portable Document Format

Coleções