Geração e avaliação de dados sintéticos para aplicações em saúde mental
| dc.contributor.advisor1 | Caseli, Helena de Medeiros | |
| dc.contributor.advisor1Lattes | https://lattes.cnpq.br/6608582057810385 | |
| dc.contributor.advisor1orcid | https://orcid.org/0000-0003-3996-8599 | |
| dc.contributor.author | Figueiredo, Vitória Rodrigues Pinto Borelli | |
| dc.contributor.authorlattes | https://lattes.cnpq.br/7999155514405484 | |
| dc.date.accessioned | 2026-07-13T14:12:19Z | |
| dc.date.issued | 2026-06-25 | |
| dc.description.abstract | Annotated corpora in the mental health domain are scarce and frequently cannot be publicly redistributed due to ethical and legal restrictions associated with the sensitivity of the data involved, which limits the reproducibility of experiments and collaborative progress in the field. This work proposes and evaluates a synthetic data generation pipeline for the Amive corpus, composed of anonymous social media posts annotated with depression symptoms, aiming to enable the public distribution of a functional corpus without exposing the original texts of the users who produced them. The pipeline combines machine translation via a language model (Portuguese to English and back-translation to Portuguese), paraphrase generation with the PEGASUS model through diverse beam search, and selection of the best candidate paraphrase based on semantic similarity computed by BERTScore, using BERTimbau as the representation model. The evaluation of the generated synthetic corpus, focused on the Sadness/Depressed Mood symptom, is conducted along two complementary lines: an extrinsic evaluation, in which binary classifiers of different natures (Logistic Regression, SVM, Naive Bayes, and Random Forest) are trained and tested across four scenarios combining original and synthetic data; and an intrinsic evaluation, based on lexical diversity metrics and the part-of-speech distribution of the generated corpus, complemented by a qualitative analysis of representative examples. Results indicate that the synthetic corpus largely preserves the utility of the original corpus for the classification task, with particular emphasis on recall, a metric considered more critical in mental health screening applications, where failing to identify a positive case tends to be more costly than a false alarm. However, a more consistent drop in precision is observed for classifiers trained exclusively on synthetic data when evaluated on real data, along with evidence that part of the lexical diversity introduced stems from a tendency of the pipeline to prune content in syntactically complex sentences, rather than from genuine reformulation alone. The qualitative analysis further reveals recurring patterns of discursive nuance loss, such as the depersonalization of autobiographical accounts and the literalization of metaphorical constructions. It is concluded that the proposed pipeline constitutes a viable, though not limitation-free, mechanism for generating synthetic corpora in Portuguese within the mental health domain, offering a concrete alternative to the unavailability of annotated data in this field. | eng |
| dc.description.resumo | Corpora anotados na área de saúde mental são escassos e frequentemente não podem ser redistribuídos publicamente devido a restrições éticas e legais associadas à sensibilidade dos dados, o que limita a reprodutibilidade de experimentos e o avanço colaborativo da área. Este trabalho propõe e avalia um pipeline de geração de dados sintéticos para o corpus Amive, composto por postagens anônimas de redes sociais anotadas com sintomas de depressão, com o objetivo de viabilizar a distribuição pública de um corpus funcional sem expor os textos originais dos usuários que os produziram. O pipeline combina tradução automática via modelo de linguagem (português para inglês e retradução ao português), geração de paráfrases com o modelo PEGASUS por meio de diverse beam search, e seleção da melhor paráfrase candidata com base na similaridade semântica calculada pelo BERTScore, utilizando o BERTimbau como modelo de representação. A avaliação do corpus sintético gerado, com foco no sintoma de Tristeza/Humor depressivo, é conduzida em duas frentes complementares: uma avaliação extrínseca, na qual classificadores binários de diferentes naturezas (Regressão Logística, SVM, Naive Bayes e Random Forest) são treinados e testados em quatro cenários combinando dados originais e sintéticos; e uma avaliação intrínseca, baseada em métricas de diversidade lexical e na distribuição de categorias gramaticais do corpus gerado, complementada por uma análise qualitativa de exemplos representativos. Os resultados indicam que o corpus sintético preserva, em grande medida, a utilidade do corpus original para a tarefa de classificação, com destaque para a revocação, métrica considerada mais crítica em aplicações de triagem em saúde mental, na qual deixar de identificar um caso positivo tende a ser mais custoso do que um alarme falso. Observa-se, no entanto, queda mais consistente na precisão dos classificadores treinados exclusivamente com dados sintéticos quando avaliados sobre dados reais, além de indícios de que parte da diversidade lexical introduzida decorre de uma tendência do pipeline a podar conteúdo em sentenças sintaticamente complexas, e não apenas de reformulação genuína. A análise qualitativa revela, ainda, padrões recorrentes de perda de nuances discursivas, como despersonalização de relatos autobiográficos e literalização de construções metafóricas. Conclui-se que o pipeline proposto constitui um mecanismo viável, embora não isento de limitações, para a geração de corpora sintéticos em português no domínio da saúde mental, oferecendo uma alternativa concreta à indisponibilidade de dados anotados nesse domínio. | por |
| dc.description.sponsorship | Não recebi financiamento | |
| dc.identifier.citation | FIGUEIREDO, Vitória Rodrigues Pinto Borelli. Geração e avaliação de dados sintéticos para aplicações em saúde mental. 2026. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de São Carlos, Campus São Carlos, 2026. Disponível em: https://repositorio.ufscar.br/handle/20.500.14289/24329. | * |
| dc.identifier.uri | https://hdl.handle.net/20.500.14289/24329 | |
| dc.identifier.url | https://github.com/LALIC-UFSCar/synthetic-data-mental-health | |
| dc.language.iso | por | |
| dc.publisher | Universidade Federal de São Carlos | |
| dc.publisher.address | Campus São Carlos | |
| dc.publisher.center | Centro de Ciências Exatas e de Tecnologia - CCET | |
| dc.publisher.course | Engenharia de Computação - EC | |
| dc.publisher.initials | UFSCar | |
| dc.rights.uri | https://creativecommons.org/licenses/by-nc/4.0/ | |
| dc.subject | Dados sintéticos | por |
| dc.subject | Processamento de Linguagem Natural | por |
| dc.subject | Saúde mental | por |
| dc.subject | Privacidade de dados | por |
| dc.subject | Paráfrase automática | por |
| dc.subject | Synthetic data | eng |
| dc.subject | Natural Language Processing | eng |
| dc.subject | Mental health | eng |
| dc.subject | Data privacy | eng |
| dc.subject | Automatic paraphrasing | eng |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO | |
| dc.subject.ods | 9. Indústria, Inovação e Infraestrutura | |
| dc.subject.ods | 4. Educação de Qualidade | |
| dc.subject.ods | 3. Saúde e Bem-Estar | |
| dc.title | Geração e avaliação de dados sintéticos para aplicações em saúde mental | por |
| dc.title.alternative | Generation and evaluation of synthetic data for mental health applications | eng |
| dc.type | TCC |
Arquivos
Pacote Original
1 - 1 de 1