O uso de recursos linguísticos para mensurar a semelhança semântica entre frases curtas através de uma abordagem híbrida

Orientador(a) (dc.contributor.advisor)Rigo, Sandro José
Coorientador(a) (dc.contributor.advisor-co1)Alves, Isa Mara da Rosa
Lattes Coorientador(a) (dc.contributor.advisor-co1Lattes)http://lattes.cnpq.br/4118926626764248pt_BR
Lattes Orientador(a) (dc.contributor.advisorLattes)http://lattes.cnpq.br/3914159735707328pt_BR
Autor(a) (dc.contributor.author)Silva, Allan de Barcelos
Autor(a) Lattes (dc.contributor.authorLattes)http://lattes.cnpq.br/3284404774453856pt_BR
Data de Disponibilização (dc.date.accessioned)2018-04-04T11:46:55Z
dc.date.available (dc.date.available)2018-04-04T11:46:55Z
Data da defesa / Data do evento (dc.date.issued)2017-12-14
Abstract (dc.description.abstract)One of the areas of Natural language processing (NLP), the task of assessing the Semantic Textual Similarity (STS) is one of the challenges in NLP and comes playing an increasingly important role in related applications. The STS is a fundamental part of techniques and approaches in several areas, such as information retrieval, text classification, document clustering, applications in the areas of translation, check for duplicates and others. The literature describes the experimentation with almost exclusive application in the English language, in addition to the priority use of probabilistic resources, exploring the linguistic ones in an incipient way. Since the linguistic plays a fundamental role in the analysis of semantic textual similarity between short sentences, because exclusively probabilistic works fails in some way (e.g. identification of far or close related sentences, anaphora) due to lack of understanding of the language. This fact stems from the few non-linguistic information in short sentences. Therefore, it is vital to identify and apply linguistic resources for better understand what make two or more sentences similar or not. The current work presents a hybrid approach, in which are used both of distributed, lexical and linguistic aspects for an evaluation of semantic textual similarity between short sentences in Brazilian Portuguese. We evaluated proposed approach with well-known and respected datasets in the literature (PROPOR 2016) and obtained good results.en
Resumo (dc.description.resumo)Na área de Processamento de Linguagem Natural, a avaliação da similaridade semântica textual é considerada como um elemento importante para a construção de recursos em diversas frentes de trabalho, tais como a recuperação de informações, a classificação de textos, o agrupamento de documentos, as aplicações de tradução, a interação através de diálogos, entre outras. A literatura da área descreve aplicações e técnicas voltadas, em grande parte, para a língua inglesa. Além disso, observa-se o uso prioritário de recursos probabilísticos, enquanto os aspectos linguísticos são utilizados de forma incipiente. Trabalhos na área destacam que a linguística possui um papel fundamental na avaliação de similaridade semântica textual, justamente por ampliar o potencial dos métodos exclusivamente probabilísticos e evitar algumas de suas falhas, que em boa medida são resultado da falta de tratamento mais aprofundado de aspectos da língua. Este contexto é potencializado no tratamento de frases curtas, que consistem no maior campo de utilização das técnicas de similaridade semântica textual, pois este tipo de sentença é composto por um conjunto reduzido de informações, diminuindo assim a capacidade de tratamento probabilístico eficiente. Logo, considera-se vital a identificação e aplicação de recursos a partir do estudo mais aprofundado da língua para melhor compreensão dos aspectos que definem a similaridade entre sentenças. O presente trabalho apresenta uma abordagem para avaliação da similaridade semântica textual em frases curtas no idioma português brasileiro. O principal diferencial apresentado é o uso de uma abordagem híbrida, na qual tanto os recursos de representação distribuída como os aspectos léxicos e linguísticos são utilizados. Para a consolidação do estudo, foi definida uma metodologia que permite a análise de diversas combinações de recursos, possibilitando a avaliação dos ganhos que são introduzidos com a ampliação de aspectos linguísticos e também através de sua combinação com o conhecimento gerado por outras técnicas. A abordagem proposta foi avaliada com relação a conjuntos de dados conhecidos na literatura (evento PROPOR 2016) e obteve bons resultados.pt_BR
Agência de fomento (dc.description.sponsorship)Nenhumapt_BR
URI (dc.identifier.uri)http://www.repositorio.jesuita.org.br/handle/UNISINOS/6974
Idioma (dc.language)pt_BRpt_BR
Nome da instituição (dc.publisher)Universidade do Vale do Rio dos Sinospt_BR
País da Instituição (dc.publisher.country)Brasilpt_BR
Departamento (dc.publisher.department)Escola Politécnicapt_BR
Sigla da Instituição (dc.publisher.initials)Unisinospt_BR
Programa (dc.publisher.program)Programa de Pós-Graduação em Computação Aplicadapt_BR
Direitos de acesso ao documento (dc.rights)openAccesspt_BR
Assunto (dc.subject)Processamento de linguagem naturalpt_BR
Assunto (dc.subject)Similaridade semântica textualpt_BR
Assunto (dc.subject)Linguísticapt_BR
Assunto (dc.subject)Aprendizagem de máquinapt_BR
Assunto (dc.subject)Support vector machinesen
Assunto (dc.subject)Word embeddingsen
Assunto (dc.subject)Principal component analysisen
Assunto (dc.subject)Natural language processingen
Assunto (dc.subject)Semantic textual similarityen
Assunto (dc.subject)Linguisticen
Assunto (dc.subject)Machine learningen
Assunto (dc.subject)Support vector machinesen
Assunto (dc.subject)Word embeddingsen
Assunto (dc.subject)Principal component analysisen
Tema (CNPq) (dc.subject.cnpq)ACCNPQ::Ciências Exatas e da Terra::Ciência da Computaçãopt_BR
Título (dc.title)O uso de recursos linguísticos para mensurar a semelhança semântica entre frases curtas através de uma abordagem híbridapt_BR
Tipo de arquivo (dc.type)Dissertaçãopt_BR

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Allan de Barcelos Silva_.pdf
Tamanho:
2.19 MB
Formato:
Adobe Portable Document Format
Descrição:
recursos_linguisticos

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
2.12 KB
Formato:
Item-specific license agreed upon to submission
Descrição: