Export this record: EndNote BibTex

Please use this identifier to cite or link to this item: https://tede2.pucrs.br/tede2/handle/tede/7108
Document type: Tese
Title: Evaluation of methods for taxonomic relation extraction from text
Other Titles: Avaliação de métodos para extração automática de relações a partir de textos
Author: Granada, Roger Leitzke 
Advisor: Vieira, Renata
???metadata.dc.contributor.advisor2???: Aussenac-Gilles, Nathalie
First advisor-co: Santos, Cássia Trojahn dos
Abstract (native): Modern information systems are changing the idea of “data processing” to the idea of “concept processing”, meaning that instead of processing words, such systems process semantic concepts which carry meaning and share contexts with other concepts. Ontology is commonly used as a structure that captures the knowledge about a certain area via providing concepts and relations between them. Traditionally, concept hierarchies have been built manually by knowledge engineers or domain experts. However, the manual construction of a concept hierarchy suffers from several limitations such as its coverage and the enormous costs of extension and maintenance. Furthermore, keeping up with a hand-crafted concept hierarchy along with the evolution of domain knowledge is an overwhelming task, being necessary to build concept hierarchies automatically. The (semi-)automatic support in ontology development is usually referred to as ontology learning. The ontology learning from texts is usually divided in steps, going from concepts identification, passing through hierarchy and non-hierarchy relations detection and, seldom, axiom extraction. It is reasonable to say that among these steps the current frontier is in the establishment of concept hierarchies, since this is the backbone of ontologies and, therefore, a good concept hierarchy is already a valuable resource for many ontology applications. A concept hierarchy is represented with a tree-structured form with specialization/generalization relations between concepts, in which lower-level concepts are more specific while higher-level are more general. The automatic construction of concept hierarchies from texts is a complex task and since the 1980 decade a large number of works have been proposing approaches to better extract relations between concepts. These different proposals have never been contrasted against each other on the same set of data and across different languages. Such comparison is important to see whether they are complementary or incremental, also we can see whether they present different tendencies towards recall and precision, i.e., some can be very precise but with very low recall and others can achieve better recall but low precision. Another aspect concerns to the variation of results for different languages. This thesis evaluates these different methods on the basis of hierarchy metrics such as density and depth, and evaluation metrics such as Recall and Precision. The evaluation is performed over the same corpora, which consist of English and Portuguese parallel and comparable texts. Both automatic and manual evaluations are presented. The output of seven methods are evaluated automatically and the output of four methods are evaluated manually. Results shed light over the comprehensive set of methods that are the state of the art according to the literature in the area.
Abstract (english): Sistemas de informação modernos têm mudado a ideia “processamento de dados” para a ideia de “processamento de conceitos”, assim, ao invés de processarem palavras, tais sistemas fazem o processamento de conceitos que contêm ignificado e que compartilham contextos com outros contextos. Ontologias são normalmente utilizadas como uma estrutura que captura o conhecimento a cerca de uma certa área, provendo conceitos e relações entre tais conceitos. Tradicionalmente, hierarquias de conceitos são construídas manualmente por engenheiros do conhecimento ou especialistas do domínio. Entretanto, este tipo de construção sofre com diversas limitações, tais como, cobertura e o alto custo de extensão e manutenção. Assim, se faz necessária a construção de tais estruturas automaticamente. O suporte (semi-)automatico no desenvolvimento de ontologias é comumente referenciado como aprendizagem de ontologias e é normalmente dividido em etapas, como identificação de conceitos, detecção de relações hierarquicas e não hierarquicas, e extração de axiomas. É razoável dizer que entre tais passos a fronteira está no estabelecimento de hierarquias de conceitos, pois é a espinha dorsal das ontologias e, por consequência, uma boa hierarquia de conceitos é um recurso válido para várias aplicações de ontologias. Hierarquias de conceitos são representadas por estruturas em árvore com relacionamentos de especialização/generalização, onde conceitos nos níveis mais baixos são mais específicos e conceitos nos níveis mais altos são mais gerais. A construção automática de tais hierarquias é uma tarefa complexa e desde a década de 80 muitos trabalhos têm proposto melhores formas para fazer a extração de relações entre conceitos. Estas propostas nunca foram contrastadas usando um mesmo conjunto de dados. Tal comparação é importante para ver se os métodos são complementares ou incrementais, bem como se apresentam diferentes tendências em relação à precisão e abrangência, i.e., alguns podem ser bastante precisos e ter uma baixa abrangência enquanto outros têm uma abrangência melhor porém com uma baixa precisão. Outro aspecto refere-se à variação dos resultados em diferentes línguas. Esta tese avalia os métodos utilizando métricas de hierarquias como densidade e profundidade, e métricas de evaliação como precisão e abrangência. A avaliação é realizada utilizando o mesmo corpora, consistindo de textos paralelos e comparáveis em inglês e português. São realizadas avaliações automática e manual, sendo a saída de sete métodos avaliados automaticamente e quatro manualmente. Os resultados dão uma luz sobre a abrangência dos métodos que são utilizados no estado da arte de acordo com a literatura.
Keywords: ONTOLOGIA
PROCESSAMENTO DA LINGUAGEM NATURAL
INFORMÁTICA
CNPQ Knowledge Areas: CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
Language: eng
Country: Brasil
Publisher: Pontifícia Universidade Católica do Rio Grande do Sul
Institution Acronym: PUCRS
Department: Faculdade de Informática
Program: Programa de Pós-Graduação em Ciência da Computação
Access type: Acesso Aberto
URI: http://tede2.pucrs.br/tede2/handle/tede/7108
Issue Date: 28-Sep-2015
Appears in Collections:Programa de Pós-Graduação em Ciência da Computação

Files in This Item:
File Description SizeFormat 
TES_ROGER_LEITZKE_GRANADA_COMPLETO.pdfTexto Completo2.43 MBAdobe PDFThumbnail

Download/Open Preview


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.