Creació d’un corpus d’entailment en espanyol

Grau Francitorra, Patricia

Fitxers

TFG_Grau_Francitorra_Patricia.pdf (479.89 KB)

Tipus de document

Treball de fi de grau

Data de publicació

2020-06-12

Llicència de publicació

Si us plau utilitzeu sempre aquest identificador per citar o enllaçar aquest document: https://hdl.handle.net/2445/171914

Creació d’un corpus d’entailment en espanyol

Autors

Grau Francitorra, Patricia

Director/Tutor

Taulé Delor, Mariona

Resum

[cat] L’estudi de la inferència en el llenguatge natural i la seva detecció pot suposar un avenç important en les tecnologies del llenguatge. Per aquest motiu, s’han creat corpus per a tasca de Natural Language Inference, que estudien l’entailment i la contradicció, si bé han estat centrats en l’anglès. Aquest treball presenta la metodologia duta a terme per a la creació i anotació manual de frases d’un corpus d’entailment en espanyol. Especialment, s’ha descrit el procés de creació de frases inferides de textos a través d’uns criteris que n’asseguren la seva riquesa, que hi hagi diferents nivells de complexitat i eviten que hi hagi informació esbiaixada. S’han creat 940 hipòtesis inferides a partir de 470 frases inicials, que van ser extretes de 6 articles de la Viquipèdia. El corpus d’entailment en espanyol forma part d’un corpus més gran de Natural Language Inference que s’està duent a terme en el marc d’un projecte que desenvolupa el grup de recerca CLiC (Centre de Llenguatge i Computació) de la Universitat de Barcelona.
[eng] The study of Natural Language Inference and its detection may suppose an important advance in language technology. For this reason, many corpora regarding entailment and contradiction have been created, even though most of them have been written for English. This work presents the methodology for the creation and annotation of a corpus of entailed sentences in Spanish made by humans. Especially, the process of creation of entailed sentences from texts through some criteria that ensure its richness, different levels of complexity and lack of bias. 940 hypotheses have been entailed from 470 texts, which were taken from 6 Wikipedia articles. The corpus of entailment in Spanish is part of a larger corpus about Natural Language Inference, which is being developed in the project of the research group CLiC (Centre de Llenguatge i Computació) of the University of Barcelona.

Descripció

Treballs Finals de Grau de Lingüística. Facultat de Filologia. Universitat de Barcelona, Curs: 2019-2020, Tutora: Mariona Taulé Delor

Matèries

Corpus (Lingüística), Lingüística computacional, Inferència, Treballs de fi de grau

Matèries (anglès)

Corpora (Linguistics), Computational linguistics, Inference, Bachelor's theses

Col·leccions

Treballs Finals de Grau (TFG) - Lingüística

Pàgina completa de l'ítem

Citació

GRAU FRANCITORRA, Patricia. Creació d’un corpus d’entailment en espanyol. [consulted: 24 of July of 2026]. Available at: https://hdl.handle.net/2445/171914

Estadístiques

Exportar metadades

JSON - METS

Fitxers

Tipus de document

Data de publicació

Llicència de publicació

Creació d’un corpus d’entailment en espanyol

Títol de la revista

Autors

Director/Tutor

ISSN de la revista

Títol del volum

Recurs relacionat

Resum

Descripció

Matèries

Matèries (anglès)

Citació

Col·leccions

Citació

Exportar metadades

Fitxers

Tipus de document

Data de publicació

Llicència de publicació

Creació d’un corpus d’entailment en espanyol

Títol de la revista

Autors

Director/Tutor

ISSN de la revista

Títol del volum

Recurs relacionat

Resum

Descripció

Matèries

Matèries (anglès)

Citació

Col·leccions

Citació

Exportar metadades

Compartir registre