Pos Taggin utilizando CRFS para el español
Portada
Citas bibliográficas
Código QR
Autores
Autor corporativo
Recolector de datos
Otros/Desconocido
Director audiovisual
Editor/Compilador
Editores
Tipo de Material
Fecha
Cita bibliográfica
Título de serie/ reporte/ volumen/ colección
Resumen en español
El POS Tagging es una tarea enmarcada dentro del procesamiento del lenguaje Natulal (PLN), cuyo objetivo esencial es la categorización lingüística de las palabras dentro de un texto. El problema al cual se enfrenta el POS tagging es la ambigüedad, en cuanto a que existen algunas palabras que presentan más de una posible categoría lingüística. Existen diferentes enfoques para resolver esta tarea, entre los que se tienen, modelos estocásticos, modelos basados en reglas, entre otros. Dentro de los modelos estocásticos se encuentran los campos randómicos condicionales (Conditional Random Fields CRF) y las cadenas ocultas de markov (Hidden Markov Chain HMM). Los primeros, utilizados para el etiquetado de secuencias, representan un modelo grá¿co no dirigido, lo que permite que sean discriminativos, y que se puedan incluir características sobre las observaciones. Los segundos, igualmente utilizados para el etiquetado de secuencias, corresponden a un modelo gráfico dirigido, lo cual permite que sean generativos. La desventaja que presentan las HMMs, es que elas para determinar la clasificación del siguiente estado, no tienen en cuenta el pasado, sino el estado actual, además de no permitir incluir características sobre las observaciones. Estas dos debilidades no las presenta los CRFs. El objetivo de este trabajo es realizar un análisis comparativo del rendimiento de estos dos modelos estocásticos, para la tarea del POS Tagging, en el idioma español, bajo el corpus AnCora, teniendo en cuenta las características morfológicas de cada palabra para el modelo CRF.

PDF
FLIP 
