Normalizace dat ve fulltextovém systému

Kapusta, Matúš

Normalisation of data in fulltext system
Normalizace dat ve fulltextovém systému

diplomová práce (OBHÁJENO)

Zobrazit/otevřít

Záznam o průběhu obhajoby (127.9Kb)

Trvalý odkaz

http://hdl.handle.net/20.500.11956/31131

Identifikátory

SIS: 45330

Oponent práce

Knap, Tomáš

Fakulta / součást

Matematicko-fyzikální fakulta

Obor

Softwarové systémy

Katedra / ústav / klinika

Katedra softwarového inženýrství

Datum obhajoby

2. 2. 2010

Nakladatel

Univerzita Karlova, Matematicko-fyzikální fakulta

Jazyk

Slovenština

Známka

Výborně

Cieľom tejto práce je návrh a implementácia programu v jazyku Java pre spracovanie dát fulltextového systému do výslednej podoby dobre formovaného XML podľa špecifikácie XML 1.0. Vstupné dáta sú vo forme ľubovolného zle formovaného XML súboru ako napríklad HTML dáta. Dôležitými kritériami pri úpravách vstupných dát sú zachovať vernosť štruktúre a obsahu vstupného súboru v čo najvyššej miere. Program kontroluje správnosť menných priestorov a umožňuje nahradenie špeciálnych HTML entít skutočnými Unicode znakmi. Výstupný súbor musí byť možné spracovať použitím štandardných parserov. Sekundárnym cieľom je preskúmať a implementovať vhodnú metódu pre identifikáciu jazyka textového obsahu výsledného XML dokumentu ako celku, obsahu jednotlivých elementov alebo jednoduchého textového súboru.

Abstrakt (anglicky)

The purpose of this thesis is to design and implement Java application to process data from full text system to well-formed XML data according to XML 1.0 specification. Input data are stored in XML files containing any kind of not well formed XML, typically HTML content. Major criteria are conservation of the structure and conservation of the text content as much as possible. Program verifies if namespaces are correct and allows replacement of special HTML entities by appropriate Unicode characters. The output file has to be correctly processed by standard XML parsers. Secondary objective is to investigate and implement suitable method to identify language of the resulting output file as a whole, the content of individual elements or plain text file.

Citace dokumentu

Metadata

Zobrazit celý záznam