Normalizace dat ve fulltextovém systému
Normalisation of data in fulltext system
Normalizace dat ve fulltextovém systému
diplomová práce (OBHÁJENO)
![Náhled dokumentu](/bitstream/handle/20.500.11956/31131/thumbnail.png?sequence=7&isAllowed=y)
Zobrazit/ otevřít
Trvalý odkaz
http://hdl.handle.net/20.500.11956/31131Identifikátory
SIS: 45330
Kolekce
- Kvalifikační práce [11266]
Autor
Vedoucí práce
Oponent práce
Knap, Tomáš
Fakulta / součást
Matematicko-fyzikální fakulta
Obor
Softwarové systémy
Katedra / ústav / klinika
Katedra softwarového inženýrství
Datum obhajoby
2. 2. 2010
Nakladatel
Univerzita Karlova, Matematicko-fyzikální fakultaJazyk
Slovenština
Známka
Výborně
Cieľom tejto práce je návrh a implementácia programu v jazyku Java pre spracovanie dát fulltextového systému do výslednej podoby dobre formovaného XML podľa špecifikácie XML 1.0. Vstupné dáta sú vo forme ľubovolného zle formovaného XML súboru ako napríklad HTML dáta. Dôležitými kritériami pri úpravách vstupných dát sú zachovať vernosť štruktúre a obsahu vstupného súboru v čo najvyššej miere. Program kontroluje správnosť menných priestorov a umožňuje nahradenie špeciálnych HTML entít skutočnými Unicode znakmi. Výstupný súbor musí byť možné spracovať použitím štandardných parserov. Sekundárnym cieľom je preskúmať a implementovať vhodnú metódu pre identifikáciu jazyka textového obsahu výsledného XML dokumentu ako celku, obsahu jednotlivých elementov alebo jednoduchého textového súboru.
The purpose of this thesis is to design and implement Java application to process data from full text system to well-formed XML data according to XML 1.0 specification. Input data are stored in XML files containing any kind of not well formed XML, typically HTML content. Major criteria are conservation of the structure and conservation of the text content as much as possible. Program verifies if namespaces are correct and allows replacement of special HTML entities by appropriate Unicode characters. The output file has to be correctly processed by standard XML parsers. Secondary objective is to investigate and implement suitable method to identify language of the resulting output file as a whole, the content of individual elements or plain text file.