Analýza chyb a možností zlepšení frázového strojového překladu z angličtiny do urdštiny

Ata, Naila

dc.contributor.advisor	Bojar, Ondřej
dc.creator	Ata, Naila
dc.date.accessioned	2017-04-27T02:00:22Z
dc.date.available	2017-04-27T02:00:22Z
dc.date.issued	2011
dc.identifier.uri	http://hdl.handle.net/20.500.11956/33687
dc.description.abstract	Diplomová práce vyhodnocuje kvalitu frázového strojového překladu pro překlad z angličtiny do urdštiny. Popisujeme anotační schéma pro chyby v překladu a aplikujeme jej na výstupy systému. Hlavním cílem diplomové práce je experimentovat s rozličnými heuristickými postupy pro zlepšení kvality překladu na základě podrobné ruční analýzy chyb v 200 ukázkových větách. Naše postupy zahrnují 1) předzpracování zdrojové angličtiny, např. změna pořádku slov, 2) předzpracování trénovacích dat pro snížení nadměrné lexikální víceznačnosti, při slovním zarovnávání 3) použití dodatečné anotace v podobě tzv. faktorů pro lepší modelování tvaroslovné ko- herence na cílové straně. Účinek studovaných technik je vyhodnocen pomocí automatické metriky kvality strojového překladu. 1	cs_CZ
dc.description.abstract	This thesis evaluates the translation quality of phrase-based machine translation system. It explains the translation error annotation scheme to manually annotate errors related to English to Urdu translation system. The primary goal of the thesis is to experiment with different heuristic in order to improve the translation quality based on through manual analysis of 200 test sentences. Different hueristics such as (1) pre-processing of input English, such as word reordering, (2) preprocessing the training corpus in order to improve word alignment, (3) using additional factors (in Moses factored translation) to better model target-side morphological coherence are applied and their impact on the translation quality is evaluated.	en_US
dc.language	English	cs_CZ
dc.language.iso	en_US
dc.publisher	Univerzita Karlova, Matematicko-fyzikální fakulta	cs_CZ
dc.subject	frázový překlad	cs_CZ
dc.subject	jazyky svolným slovosledem	cs_CZ
dc.subject	typy chyb v překladu	cs_CZ
dc.subject	Phrase-based translation	en_US
dc.subject	Free-word order languages	en_US
dc.subject	error scheme	en_US
dc.title	Analýza chyb a možností zlepšení frázového strojového překladu z angličtiny do urdštiny	en_US
dc.type	diplomová práce	cs_CZ
dcterms.created	2011
dcterms.dateAccepted	2011-02-04
dc.description.department	Institute of Formal and Applied Linguistics	en_US
dc.description.department	Ústav formální a aplikované lingvistiky	cs_CZ
dc.description.faculty	Faculty of Mathematics and Physics	en_US
dc.description.faculty	Matematicko-fyzikální fakulta	cs_CZ
dc.identifier.repId	76231
dc.contributor.referee	Zeman, Daniel
dc.identifier.aleph	001286380
thesis.degree.name	Mgr.
thesis.degree.level	navazující magisterské	cs_CZ
thesis.degree.discipline	Computational Linguistics	en_US
thesis.degree.discipline	Matematická lingvistika	cs_CZ
thesis.degree.program	Computer Science	en_US
thesis.degree.program	Informatika	cs_CZ
uk.thesis.type	diplomová práce	cs_CZ
uk.taxonomy.organization-cs	Matematicko-fyzikální fakulta::Ústav formální a aplikované lingvistiky	cs_CZ
uk.taxonomy.organization-en	Faculty of Mathematics and Physics::Institute of Formal and Applied Linguistics	en_US
uk.faculty-name.cs	Matematicko-fyzikální fakulta	cs_CZ
uk.faculty-name.en	Faculty of Mathematics and Physics	en_US
uk.faculty-abbr.cs	MFF	cs_CZ
uk.degree-discipline.cs	Matematická lingvistika	cs_CZ
uk.degree-discipline.en	Computational Linguistics	en_US
uk.degree-program.cs	Informatika	cs_CZ
uk.degree-program.en	Computer Science	en_US
thesis.grade.cs	Dobře	cs_CZ
thesis.grade.en	Good	en_US
uk.abstract.cs	Diplomová práce vyhodnocuje kvalitu frázového strojového překladu pro překlad z angličtiny do urdštiny. Popisujeme anotační schéma pro chyby v překladu a aplikujeme jej na výstupy systému. Hlavním cílem diplomové práce je experimentovat s rozličnými heuristickými postupy pro zlepšení kvality překladu na základě podrobné ruční analýzy chyb v 200 ukázkových větách. Naše postupy zahrnují 1) předzpracování zdrojové angličtiny, např. změna pořádku slov, 2) předzpracování trénovacích dat pro snížení nadměrné lexikální víceznačnosti, při slovním zarovnávání 3) použití dodatečné anotace v podobě tzv. faktorů pro lepší modelování tvaroslovné ko- herence na cílové straně. Účinek studovaných technik je vyhodnocen pomocí automatické metriky kvality strojového překladu. 1	cs_CZ
uk.abstract.en	This thesis evaluates the translation quality of phrase-based machine translation system. It explains the translation error annotation scheme to manually annotate errors related to English to Urdu translation system. The primary goal of the thesis is to experiment with different heuristic in order to improve the translation quality based on through manual analysis of 200 test sentences. Different hueristics such as (1) pre-processing of input English, such as word reordering, (2) preprocessing the training corpus in order to improve word alignment, (3) using additional factors (in Moses factored translation) to better model target-side morphological coherence are applied and their impact on the translation quality is evaluated.	en_US
uk.file-availability	V
uk.publication.place	Praha	cs_CZ
uk.grantor	Univerzita Karlova, Matematicko-fyzikální fakulta, Ústav formální a aplikované lingvistiky	cs_CZ
dc.identifier.lisID	990012863800106986