Europarl Parallel Corpus

Instance of: Dataset
Description The Europarl parallel corpus is extracted from the proceedings of the European Parliament. It includes versions in 21 European languages: Romanic (French, Italian, Spanish, Portuguese, Romanian), Germanic (English, Dutch, German, Danish, Swedish), Slavik (Bulgarian, Czech, Polish, Slovak, Slovene), Finni-Ugric (Finnish, Hungarian, Estonian), Baltic (Latvian, Lithuanian), and Greek. The goal of the extraction and processing was to generate sentence aligned text for statistical machine translation systems. For this purpose we extracted matching items and labeled them with corresponding document IDs. Using a preprocessor we identified sentence boundaries. We sentence aligned the data using a tool based on the Church and Gale algorithm.
Language rf
fi
sl
en
hu
el
bg
es
lv
cs
sv
sk
nl
et
it
ro
de
lt
pt
da
pl
Language Portuguese
Italian
German
Swedish
Danish
Slovak
Finnish
Czech
Dutch
English
Bulgarian
Greek (modern)
Polish
Romanian
Spanish
Rights CC-ZERO
See Also http://metashare.elda.org/repository/browse/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6/
Source META-SHARE
Title Europarl Parallel Corpus
Type Resource Info
Type Corpus
Is Is Replaced By of Europarl Parallel Corpus

Contact Point

Affiliation
Communication Info
Distribution
Access URL http://www.ed.ac.uk/home
Type Distribution
URL
Email [email protected]
Type Communication Info
Organization Name University of Edinburgh
Type Organization Info Type
Communication Info
Email [email protected]
Type Communication Info
Gender male
Given Name Philipp
Surname Koehn
Type Contact Person
Person
Person Info Type

Corpus Info

Corpus Text Info
Language Info
Language lv
Language Name Latvian
Size Per Language
Size 12085228
Size Unit Words
Type Size Info Type
Type Language Info
Language cs
Language Czech
Language Name Czech
Size Per Language
Size 13195311
Size Unit Words
Type Size Info Type
Type Language Info
Language rf
Language Name French
Size Per Language
Size 54202850
Size Unit Words
Type Size Info Type
Type Language Info
Language fi
Language Finnish
Language Name Finnish
Size Per Language
Size 33708706
Size Unit Words
Type Size Info Type
Type Language Info
Language de
Language German
Language Name German
Size Per Language
Size 47236849
Size Unit Words
Type Size Info Type
Type Language Info
Language bg
Language Bulgarian
Language Name Bulgarian
Size Per Language
Size 411636
Size Unit Sentences
Type Size Info Type
Type Language Info
Language ro
Language Romanian
Language Name Romanian
Size Per Language
Size 9663544
Size Unit Words
Type Size Info Type
Type Language Info
Language hu
Language Name Hungarian
Size Per Language
Size 12606986
Size Unit Words
Type Size Info Type
Type Language Info
Language pt
Language Portuguese
Language Name Portuguese
Size Per Language
Size 52300149
Size Unit Words
Type Size Info Type
Type Language Info
Language lt
Language Name Lithuanian
Size Per Language
Size 11512131
Size Unit Words
Type Size Info Type
Type Language Info
Language it
Language Italian
Language Name Italian
Size Per Language
Size 50259169
Size Unit Words
Type Size Info Type
Type Language Info
Language en
Language English
Language Name English
Size Per Language
Size 53974751
Size Unit Words
Type Size Info Type
Type Language Info
Language da
Language Danish
Language Name Danish
Size Per Language
Size 47761381
Size Unit Words
Type Size Info Type
Type Language Info
Language el
Language Greek (modern)
Language Name Greek, Modern (1453-)
Size Per Language
Size 1517141
Size Unit Sentences
Type Size Info Type
Type Language Info
Language sv
Language Swedish
Language Name Swedish
Size Per Language
Size 45665947
Size Unit Words
Type Size Info Type
Type Language Info
Language nl
Language Dutch
Language Name Dutch; Flemish
Size Per Language
Size 53487257
Size Unit Words
Type Size Info Type
Type Language Info
Language pl
Language Polish
Language Name Polish
Size Per Language
Size 7087016
Size Unit Words
Type Size Info Type
Type Language Info
Language sl
Language Name Slovenian
Size Per Language
Size 12665974
Size Unit Words
Type Size Info Type
Type Language Info
Language es
Language Spanish
Language Name Spanish
Size Per Language
Size 54806927
Size Unit Words
Type Size Info Type
Type Language Info
Language sk
Language Slovak
Language Name Slovak
Size Per Language
Size 13116301
Size Unit Words
Type Size Info Type
Type Language Info
Language et
Language Name Estonian
Size Per Language
Size 11358009
Size Unit Words
Type Size Info Type
Type Language Info
Linguality Info
Linguality Type Multilingual
Multilinguality Type Parallel
Type Linguality Info
Media Type Text
Modality Info
Modality Type Written Language
Type Modality Info
Size Info
Size 650000000
Size Unit Words
Type Size Info Type
Type Corpus Text Info
Resource Type Corpus
Type Corpus Info

Distribution Info

Availability Available-unrestricted Use
Ipr Holder
Person Info
Affiliation
Communication Info
Distribution Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#Dist URL2
Email [email protected]
Type Communication Info
Organization Name University of Edinburgh
Type Organization Info Type
Communication Info
Distribution Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#Dist URL2
Email [email protected]
[email protected]
Type Communication Info
Gender male
Given Name Philipp
Surname Koehn
Type Person
Person Info Type
Type Actor
License
Delivery Channel Downloadable
Distribution Rights Holder
Person Info Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#person Info
Type Actor
Licensor
Person Info
Affiliation
Communication Info Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#communication Info2
Organization Name University of Edinburgh
Type Organization Info Type
Communication Info
Email [email protected]
Type Communication Info
Gender male
Given Name Philipp
Surname Koehn
Type Person
Person Info Type
Type Actor
Same As http://creativecommons.org/publicdomain/zero/1.0/
Type Licence Info
Type Distribution
Distribution Info

Identification Info

Description The Europarl parallel corpus is extracted from the proceedings of the European Parliament. It includes versions in 21 European languages: Romanic (French, Italian, Spanish, Portuguese, Romanian), Germanic (English, Dutch, German, Danish, Swedish), Slavik (Bulgarian, Czech, Polish, Slovak, Slovene), Finni-Ugric (Finnish, Hungarian, Estonian), Baltic (Latvian, Lithuanian), and Greek. The goal of the extraction and processing was to generate sentence aligned text for statistical machine translation systems. For this purpose we extracted matching items and labeled them with corresponding document IDs. Using a preprocessor we identified sentence boundaries. We sentence aligned the data using a tool based on the Church and Gale algorithm.
Distribution
Access URL http://www.statmt.org/europarl/
Type Distribution
URL
Identifier http://urn.fi/urn:nbn:fi:lb-20140730195
Meta Share Id NOT_DEFINED_FOR_V2
Title Europarl Parallel Corpus
Type Identification Info

Usage Info

Foreseen Use Info
Foreseen Use Nlp Applications
Type Foreseen Use Info
Use NLPSpecific Machine Translation
Type Usage Info

Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#Header

Instance of: Catalog Record
Issued 2014-09-29T18:57:10Z Date
Primary Topic Europarl Parallel Corpus
Set Spec corpus:text
corpus

Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#metadata Creator

Instance of: Actor
Is Creator of Metashare/beef693405b111e2999d005056be118e4a6836d082c847eab5f68ce44e1a92c6#metadata Info