"Suuline eesti keel arvudes" [1, 2] on projekt, mille eesmärk on pakkuda suulise eesti keele kohta baasstatistikat (keeleliste üksuste sagedusi ja pikkuseid), mida seni on olnud saadaval ainult kirjakeele kohta. Andmeallikatena kasutatakse olemasolevaid aegjoondusega suulise eesti keele korpuseid ning projekti käigus loodud suuremahulist automaatselt transkribeeritud ja morfoloogiliselt annoteeritud raadio ja taskuhäälingu korpust. Käesolev kollektsioon koondab loodud korpuste tekste ning kõigist kasutatud korpustest tuletatud sagedusandmestikke.

Projektimeeskond: Pärtel Lippus (vastutav täitja, Tartu Ülikool), Tanel Alumäe (Tallinna Tehnikaülikool), Liina Lindström (Tartu Ülikool), Kaidi Lõo (Tartu Ülikool), Anton Malmi (Tartu Ülikool), Maarja-Liisa Pilvik (Tartu Ülikool), Siim Orasmaa (Tartu Ülikool), Aleksei Kelli (Tartu Ülikool)

The aim of the project "Basic statistics of spoken Estonian" is to provide frequency lists and other basic statistics of spoken Estonian that have only been available based on written language. The data comes from manually annotated time-alligned speech corpora. In addition to analysing systematically collected and manually annotated speech corpora the project team has collected a larger speech corpus of radio talk shows and podcasts that have been automatically annotated using ASR and NLP tools. The speech corpora are used for creating lists of phoneme, morpheme, word, n-gram, and collocation frequencies. This collection consists of the text transcriptions of the speech corpora collected within the project and the frequency data sets.

Project team: Pärtel Lippus (PI, University of Tartu), Tanel Alumäe (TalTech), Liina Lindström (University of Tartu), Kaidi Lõo (University of Tartu), Anton Malmi (University of Tartu), Maarja-Liisa Pilvik (University of Tartu), Siim Orasmaa (University of Tartu), Aleksei Kelli (University of Tartu)

1] "Riiklik programm: Eesti keel ja kultuur digiajastul (EKKD)" projekt EKKD93 "Suuline eesti keel arvudes"(1.01.2022−31.12.2022)

[2] "Riiklik programm: Eesti keel ja kultuur digiajastul (EKKD)" projekt EKKD117 "Suuline eesti keel arvudes II" (1.01.2023−31.12.2023)

Featured Dataverses

In order to use this feature you must have at least one published or linked dataverse.

Publish Dataverse

Are you sure you want to publish your dataverse? Once you do so it must remain published.

Publish Dataverse

This dataverse cannot be published because the dataverse it is in has not been published.

Delete Dataverse

Are you sure you want to delete your dataverse? You cannot undelete this dataverse.

Advanced Search

31 to 40 of 67 Results
Comma Separated Values - 31.7 MB - MD5: ef1ff8933edffc2d4dc66b7f6b5bc4a6
lemma frequency
Comma Separated Values - 202.8 MB - MD5: 4df13ab3aced792b6148fd3e5c6cc99a
lemma trigrams
Comma Separated Values - 245.6 MB - MD5: 2b4e9d43974b76da9a152ef5bc316182
wordform bigrams
Comma Separated Values - 148.3 MB - MD5: ebb07aa56f783de2bb82235a175e4560
wordform frequency
Comma Separated Values - 465.0 MB - MD5: b6962f51075c826cb0105c334776503d
wordform trigrams
Plain Text - 8.3 KB - MD5: 1afc7affe55b2654c6eb082243ff0ea0
ZIP Archive - 38.6 KB - MD5: dbc981c6fe482b43f8dc36852609957e
Praat & R scripts used for collecting data from corpora
Comma Separated Values - 1.1 MB - MD5: 60304eb2631a86333ca5b4da41c723f9
lemma bigrams
Comma Separated Values - 431.6 KB - MD5: d5f65620d2f5a6fe94262c835f589f0d
lemma frequency
Comma Separated Values - 1.5 MB - MD5: 7a58847e323eba35884d1bf356f67f90
lemma trigrams
Add Data

Sign up or log in to create a dataverse or add a dataset.

Share Dataverse

Share this dataverse on your favorite social media networks.

Link Dataverse
Reset Modifications

Are you sure you want to reset the selected metadata fields? If you do this, any customizations (hidden, required, optional) you have done will no longer appear.