211 Downloads view our datasets

MDC Datasets

About MDC Datasets

Mozilla Data Collective is building a Multilingual, Multicultural, Multimodal tech future by giving everyone the Data Platform for Human Agency and Fair Value Exchange.

Datasets

🚧 Southeast Asian Tamil TTS Dataset 🚧MDC DLA-1.0taTTSWAV, TSV193 B
African Actions Annotated Videos for AI (Health Domain)MDC DLA 1.0en, ig, ha, yoOTHMP4, JSON4.81 GB
Brazilian Sign Language (Libras) Healthcare CorpusMDC-DLA 1.0bzs, ptOTHMP4, SRT, JSON40.30 GB
Brazilian Sign Language (Libras) Healthcare Corpus (Non Commercial)CC-BY-NC-SA-4.0bzs, ptOTHMP4, SRT, JSON40.31 GB
Burmese Speech CollectionMDC DLA-1.0myTTSWAV, TSV7.21 GB
Conversational Speech in Gujarati in the Finance DomainMDC DLA-1.0guASRWAV, JSON6.20 GB
Conversational Speech in Gujarati in the Medical DomainMDC-DLA 1.0guASRWAV, JSON6.18 GB
Conversational Speech in Manipuri in the Finance DomainMDC DLA-1.0mniASRWAV, JSON6.50 GB
Conversational Speech in Manipuri in the Medical DomainMDC DLA-1.0mniASRWAV, JSON6.72 GB
Lost In Transcription Competition - Development Data (Javanese-Indonesian)CC-BY-SA-4.0jv, idASRMP3, TSV69.40 MB
Lost In Transcription Competition - Development Data (Nahuatl-Spanish)CC-BY-SA-4.0azz, nhi, nhw, esASRMP3, TSV35.36 MB
Lost In Transcription Competition - Development Data (Spanish-English)CC-BY-SA-4.0es, enASRMP3, TSV16.24 MB
Medical Domain Mexican Spanish Speech Corpus (MEDMEX)MDC-DLA 1.0es-MXASRMP3, TSV264.24 MB
Singaporean Tamil Speech CollectionMDC-DLA 1.0ta-SGTTSWAV, TSV8.47 GB
Single Speaker Urdu TTS dataset (Female Speaker, South Punjab)MDC DLA-1.0urTTSWAV, TSV6.02 GB
🚧 Hazargi Corpus for Speech Recognition 🚧MDC DLA-1.0hazASRMP3, TSV511.56 MB
🚧 Hazargi Multimodal Dataset 🚧MDC DLA-1.0hazNLPMP4, EAF44.00 GB
🚧 Hazargi-English Parallel Text Corpus 🚧 MDC DLA-1.0haz, enMTTSV434.04 KB
🚧 Hazargi-English Speech Translation Corpus 🚧MDC DLA-1.0haz, enMTMP3, TSV511.58 MB
🚧 Khowar Corpus for Speech Recognition 🚧MDC DLA-1.0khwASRMP3, TSV245.00 MB
🚧 Khowar Multimodal Dataset 🚧MDC DLA 1.0khw, enNLPMP4, WAV, EAF167.23 GB
🚧 Khowar Speech Translation Corpus 🚧MDC DLA-1.0khw, enMTMP3, TSV244.96 MB
🚧 Khowar-English Parallel Corpus 🚧MDC DLA-1.0khw, enMTTSV407.57 KB
🚧 Moroccan Arabic ASR dataset (180h) 🚧MDC DLA-1.0aryASRMP3, TSV214 B
🚧 Multi-Subject Human Pose & Facial Expression Dataset (Studio, 4K) 🚧MDC DLA-1.0zxxCVJPEG, CSV68.50 GB
🚧 Northern Pashto Multimodal Dataset 🚧MDC DLA-1.0pbuNLPMP4, WAV, EAF251.41 GB
🚧 Southeast Asian Cantonese TTS dataset 🚧MDC DLA-1.0yueTTSWAV, TSV202 B
🚧 Southeast Asian Hokkien TTS dataset 🚧MDC DLA-1.0nanTTSWAV, TSV194 B
🚧 Southeast Asian Malay TTS dataset 🚧MDC DLA-1.0msTTSWAV, TSV194 B