Release Date: 9/17/2026
Format: MP3
Size: 202.35 MB
A collection of spontaneous responses to questions in Mixteco Yucuhiti (Mixteco Yucuhiti).
Restrictions/Special Constraints
None provided.
Forbidden Usage
It is forbidden to attempt to determine the identity of speakers in the Common Voice datasets. It is forbidden to re-host or re-share this dataset.
Intended Use
This dataset is intended to be used for training and evaluating automatic speech recognition (ASR) models. It may also be used for applications relating to computer-aided language learning (CALL) and language or heritage revitalisation.
meh)Esta ficha técnica corresponde a sps-corpus-5.0-2026-09-11 del conjunto de datos Spontaneous Speech (habla espontánea) de Mozilla Common Voice para Mixteco Yucuhiti [Mixteco Yucuhiti - meh]. El conjunto de datos contiene 1057 representando 10.15 horas de grabaciones (10.05 horas validadas) de 16 hablantes.
Los clips del conjunto de datos se clasifican según el estado de transcripción y la asignación al conjunto de entrenamiento. Las siguientes tablas resumen la distribución.
| Categoría | Clips | % |
|---|---|---|
| Transcrito y validado | 1,048 | 99.1% |
| Transcrito pendiente | 0 | 0.0% |
| Sin transcribir | 9 | 0.9% |
| Categoría | Clips | % |
|---|---|---|
| Train | 675 | 63.9% |
| Dev | 235 | 22.2% |
| Test | 138 | 13.1% |
| Sin asignar | 9 | 0.9% |
Cobertura de particiones de entrenamiento: 1,048 de 1,048 clips transcritos y validados (100.0%)
| Categoría | Clips | % |
|---|---|---|
| Validadas | 1,048 | 100.0% |
| Pendientes | 0 | 0.0% |
| Edited | 328 | 31.3% |
A continuación se muestra una selección aleatoria de las preguntas usadas en el corpus.
Nà tiñu kúvi nú sà’a nú, de nàvi?
Á sɨ́ɨ́n kúvi nùù kú’ú’ jin ñuu’ tò’ò, de nàvi?
Nàsa nó’o nú sá nkɨ̀vɨ xínañú’u nú nùù ve’i súkuá’a?
A ká’án nú Tù’un Ñuu Sàvì ve’i sukua’à axín nùù sa’a tíñú nú?
Nà tá’án ini’ nú sìkɨ́ nú de nàvi?
A continuación se muestra una selección aleatoria de respuestas transcritas del corpus.
A kusɨɨ ini vi nuu nakua'a daja iin tu'un va'a ini nuu ntaka ñivɨ ñuu. A suu a kumi daja maa daja jin suu a tyu'un daja yaa sa'a sɨɨ sava kusɨɨ ini ñɨvɨ nenu kuvi nuu iñɨ jɨn satiñu jun.
Kuaa kunee va'a o koo va'a o nuu nee o jen su nejika kumi o kunta'an o jin da ñu'un ñunta'an jin on da tii axin da yuku nuu nee o tyi kumi on majan. Tyi tun sa'a niva'a o yuku jen ntaji ji ka kaji o katyi da ñivɨ ña'nu. Kumi o tiñu sa'a o kuaa tun nuni vi ji jen kumi on majan, tyi yukuan va jinimani jin yo va iyo jo nuu on jen suni kuaa da tii jen suni kumi on ti tyi ntuvi sanaa va iyo ti axin tun jia'an... jia'an... kasa da ñivɨ, da tii jen nejika kumi daja kuaa jia'ni daja da tii tyi suni xinɨ'ɨ o ti jen ntu va'a sukuan na jen ntu tyi a tyu'un va'a kuaa sava kuaa sava ni sa'a o jen sava koo va'a o jin da nee jin on nuu nuku'u.
Vitan jen, iyo kue'i a vixin. Ah... ɨjɨn... Xinatyi da ñivɨ. Jen iyo kue'i kajin. Tyiji a vijin jen iyo tuni kajin. Iyo kue'i kayu. iyo kue'i kijin. Iyo kue'i ñu'un xe'en nuu... nuu niñɨ. Da i'ña vi kue'i iyo nuu ñuu ni.
A kene nijia'a tyi ñuu to'o tyi su ka'an ni tu'n Ñuu Savi nuu, nee ni tee na kenta ni iin ta'an, jini ta'an, ta'an... ñuu o jen suu ka'an ni jin tu'un savi.
A kua nuu nee ni ya'a jen ntu koyo ñu'un ntu naa iin tuno'o iyo majan de yu'u ityi karretera va koyo ñu'un. Tyi ma jie'e a ntanɨ jɨn jen saa vi nuu kunaka ñu'un kua'an de koo maa nuu nee dani ya'a tyi iyo va'a ya'a nee danu kava yukuan va koyo yuu, koyo koo, so ntuvi nuu nee o viji ntu nuu iñɨ nuu nee ve'i, ntu nuu jia'a ñivɨ viji tyi jika vi ju ntu na iyo iin a nasɨ vi'i ya'a tyi ntu nuu natyitu nute vi ya'a de na iyo sa ne tun iyo va'a xini ve'i dani, nee dani ini ve'i dani koo a, kuiñɨ dani ini nute de ku'un dani nuu nute tyi ntuvi, tyi ntuvi na nute ka'nu iyo nuu iyo dani ya'a.
Cada fila de un archivo tsv representa un solo clip de audio, y contiene la siguiente información:
client_id - UUID hasheado de cierto usuario
audio_id - id numérico para archivo de audio
audio_file - nombre del archivo de audio
duration_ms - duración del audio en milisegundos
prompt_id - id numérico para el prompt
prompt - pregunta para el usuario
transcription - transcripción de la respuesta al audio
votes - número de personas quiene aprobaron cierta transcripción
age - edad de los hablantes1
gender - género de los hablantes1
language - nombre de la lengua
split - para el modelado de datos, indica a qué subconjunto de datos pertenece este clip
char_per_sec - cuántos caracteres de transcripción por segundo de audio.
quality_tags - una evaluación automatizada del par transcripción-audio, separadas por |
transcription-length - caracteres por segundo inferior a 3 caracteres por segundo
speech-rate - tasa de caracteres por segundo superior a 30 caracteres por segundo
short-audio - duración del audio inferior a 2 segundos
long-audio - duración del audio superior a 5 minutos
non-allowed-script - la transcripción contiene caracteres de un sistema de escritura no asociado al idioma
mixed-script-words - una sola palabra contiene caracteres de múltiples sistemas de escritura
mixed-script-transcription - la transcripción abarca múltiples sistemas de escritura, pero cada palabra usa uno solo de forma consistente
Este proyecto recibió financiamiento del Open Multilingual Speech Fund gestionado por Mozilla Common Voice.
Este conjunto de datos se publica bajo la licencia Creative Commons Zero (CC-0). Al descargar estos datos usted acepta no determinar la identidad de los hablantes en el conjunto de datos.
Para una lista completa de opciones de edades, generos, y acéntos, ver la especificación demográfica. Esta será reportada únicamente si el hablante aceptó proporcionar dicha información. ↩ ↩2