Release Date: 9/17/2026
Format: MP3
Size: 226.41 MB
A collection of spontaneous responses to questions in Michoacán Mazahua (Jñatjo).
Restrictions/Special Constraints
None provided.
Forbidden Usage
It is forbidden to attempt to determine the identity of speakers in the Common Voice datasets. It is forbidden to re-host or re-share this dataset.
Intended Use
This dataset is intended to be used for training and evaluating automatic speech recognition (ASR) models. It may also be used for applications relating to computer-aided language learning (CALL) and language or heritage revitalisation.
mmc)Esta ficha técnica corresponde a sps-corpus-5.0-2026-09-11 del conjunto de datos Spontaneous Speech (habla espontánea) de Mozilla Common Voice para Jñatjo [Michoacán Mazahua - mmc]. El conjunto de datos contiene 871 representando 11.23 horas de grabaciones (11.23 horas validadas) de 12 hablantes.
La variante de Michoacán de mazahua o ‘Jñatjo’ es hablada en el norte Michoacán, México. Las tenencias donde se habla esta variante son Crescencio Morales, Boca de la Cañada, Rincón de San Mateo, El Tigre, La Barranca, La Dieta, La Fundición, Macho de Agua y Río de Guadalupe. Pertenece a la familia lingüística otomangue, subrama otopameana-central. Los datos obtenidos para este corpus de datos provienen de la tenencia de Crescencio Morales, ubicado en el municipio de Zitácuaro.
Los clips del conjunto de datos se clasifican según el estado de transcripción y la asignación al conjunto de entrenamiento. Las siguientes tablas resumen la distribución.
| Categoría | Clips | % |
|---|---|---|
| Transcrito y validado | 871 | 100.0% |
| Transcrito pendiente | 0 | 0.0% |
| Sin transcribir | 0 | 0.0% |
| Categoría | Clips | % |
|---|---|---|
| Train | 550 | 63.1% |
| Dev | 179 | 20.6% |
| Test | 142 | 16.3% |
| Sin asignar | 0 | 0.0% |
Cobertura de particiones de entrenamiento: 871 de 871 clips transcritos y validados (100.0%)
| Categoría | Clips | % |
|---|---|---|
| Validadas | 871 | 100.0% |
| Pendientes | 0 | 0.0% |
| Edited | 305 | 35.0% |
El Mazahua de Michoacán se escribe utilizando alfabeto latino. Ha habido múltiples propuestas de alfabeto para el Mazahua y sus dos variantes, la del Estado de México (Jñajtro) y la de Michoacán (Jñatjo), las cuales no toman en cuenta los tonos de las palabras habiendo mucha confusión durante la escritura, los tonos de la lengua son sistémicos ya que pueden contrastar funciones gramaticales (posesión, demostrativos, definitud, tiempo, aspecto y modo) y determinar el significado de las palabras
Por ejemplo:
‘kjǚjnü’ metate – ‘kjǜjnü’ maíz
‘‘ë̀dyi’ llevar animales – ‘ ‘ë̂dyi’ medir
Para esta propuesta de alfabeto, se retomará el sugerido por la Universidad Intercultural del Estado de México expuesto en la tesis de Gloria Vargas Bernal (2013). Se tiene la visión de hacerlo más específico en el caso de los tonos.
A continuación se muestra una selección aleatoria de las preguntas usadas en el corpus.
Xi'tsjme jânge gá kjâ'a ímǐzhikjími k'a íjñǐñi?
Jânge ga kjâ'a yá pǎra ná pǔnkü nú tradision à jñǐni?
Nutsʼkʼé péchʼkʼe ín cultura jânge gá kjâʼa.
Na vez yá gí tsʼínchi tī́jī́ kʼa ná sóʼo? Pjéko gí tsʼínchi?
Jânge b'i ch'ǘd'ühi mànge nú mbáxua à jñǐni?
A continuación se muestra una selección aleatoria de respuestas transcritas del corpus.
A... rí kjâ'agö má yá rá 'ób'ü í rá, í rá pö́tp'üji pájnak'a rí xë́'ë má ndémp'a yá rá jé'kja rí jé' má yá rá 'óbü ngé rá juë̌ch'e nú sibi, rá a veces rí 'órü pójo Síño Jêns'e k'a dyák'o sjéts'e k'e dyà ró mí'm'i nú pá'a dyák'a. Í k'a, k'a b'ǚb'ü ná jó'o yó ím pjámilia k'o ín chí'i í méjch'e, k'o 'í í ndzhóm'a ñé k'o mí zǘnk'ü ñeje ndéxe yó të́'ë, rá sípje Siño Jêns'e. Pö̌k'ü Palesito k'a í jésgi ró míjme nú pá'a dyá, í ñe k'a yá rí, rí recibido o ñák'o rá só'o k'o rá 'ä̀jä í nä̀b'ä. Rá 'órü pójo yá rá 'ókü, í'i á... o pjǘndzhé'e ndízik'o yá rá 'óbü, jé rá k'â'a k'o má yá rá 'óbü b'á má yá gó jyâs'ü gá k'átk'o, rá 'órü pójo porque ró jyâsü ná jó'o ngék'o rí kjâ'agö k'o
Nú k'a rá jâ'a rá xôra 'òrá mä̌gä, rá míjmi kja índzúmü ndo rá nú k'o ró 'ínch'ijue ñéji mbéchi k'o rí xíji ndé xí rá má rá mí jích'i yó të́'ë, k'o né'e rá xôra nú jñátjo, k'a rí pára nú k'a í xô'pjü angezeji nú téxe k'o yó të́'ë k'o né'e rá xôrü ngéko rá mâ'a ná mǚnü rá má xô'pjü yó të́'ë rá ñáji jñátjo
Nú jñôna yó ts'ímbáne ní'á'a ngéje b'â'a ñej ts'íjk'e lúlu
*K'a jñíñi, es... ná jó'o yó... yó të̌jë, ndé ná zódyo të̌jë k'e xí b'ǚb'ü zà'a pero yá... núdyà b'ǚb'ü têk'e dyá dyójk'u, dyá rá těs'e yó të́'ë yó zà'a porque ná jó'o yó zá'a k'a të́'ë k'a të̌jë. Yó të́'ë gó k'a dyä̀jk'ä jókà ñô'o rá síb'i, jókà tês'e zà'a rá sā̂ntā à téxe pero ná só'o nú të̌jë porque má yá rá s'ä́n'u nú pá'a cada que pédye kjó'o mí ná... mí ná kjíjmi yó kjó'o k'a të́'ë k'a të̌jë í nú ndáreje ná só'o nú ndáreje dyá nú dyä̀'ä k'a b'ǚb'ü nú ndáreje porque yó të́'ë k'a xíji délegado k'a xíji comisariagö yá... yá yó kjí'i nú tubo k'a para que rá sídyiji nú... nú ndéje nù k'a pédye k'a... k'a k'ój k'a... k'a ndáreje gá sídyi já mánu k'a nú ngǔm'ü. Dyá, dyá yá 'ṓjtjō nú ndáreje yá tês'to yá, yá ts'ík'i né'e k'a kö̌gü k'a jângo mí kjâ'a nú ndáreje, dyá nú dyájkja jé' k'a ngó, yá núdyà jângo yá... yá tés'e yá kjâ'a porque yó të́'ë pues dyà kjâ'a ná jó'o k'ó yó të́'ë gá jango mí ambiciosoji të́'ë pero ñéxtjo ngé angeze k'a para dyákjo kjâji. Dyá nuts'k'ó mí jângo yá... yá mä̂'ä í m'ǚb'ü para que rá kjâji gá kjâ'a *
Yó níts'imi kja jñíñi gó dyä̀t'äji ngó ná pǔnk'ü ndójo ñé' ñóxôma ñé... jñôna nú ndéndzuma ngé... ngéje este... lámina gú b'ǚb'ü ná torre jângo b'ǚb'ü nú tés'i k'a ná zǚnü má m'átüji rá móji míxa ndá b'ǚb'ü ná pǔnk'ü kjǐmi k'o b'ǚb'ü, b'ǚb'ü San Mateo, b'ǚb'ü kí ná Guadalupe ná téxi yó kjǐmi k'o b'ǚb'ü kja jñíñi k'a níts'imi
Cada fila de un archivo tsv representa un solo clip de audio, y contiene la siguiente información:
client_id - UUID hasheado de cierto usuario
audio_id - id numérico para archivo de audio
audio_file - nombre del archivo de audio
duration_ms - duración del audio en milisegundos
prompt_id - id numérico para el prompt
prompt - pregunta para el usuario
transcription - transcripción de la respuesta al audio
votes - número de personas quiene aprobaron cierta transcripción
age - edad de los hablantes1
gender - género de los hablantes1
language - nombre de la lengua
split - para el modelado de datos, indica a qué subconjunto de datos pertenece este clip
char_per_sec - cuántos caracteres de transcripción por segundo de audio.
quality_tags - una evaluación automatizada del par transcripción-audio, separadas por |
transcription-length - caracteres por segundo inferior a 3 caracteres por segundo
speech-rate - tasa de caracteres por segundo superior a 30 caracteres por segundo
short-audio - duración del audio inferior a 2 segundos
long-audio - duración del audio superior a 5 minutos
non-allowed-script - la transcripción contiene caracteres de un sistema de escritura no asociado al idioma
mixed-script-words - una sola palabra contiene caracteres de múltiples sistemas de escritura
mixed-script-transcription - la transcripción abarca múltiples sistemas de escritura, pero cada palabra usa uno solo de forma consistente
Rosario de Fátima Álvarez García <[email protected]>
Juan Castro Gallardo <[email protected]>
Lorena Abigail Benítez Cruz <[email protected]>
Este proyecto recibió financiamiento del Open Multilingual Speech Fund gestionado por Mozilla Common Voice.
Este conjunto de datos se publica bajo la licencia Creative Commons Zero (CC-0). Al descargar estos datos usted acepta no determinar la identidad de los hablantes en el conjunto de datos.
Para una lista completa de opciones de edades, generos, y acéntos, ver la especificación demográfica. Esta será reportada únicamente si el hablante aceptó proporcionar dicha información. ↩ ↩2