MirasAI
- United States
- mirasai.net/
- Llc
About MirasAI
MirasAI LLC
About Us
MirasAI LLC is an NLP research company dedicated to advancing language technology for underserved South Asian languages: Urdu, Punjabi, Saraiki, Sindhi, Pashto, Balochi, Burushaski, and others. Based in Indiana, we develop high-quality datasets and AI tools that serve researchers, developers, and communities across South Asia.
Our Mission
To democratize language technology for low-resource South Asian languages, enabling equitable AI development and ensuring these communities benefit from the language resources they create.
What We Do
Research & Data: High-quality NLP datasets across speech, text, and multimodal domains (ASR, TTS, speech emotion recognition, linguistic annotation).
Technology Services: Custom AI solutions for organizations working in South Asia.
Recent Work
Burushaski–English Speech Translation Corpus (15 hours, 14,970 utterances)
Karachi Colloquial Urdu Speech Dataset (50-hour collection)
Punjabi Multimodal Dataset (113 prompts, 10+ hours)
Hazargi Multimodal Dataset (181 video segments)
Why We Share on Mozilla Data Collective
We publish on MDC because it aligns with our values: open access, community accountability, and ethical data governance. Publishing here ensures researchers worldwide can access language resources equitably, elevates South Asian language visibility globally, and builds critical infrastructure for underserved research communities.
All our datasets follow rigorous ethical standards including community consent, fair contributor compensation, and transparent documentation.
Contact: mirasai.net | Meesum Alam, Director
Datasets
| Bangladesh Traffic Signs Dataset | CC-BY-NC-4.0 | ben, eng | CV | JSON, JPEG | 1.35 GB |
| Chittagonian (চাটগাঁইয়া, saṭgãia) Text Corpus | CC-BY-NC-SA-4.0 | ctg | NLP | TXT | 6.59 MB |
| Gujarati News and Blogs Corpus | CC-BY-NC-4.0 | guj | NLP | TXT | 18.93 MB |
| Hindi Literature & News Corpus | CC-BY-NC-SA-4.0 | hin | NLP | TXT | 19.52 MB |
| India Traffic Signs Dataset | CC-BY-ND-4.0 | NA | CV | JPEG, JSON | 190.44 MB |
| Kannada Text Corpus | CC-BY-NC-SA-4.0 | kan | NLP | TXT | 2.61 MB |
| Kannada Time Aligned Speech Corpus | CC-BY-NC-SA-4.0 | kan | ASR | OGG, SRT | 355.77 MB |
| Marathi Blog & Literature Corpus | CC-BY-NC-4.0 | mar | NLP | TXT | 4.20 MB |
| Multispeaker Hindi ASR Dataset | CC-BY-NC-SA-4.0 | hin | ASR | OGG , SRT | 63.03 MB |
| Noakhalian (নোয়াখাইল্লা) Text Corpus | CC-BY-NC-4.0 | oak | NLP | TXT, DOCX | 3.61 MB |
| Pakistan Traffic Signs Dataset | CC-BY-NC-4.0 | urd, eng | CV | JPEG, JSON | 2.64 GB |
| Punjabi 10 Hours TTS | CC-BY-NC-SA-4.0 | pnb | TTS | WEBM, TSV | 481.96 MB |
| Rangpuri (অংপুরি Ôṅgpuri) Text Corpus | CC-BY-NC-4.0 | rkt | NLP | TXT | 3.68 MB |
| Rohingya Literature Corpus | CC-BY-NC-4.0 | rhg | NLP | TXT, DOCX | 7.01 MB |
| Saraiki 10 Hours TTS Dataset | CC-BY-NC-SA-4.0 | srk | TTS | WEBM, TSV | 584.44 MB |
| Sylheti Text Corpus by Haque Publishers | CC-BY-NC-4.0 | syl | NLP | TXT | 3.53 MB |
| Tamil Literature Corpus | CC-BY-NC-SA-4.0 | tam | NLP | TXT | 41.85 MB |
| Tamil Time Aligned Speech Dataset | CC-BY-NC-SA-4.0 | tam | ASR | OGG, SRT | 37.11 MB |
| Telugu Text Corpus | CC-BY-NC-SA-4.0 | tel | NLP | TXT | 19.87 MB |
| 🚧 Noakhali 10 Hours TTS (Male Speaker) 🚧 | MirasAI Data License | oak | TTS | WAV, TSV | 2.87 GB |