Tools

The toolchain that turns recordings into working models.

Every dataset we deliver passes through the same set of tools — built for low-resource languages, unreliable connectivity, and community reviewers who are not engineers.

Learning

ShabdPatra

Flip-card explorer for alphabets, numerals, words, phrases, idioms and proverbs across 14 languages of Nepal.

Open tool

Collection

Voice Capture Studio

Browser recording workflow with prompt scripts, live level monitoring, retakes and per-clip consent capture.

Available to partners

Annotation

Transcription & Alignment Desk

Audio-to-text workbench with timestamp alignment, dual-review validation and dialect tagging.

Available to partners

Data

Corpus Manager

Versioned datasets with speaker metadata, license terms, quality scores and export to training formats.

Available to partners

Evaluation

Benchmark Runner

Standard ASR (WER/CER) and translation (BLEU/chrF) evaluation on held-out sets for every supported language.

Available to partners

Deployment

Chatbot Sandbox

Test written and spoken conversation with fine-tuned models before shipping them into a product.

Available to partners

Pipeline view

Where each tool sits

Collect

  • Voice Capture Studio
  • ShabdPatra

Refine

  • Transcription & Alignment Desk
  • Corpus Manager

Ship

  • Benchmark Runner
  • Chatbot Sandbox

Want access to the toolchain?

Partners and research groups can run their own collection programmes on Sabdakunja tooling, with our team supporting quality review.

Request access