Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
-
Updated
Sep 21, 2026 - Python
Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.
Fun-ASR speech recognition models, with native Hugging Face Transformers support for Fun-ASR-Nano and separate FunASR, vLLM and llama.cpp deployment paths.
High-performance Google Colab Notebook for fast & accurate audio transcription/translation using OpenAI Whisper. Accelerated on TPUs with PyTorch/XLA. Features an interactive UI for model selection, multi-language support, and long-form audio processing.
Lightweight real-time ASR powered by a Microsoft offline speech recognition model. CPU-only, supporting 10 languages, Windows, Linux, macOS, and C#, C++, Python SDKs. 基于微软离线语音识别模型的轻量级实时 ASR,纯 CPU 运行,支持 10 种语言及 Windows、Linux、macOS,提供 C#、C++ 和 Python SDK。
本地优先的 AI 双语字幕工作台:WhisperX/MLX 转录、智能断句、上下文翻译与字幕编辑,支持 macOS 和 Windows。
Point of Interest Error Rate (PIER) Metric for Code-Switching ASR: A specialized evaluation metric designed to focus on critical points in multilingual speech recognition, providing a more accurate analysis of code-switched utterances.
Real-time transformer-based ASR supporting 100+ languages - Google Cloud integration with noise cancellation & low-latency optimization
AISRT - 本地 AI 字幕生成工具 / local AI subtitle generator for video/audio to SRT, multilingual ASR, timestamp alignment, GUI/CLI batch processing, and local SRT translation.
Code-switching ASR adaptation for strong multilingual speech recognition models. Synthetic CSW data generation, Whisper adaptation, Bayesian LoRA (BLoRA), and robust multilingual ASR evaluation.
Benchmarking AI4Bharat IndicConformer ASR across major Indian languages using the Kathbath dataset and Word Error Rate (WER).
Evidence-preserving transcription for Hokkien, Singlish, Mandarin and English—multilingual ASR, diarization, cost controls, provenance and human review.
To associate your repository with the multilingual-asr topic, visit your repo's landing page and select "manage topics."