NeMo-based speech pipeline with Wake Word detection, VAD, and ASR. It requires very bare minimum dependencies, and I like it this way. Completely useless outside our settings.
- PortAudio C lib (sudo apt-get install portaudio19-dev)
- torch >= 2.7
- numpy
- sounddevice Clean API, callback-based, low-latency, better than pyaudio from my experience with less clunkier API
Put your weights under weights/ directory.
bash setup.sh
source .venv/bin/activate
eic-speech-nemo(Install PortAudio beforehands)
# sudo apt-get install portaudio19-dev
pip install -e .from eic_speech_nemo import ASRServer, State
from eic_speech_nemo.server import ASRConfig
server = ASRServer(config=ASRConfig(model_dir="./models"))
server.start()
server.run_forever()