Наши требования
Опыт работы с задачами ASR и/или TTS в ML-продуктах
Уверенное знание Python, PyTorch / TensorFlow
Опыт с open-source решениями (Whisper, ESPNet, Mozilla TTS, Coqui, etc.)
Знание алгоритмов работы с аудио: FFT, MelSpectrogram, MFCC и т.п.
Навыки оптимизации inference (ONNX, quantization, streaming)
Понимание задач real-time распознавания
Опыт от 2-3 года в ML или DS проектах с голосом
Опыт развертывания моделей в реальном времени (в т.ч. на GPU / edge)
Опыт с NeMo, HuggingFace Audio, Transformers (TTS/ASR модули)
Работа с облачными STT/TTS API и кастомизация поверх них