Skip to content

Instantly share code, notes, and snippets.

View vanIvan's full-sized avatar

Ivan Yakovlev vanIvan

View GitHub Profile
@vanIvan
vanIvan / huggingface_wav2vec_alignment.py
Created June 3, 2022 09:36
Example script to make transcript forced alignment for target speech utterance, and word timestamps generation from ASR predictions, using pretrained wav2vec models from huggingface and ctc-segmentation package.
import torch
import numpy as np
from typing import List
import ctc_segmentation
from datasets import load_dataset
from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC, Wav2Vec2CTCTokenizer
# load model, processor and tokenizer
model_name = "jonatasgrosman/wav2vec2-large-xlsr-53-english"
processor = Wav2Vec2Processor.from_pretrained(model_name)