Downloads · 30 days
0
0-hero/indic-vocab-only
indic-vocab-only is a machine learning model from 0-hero. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
This is not a model, just a BPE tokenizer (fallback enabled) vocab files trained on 12 Indian languages ( a few billion tokens ). 16k extra tokens. Reduces tokens by 50-60% for some languages
Downloads · 30 days
0
Access
Public
Updated Mar 3, 2024
Repo size
331 KB
Likes
0
Public
Click a slice to open those files.
.model331 KB · 52%
From the Hugging Face model README
This is not a model, just a BPE tokenizer (fallback enabled) vocab files trained on 12 Indian languages ( a few billion tokens ). 16k extra tokens. Reduces tokens by >50-60% for some languages
from transformers import AutoModel, AutoTokenizer
import sentencepiece as spm
model = AutoModel.from_pretrained("model_path")
tokenizer = AutoTokenizer.from_pretrained("model_path")
vocabulary = tokenizer.get_vocab().keys()
sp = spm.SentencePieceProcessor(model_file='tok16000.model')
new_vocab = [sp.id_to_piece(id) for id in range(sp.get_piece_size())]
new_tokens = set(new_vocab) - set(tokenizer.vocab.keys())
tokenizer.add_tokens(list(new_tokens))
model.resize_token_embeddings(len(tokenizer))
model.save_pretrained("model_extended_vocab")
tokenizer.save_pretrained("model_extended_vocab")