Downloads · 30 days
0
Egertekin/custom-bpe-tokenizer
custom-bpe-tokenizer is a machine learning model from Egertekin. Use it for the machine learning task on the model card, and read the license before you ship it in a product. It is set up for transformers.
Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir BPE (Byte-Pair Encoding) Tokenizer modelidir.
Downloads · 30 days
0
Access
Public
Updated Jul 18, 2026
Repo size
—
Likes
1
Public
Click a slice to open those files.
.json653 KB · 99%
From the Hugging Face model README
Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir BPE (Byte-Pair Encoding) Tokenizer modelidir.
Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.
Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.
tokenizers, transformersBu tokenizer, Egertekin/marvel-domain-dataset veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.
Tokenizer, tamamen Hugging Face Hub üzerinde bulunan Egertekin/marvel-domain-dataset veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır.
Model, Hugging Face tokenizers kütüphanesindeki BpeTrainer kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için [UNK] ve doldurma işlemleri için [PAD] gibi özel token'lar tanımlanmıştır.
[PAD], [UNK], [CLS], [SEP], [MASK]ByteLevel(add_prefix_space=False)Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:
from transformers import PreTrainedTokenizerFast
# Tokenizer'ı Hugging Face üzerinden yükleme
tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer")
# Örnek kullanım
ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır."
tokenlar = tokenizer.tokenize(ornek_metin)
print(tokenlar)