Downloads · 30 days
17
35% of all-time downloads
Ibrahimsait/Beyefendi
Beyefendi is a text generation model from Ibrahimsait. Use it when you need the model to write or continue text. It is set up for transformers. The card lists the license as other.
Beyefendi, Qwen/Qwen3.5-2B üzerinde küçük bir Türkçe Wikipedia continued pretraining (CPT) aşaması ve temizlenmiş Türkçe Aya instruction verisiyle SFT uygulanmış yaklaşık 2B sınıfı bir Türkçe sohbet modelidir. Bu depo…
Downloads · 30 days
17
35% of all-time downloads
All-time downloads
49
Public
Parameters
1.9B
3.8 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors3.8 GB · 99%
From the Hugging Face model README
Beyefendi, Qwen/Qwen3.5-2B üzerinde küçük bir Türkçe Wikipedia continued
pretraining (CPT) aşaması ve temizlenmiş Türkçe Aya instruction verisiyle SFT
uygulanmış yaklaşık 2B sınıfı bir Türkçe sohbet modelidir. Bu depo,
adaptörlerin birleştirildiği BF16 Transformers artefaktını hedefler.
Bu bir araştırma sürümüdür. Olgusal doğruluk, güvenlik veya yüksek riskli alanlarda uzmanlık garantisi vermez.
Qwen3_5ForCausalLMQwen/Qwen3.5-2BsafetensorsConfig'in yüksek context değeri bu sürümün 262K bağlamda kalite ve bellek bakımından doğrulandığı anlamına gelmez. Ölçümlü kullanım 2K–4K giriş aralığıyla sınırlıdır.
| Aşama | Kaynak | Sabit revizyon | Eğitim kaydı | Kaynak lisans beyanı |
|---|---|---|---|---|
| CPT | wikimedia/wikipedia, 20231101.tr | b04c8d1ceb2f5cd4588862100d08de323dccfbaa | 512 | CC-BY-SA-3.0 / GFDL |
| SFT | CohereLabs/aya_dataset, Türkçe train | f9ea04583f02a8f86404ff6c58bf75fe637df8a2 | 3.877 | Apache-2.0 |
| Değerlendirme | AlicanKiraz0/seneca-trbench | fb56da4150b29464637333e71a73dc88022fb327 | 0 | MIT |
Aya'nın 250 satırlık Türkçe test bölümü yalnız parmak izi karantinası olarak kullanıldı; test ile eşleşen 39 train satırı çıkarıldı. Final train verisi custom Türkçe set, Seneca ve Wikipedia holdout'a karşı tarandı; otomatik raporlarda eşleşme bulunmadı. Bu sonuç her olası semantik bulaşmayı dışlamaz.
Makale düzeyi Wikipedia atıfları
WIKIPEDIA_TRAINING_ATTRIBUTION.jsonl, tam zincir ve dışlanan kaynaklar
PROVENANCE.md içindedir.
Bellek sayıları fiziksel 8 GB kartta ölçülmedi; yalnız raporlanan Torch tepe değerinin 8 GiB altında olduğunu gösterir.
Ayrı bir 1-step QLoRA smoke'u RTX 3090 üzerinde 7,5 GiB CUDA ayırıcı tavanıyla tamamlandı: 4.795.192.832 byte (4,47 GiB) peak allocated ve 4.955.570.176 byte (4,62 GiB) peak reserved. Bu olumlu bir bellek kabul sinyalidir; tam eğitim koşusu veya fiziksel 8 GB kart testi değildir.
| Koşu | Kayıt | Temel | Beyefendi | Not |
|---|---|---|---|---|
| Custom exact match | 15 | %6,67 | %33,33 | Birleştirilmiş model, NF4 |
| Custom token F1 | 15 | %19,61 | %48,15 | Küçük, proje-içi set |
| Seneca choice accuracy | 553 | %54,96 | %61,83 | Final CPT + SFT adapter bileşimi |
| Wikipedia holdout perplexity | 64 | 11,6653 | 10,8680 | Daha düşük daha iyi |
Custom setteki 15 örnek istatistiksel olarak güçlü bir genel kalite iddiası
için yeterli değildir. Tam Seneca final koşusu, yayınlanan birleştirilmiş
dosya yerine CPT-merged modele final SFT adaptörünü takarak çalıştırıldı.
Makinece okunabilir ölçümler ve kaynak rapor karmaları
EVALUATION_SUMMARY.json dosyasındadır.
Qwen/Qwen3-1.7B
70d244cc86ccca08cf5af4e1e306ecf908b1ad5e revizyonu, aynı 1–3B
parametre sınıfında bağımsız rakip olarak indirilmiş ve dosya checksum'ları
doğrulanmıştır. Eşlenik custom15 koşusunda:
| Model | Exact match | Token F1 | Kriter | token/s | Peak VRAM |
|---|---|---|---|---|---|
| Qwen3-1.7B | %0,00 | %12,43 | %40,00 | 15,35 | 1.425.819.648 byte |
| Beyefendi merged | %33,33 | %48,15 | %53,33 | 14,75 | 1.783.161.344 byte |
Beyefendi bu küçük sette daha yüksek görev metrikleri, rakip ise biraz daha yüksek hız ve daha düşük bellek gösterdi. 15 örnek genel veya istatistiksel üstünlük iddiası için yeterli değildir.
Transformers 5.13 veya Qwen3.5 mimarisini destekleyen daha yeni bir sürüm önerilir.
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Ibrahimsait/Beyefendi"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="auto",
)
messages = [{"role": "user", "content": "İstanbul'u iki cümlede tanıt."}]
inputs = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))
Depo herkese açıktır ve dosyalar Hugging Face hesabı olmadan indirilebilir. 8 GB sınıfı kartlarda BF16 yerine bitsandbytes NF4 yükleme yolu önerilir. Ollama tarafında F16, Q4_K_M'ye göre tercih edilir; ancak 24 Temmuz 2026'daki ek deterministik olgu kontrolünde F16 da yanlış yanıt verdiği için iki GGUF sürümü de deneysel kabul edilmelidir.
15852e8c16360a2fea060d615a32b45270f8a8fc revizyonuna sabittir ve
yerel cache/tokenizer kaydıyla tutarlıdır. Final eğitim özeti bu SHA'yı
ayrıca tekrarlamaz.Hub metadata'sındaki license: other, lisans kararının açık olduğunu
belirtir; kullanıcıya yeni bir lisans hakkı vermez. Qwen temel modeli
Apache-2.0'dır ve ilgili metin LICENSE-APACHE-2.0-BASE.txt olarak eklenir.
SFT kaynağı Apache-2.0, Wikipedia CPT kaynağı CC-BY-SA-3.0/GFDL soyundadır.
Model ağırlıkları için nihai dağıtım şartları ve Wikipedia
atıf/share-alike/GFDL etkisi hâlâ incelenmektedir. Public erişim, kullanıcıya
bu ağırlıkları yeniden kullanma veya yeniden dağıtma konusunda ek bir lisans
hakkı verildiği anlamına gelmez.