Downloads · 30 days
106
43% of all-time downloads
Darmm/darmm-embedding-multilingual
darmm-embedding-multilingual is a sentence similarity model from Darmm. Use it when you need a score for how close two texts are. The card lists the license as apache-2.0.
Multilingual embedding model (Kazakh/Russian/English) fine-tuned from BAAI/bge-m3 for Darmm FAQ and product content retrieval.
Downloads · 30 days
106
43% of all-time downloads
All-time downloads
244
Public
Parameters
568M
2.3 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors2.3 GB · 99%
From the Hugging Face model README
Multilingual embedding model (Kazakh/Russian/English) fine-tuned from BAAI/bge-m3 for Darmm FAQ and product content retrieval.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("Darmm/darmm-embedding-multilingual")
sentences = ["Darmm қызметтері қандай?", "What services does Darmm provide?"]
embeddings = model.encode(sentences)
print(embeddings.shape)
BAAI/bge-m3.MultipleNegativesRankingLoss (default in scripts/train_embeddings.py).epochs=3, batch_size=2, max_seq_length=128.Evaluation uses paraphrased FAQ questions mapped to the FAQ corpus:
data/faq_chunks.jsonl (369 chunks)data/eval_questions.jsonl (90 questions)We present a multilingual embedding model fine‑tuned for Darmm FAQ and product knowledge retrieval in Kazakh, Russian, and English. The model is based on BAAI/bge-m3 and trained on Darmm website content and a handcrafted FAQ corpus. We evaluate on paraphrased FAQ questions mapped to the FAQ corpus.
data/faq_chunks.jsonl.BAAI/bge-m3MultipleNegativesRankingLossepochs=3, batch_size=2, max_seq_length=128Evaluation on data/eval_questions.jsonl (90 paraphrased queries) against the FAQ corpus:
Бұл модель Darmm‑ның FAQ және өнім білім базасын қазақ, орыс және ағылшын тілдерінде іздеуге арналған. Негізі BAAI/bge-m3, оқыту Darmm сайт контенті мен қолмен жасалған FAQ жиынына жүргізілді. Бағалау парафраз сұрақтар арқылы жасалды.
data/faq_chunks.jsonl ішінде 369 чанк.BAAI/bge-m3MultipleNegativesRankingLossepochs=3, batch_size=2, max_seq_length=128data/eval_questions.jsonl (90 парафраз сұрақ) арқылы бағалау:
Модель предназначена для поиска по FAQ и базе знаний Darmm на казахском, русском и английском. Основана на BAAI/bge-m3 и дообучена на локальном контенте сайтов Darmm и ручном FAQ‑корпусе. Оценка проводится на перефразированных вопросах.
data/faq_chunks.jsonl.BAAI/bge-m3MultipleNegativesRankingLossepochs=3, batch_size=2, max_seq_length=128Оценка на data/eval_questions.jsonl (90 перефразированных запросов):