Downloads · 30 days
73
0% of all-time downloads
RefalMachine/RuadaptQwen2.5-14B-Instruct
RuadaptQwen2.5-14B-Instruct is a text generation model from RefalMachine. Use it when you need the model to write or continue text. The card lists the license as apache-2.0.
Downloads · 30 days
73
0% of all-time downloads
All-time downloads
23.2K
Public
Parameters
14.7B
29.4 GB on disk
Likes
5
Public
Click a slice to open those files.
.safetensors29.4 GB · 100%
From the Hugging Face model README
WORK IN PROGRESS!!! Текущая версия v1.
Инструктивная версия адаптированной на русский язык модели Qwen2.5-14B. В модели был заменен токенизатор, затем произведено дообучение (Continued pretraining) на русскоязычном корпусе, после чего была применена техника LEP (Learned Embedding Propagation).
Благодаря новому токенизатору (расширенный tiktoken cl100k с помощью униграм токенизатора на 48 т. токенов) скорость генерации* русскоязычных текстов возрасла до 60% по сравнению с исходной моделью Qwen-2.5-14B-Instruct.
*Под скоростью генерации подразумевается количество русскоязычных символов/слов в секунду на одинаковых текстовых последовательностях.
Модель можно попробовать в поднятом Space (внизу в параметрах выбор модели): https://huggingface.co/spaces/RefalMachine/RuadaptQwen2.5


Модель была оценена на Ru-Arena-General, MERA, llmtf_open
Замеры были произведены с использованием оффициального кода лидерборда (https://github.com/VikhrModels/ru_llm_arena), но с repetition_penalty=1.1.
TODO
Для сабмита на MERA был подготовлен кастомный системный промпт, который смягчает недостатки оценки на кодовых задачах. Для сравнения был также сделан сабмит с этим же системным промптом оригинальной модели.
TODO
TODO
Tikhomirov M., Chernyshev D. Facilitating large language model Russian adaptation with Learned Embedding Propagation // 2024 (Preprint: https://arxiv.org/abs/2412.21140)
Tikhomirov M., Chernyshev D. Impact of Tokenization on LLaMa Russian Adaptation //2023 Ivannikov Ispras Open Conference (ISPRAS). – IEEE, 2023. – С. 163-168.
Ответы модели не отражают мнения авторов, а лишь повторяют знания полученные из данных на всех этапах обучения (предобучение, смена токенизатора, обучение на инструкциях, калибровка качества ответов). Модель была получена из сторонней предобученной модели, контроль за предобучением которой не является ответственностью текущих авторов. При создании данной версии модели не производилось никаких дополнительных действий, направленных на изменение заложенных в LLM "мнений". Используйте с осторожностью.