Downloads · 30 days
604
28% of all-time downloads
kirilldual0987/MIXdevAI-llama-quantized
MIXdevAI-llama-quantized is a machine learning model from kirilldual0987. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
Данный репозиторий содержит полный набор GGUF-квантов оригинальной модели Kolyadual/MIXdevAI-llama.
Downloads · 30 days
604
28% of all-time downloads
All-time downloads
2.1K
Public
Parameters
1.2B
19.6 GB on disk
Likes
0
Public
Click a slice to open those files.
.gguf17.1 GB · 87%
From the Hugging Face model README
Данный репозиторий содержит полный набор GGUF-квантов оригинальной модели Kolyadual/MIXdevAI-llama.
MIXdevAI-llama — это легковесная ИИ-модель (1B параметров) на базе Llama 3 из семейства Newton bot, созданная автором Kolyadual. Модель представляет собой слияние (merge) двух архитектур с использованием метода SLERP (dtype: bfloat16):
meta-llama/Llama-3.2-1B-Instruct (Base)KingNish/Reasoning-Llama-1b-v0.1Все файлы в этом репозитории конвертированы и квантованы с помощью актуальной версии llama.cpp для быстрого локального запуска (Ollama, LM Studio, llama.cpp) на любых устройствах: CPU, Apple Silicon (Metal) и GPU.
Все готовые файлы лежат в папке gguf. Ниже приведена шпаргалка, которая поможет выбрать нужный формат под ваши задачи и объем оперативной памяти:
| Формат | Описание и рекомендации по использованию |
|---|---|
| F16 | Оригинальные веса без сжатия. Максимальное качество, требует больше всего RAM/VRAM. |
| Q8_0 | 8-bit квантование. Практически неотличимо от F16, отличная скорость. |
| Q6_K | Очень высокое качество, минимальные потери. |
| Q5_K_M / Q5_K_S | Отличный баланс между размером и сохранением "интеллекта" модели. |
| Q4_K_M | 🏆 Рекомендуемый. Золотая середина для большинства задач и устройств. |
| Q4_K_S / Q4_0 / Q4_1 | Хорошее сжатие с приемлемым качеством. |
| Q3_K_M / Q3_K_S | Заметное сжатие, подходит для слабых устройств, возможны легкие потери в сложной логике. |
| Q2_K | Экстремальное сжатие (2-bit). Модель сильно теряет в качестве, использовать только при жестких ограничениях памяти. |
| IQ-серия <br>(IQ1_S - IQ4_NL) | Инновационные форматы llama.cpp (Importance Matrix). Обеспечивают лучшее качество при экстремально малых размерах (особенно IQ3_XS, IQ4_NL). Идеально для смартфонов. |
Оригинальный YAML-конфиг слияния, safetensors и подробные инструкции по использованию базовой модели через Transformers доступны в оригинальном репозитории автора.