Downloads · 30 days
4
31% of all-time downloads
max-hertz-06/joke-generator
joke-generator is a machine learning model from max-hertz-06. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
This model has been pushed to the Hub using the PytorchModelHubMixin integration: - Library: [More Information Needed] - Docs: [More Information Needed]
Downloads · 30 days
4
31% of all-time downloads
All-time downloads
13
Public
Parameters
81.3M
325 MB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors325 MB · 100%
How the weights are stored.
F3281.1M · 100%
From the Hugging Face model README
This model has been pushed to the Hub using the PytorchModelHubMixin integration:
language:
🃏 Нейросетевая модель для генерации русских анекдотов на основе архитектуры Transformer
Модель представляет собой Transformer с поддержкой современных техник:
Обучена на датасете Russian Jokes
Доступные конфигурации:
model_configs = {
"nano": TransformerConfig(n_layer=3, n_head=4, n_kv_head=2, hidden_dim=96, intermediate_dim=256),
"mini": TransformerConfig(n_layer=6, n_head=6, n_kv_head=3, hidden_dim=384, intermediate_dim=1024),
"small": TransformerConfig(n_layer=12, n_head=12, n_kv_head=6, hidden_dim=768, intermediate_dim=2048),
}
Основные компоненты:
Токенизатор: Byte-level BPE с специальными токенами
Регуляризация: Dropout (0.1), RMSNorm
Оптимизация: AdamW с весом decay 0.01
Использование
Пример генерации текста:
from transformers import PyTorchModelHubMixin
from model import TransformerForCausalLM, ByteLevelBPETokenizer
# Загрузка модели и токенизатора
tokenizer = ByteLevelBPETokenizer.from_pretrained("ваш_username/llm-course-hw1")
model = TransformerForCausalLM.from_pretrained("ваш_username/llm-course-hw1")
# Генерация текста
text = "Штирлиц вышел из дома"
input_ids = tokenizer.encode(text)
output = model.generate(
torch.tensor([input_ids]),
max_new_tokens=100,
eos_token_id=tokenizer.eos_token_id,
temperature=0.7,
do_sample=True
)
print(tokenizer.decode(output[0].tolist()))
Обучение
Параметры обучения:
Learning rate: 3e-4
Batch size: 16
Контекст: 128 токенов
Общее шагов: 10,000
Град клиппинг: 1.0
Инфраструктура:
Устройство: GPU (CUDA) / MPS / CPU
Репозиторий: HuggingFace Hub
Результаты
Метрики:
Средняя длина токенов на текст: ~70
Validation loss: ~3.77 (для конфигурации small)
Штирлиц пришел домойБел на банк и говорит:- Порщик, существом?- Мнее, а ты мне сейчас сегодня вечером?- Нет, я тебе волний стором. Там сейчас идутый вдруг, а нее...