Downloads · 30 days
24.7K
14% of all-time downloads
d0rj/rut5-base-summ
rut5-base-summ is a summarization model from d0rj. Use it when you need a shorter version of a longer text. It is set up for transformers.
Finetuned ai-forever/ruT5-base for text and dialogue summarization.
Downloads · 30 days
24.7K
14% of all-time downloads
All-time downloads
182K
Public
Parameters
223M
1.8 GB on disk
Likes
27
Public
Click a slice to open those files.
.bin892 MB · 50%
From the Hugging Face model README
Finetuned ai-forever/ruT5-base for text and dialogue summarization.
All 'train' subsets was concatenated and shuffled with seed 1000 - 7.
Train subset = 155678 rows.
Evaluation on 10% of concatenated 'validation' subsets = 1458 rows.
See WandB logs.
See report at REPORT WIP.
Scheduler, optimizer and trainer states are saved into this repo, so you can use that to continue finetune with your own data with existing gradients.
from transformers import pipeline
pipe = pipeline('summarization', model='d0rj/rut5-base-summ')
pipe(text)
from transformers import T5Tokenizer, T5ForConditionalGeneration
tokenizer = T5Tokenizer.from_pretrained('d0rj/rut5-base-summ')
model = T5ForConditionalGeneration.from_pretrained('d0rj/rut5-base-summ').eval()
input_ids = tokenizer(text, return_tensors='pt').input_ids
outputs = model.generate(input_ids)
summary = tokenizer.decode(outputs[0], skip_special_tokens=True)