Downloads · 30 days
5
8% of all-time downloads
DATA-ADAPT/full-sft
full-sft is a machine learning model from DATA-ADAPT. Use it for the machine learning task on the model card, and read the license before you ship it in a product. It is set up for peft.
Offline training on the full dataset (100%) with BM25-retrieved data.
Downloads · 30 days
5
8% of all-time downloads
All-time downloads
63
Public
Repo size
537 MB
Likes
0
Public
Click a slice to open those files.
.safetensors537 MB · 100%
From the Hugging Face model README
Offline training on the full dataset (100%) with BM25-retrieved data.
Note: This checkpoint is from a single random seed (seed=3) and a specific training step (step 4220). Results may vary across seeds.
| Key | Value |
|---|---|
| Base model | meta-llama/Llama-2-7b-hf |
| Task | MMLU |
| Data selection | Full SFT (BM25) |
| Data ratio | 100% |
| Online | False |
| LoRA rank | 128 |
| LoRA alpha | 512 |
| Target modules | q_proj, k_proj, v_proj, o_proj |
| Seed | 3 |
| Checkpoint step | 4220 |
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-7b-hf")
model = PeftModel.from_pretrained(base_model, "DATA-ADAPT/full-sft")
tokenizer = AutoTokenizer.from_pretrained("DATA-ADAPT/full-sft")