Downloads · 30 days
9
25% of all-time downloads
tomaszki/gemma-g
gemma-g is a text generation model from tomaszki. Use it when you need the model to write or continue text. It is set up for transformers.
should probably proofread and complete it, then remove this comment. --
Downloads · 30 days
9
25% of all-time downloads
All-time downloads
36
Public
Parameters
2.5B
10 GB on disk
Likes
0
Public
Click a slice to open those files.
.bin5 GB · 50%
From the Hugging Face model README
axolotl version: 0.4.0
base_model: 0x0dad0/nous_nb_20
model_type: GemmaForCausalLM
hub_model_id: gemma-g
load_in_8bit: false
load_in_4bit: false
strict: false
datasets:
- path: tomaszki/gemma
- path: tomaszki/gemma-1
- path: tomaszki/gemma-2
- path: tomaszki/gemma-3
- path: tomaszki/gemma-4
- path: tomaszki/gemma-5
- path: tomaszki/gemma-6
- path: tomaszki/gemma-7
- path: tomaszki/gemma-8
- path: tomaszki/gemma-9
- path: tomaszki/gemma-10
- path: tomaszki/gemma-11
- path: tomaszki/gemma-12
- path: tomaszki/gemma-13
- path: tomaszki/gemma-14
- path: tomaszki/gemma-15
- path: tomaszki/gemma-16
- path: tomaszki/gemma-17
- path: tomaszki/gemma-18
- path: tomaszki/gemma-19
- path: tomaszki/gemma-20
- path: tomaszki/gemma-21
- path: tomaszki/gemma-22
- path: tomaszki/gemma-23
- path: tomaszki/gemma-24
- path: tomaszki/gemma-25
- path: tomaszki/gemma-26
- path: tomaszki/gemma-27
- path: tomaszki/gemma-28
- path: tomaszki/gemma-29
- path: tomaszki/gemma-30
- path: tomaszki/gemma-31
- path: tomaszki/gemma-32
- path: tomaszki/gemma-33
- path: tomaszki/gemma-34
- path: tomaszki/gemma-35
- path: tomaszki/gemma-36
- path: tomaszki/gemma-42
val_set_size: 0.0
output_dir: out
sequence_len: 1024
sample_packing: false
wandb_project: axolotl
wandb_entity:
wandb_watch:
wandb_name:
wandb_log_model:
gradient_accumulation_steps: 50
micro_batch_size: 4
num_epochs: 2
optimizer: adamw_hf
lr_scheduler: cosine
learning_rate: 0.000001
cosine_min_lr_ratio: 0.5
max_grad_norm: 0.00001
train_on_inputs: false
group_by_length: false
bf16: true
fp16: false
tf32: false
gradient_checkpointing: false
early_stopping_patience:
resume_from_checkpoint:
local_rank:
logging_steps: 1
xformers_attention:
flash_attention: true
warmup_steps: 0
saves_per_epoch: 1
debug:
deepspeed: #deepspeed_configs/zero2.json
weight_decay: 0.01
fsdp:
fsdp_config:
special_tokens:
</details><br>
This model is a fine-tuned version of 0x0dad0/nous_nb_20 on the None dataset.
More information needed
More information needed
More information needed
The following hyperparameters were used during training: