Downloads · 30 days
18
47% of all-time downloads
Leonardo1324/test-model-clean
test-model-clean is a machine learning model from Leonardo1324. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
Modello linguistico decoder-only (~134M parametri), architettura stile Llama in miniatura: RoPE, SwiGLU, RMSNorm, scritto da zero in PyTorch.
Downloads · 30 days
18
47% of all-time downloads
All-time downloads
38
Public
Parameters
134M
536 MB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors536 MB · 100%
From the Hugging Face model README
Modello linguistico decoder-only (~134M parametri), architettura stile Llama in miniatura: RoPE, SwiGLU, RMSNorm, scritto da zero in PyTorch.
model.safetensors: pesi del modelloconfig.json: iperparametri architetturatokenizer.json: tokenizer BPE (formato HuggingFace tokenizers)Richiede il codice di architecture.py (definizione del modello) dal repo GitHub del progetto.
Non è compatibile con transformers.AutoModel — è un'architettura custom, non uno dei modelli standard della libreria.
from safetensors.torch import load_file
from architecture import TransformerLM
import json
with open("config.json") as f:
cfg = json.load(f)
model = TransformerLM(
vocab_size=cfg["vocab_size"], d_model=cfg["d_model"], n_layers=cfg["n_layers"],
n_heads=cfg["n_heads"], ffn_hidden=cfg["ffn_hidden"], context_len=cfg["context_len"],
rope_theta=cfg["rope_theta"], rmsnorm_eps=cfg["rmsnorm_eps"], tie_embeddings=cfg["tie_embeddings"],
)
state_dict = load_file("model.safetensors")
model.load_state_dict(state_dict)
Modello di piccola scala addestrato su risorse consumer (dataset di pre-training limitato, ~1B token). Non affidabile per fatti specifici/enciclopedici, tende a generalizzare verso i pattern più frequenti visti in fine-tuning invece di rispondere in modo mirato a domande fuori dal dominio del dataset SFT.