Downloads · 30 days
16
31% of all-time downloads
ULFBERTO/OxideLLM_TK_SSM_V1
OxideLLM_TK_SSM_V1 is a text generation model from ULFBERTO. Use it when you need the model to write or continue text. The card lists the license as mit.
🦀 Transformer Killer - Un modelo experimental basado en State Space Models (SSM)
Downloads · 30 days
16
31% of all-time downloads
All-time downloads
51
Public
Repo size
9.3 MB
Likes
0
Public
Click a slice to open those files.
.pth9.3 MB · 100%
From the Hugging Face model README
🦀 Transformer Killer - Un modelo experimental basado en State Space Models (SSM)
Este modelo utiliza una arquitectura SSM (State Space Model) inspirada en Mamba, que reemplaza el mecanismo de atención de los Transformers tradicionales con un escaneo secuencial selectivo de complejidad O(n) lineal.
| Aspecto | Transformer | SSM |
|---|---|---|
| Complejidad | O(n²) | O(n) |
| Memoria | Crece cuadráticamente | Crece linealmente |
| Contexto largo | Costoso | Eficiente |
import torch
from model import TransformerKiller
from tokenizer import CharacterTokenizer
# Cargar checkpoint
cp = torch.load("ssm_checkpoint.pth", map_location="cpu")
# Reconstruir tokenizer
tokenizer = CharacterTokenizer()
tokenizer.chars = cp['tokenizer_chars']
tokenizer.vocab_size = len(tokenizer.chars)
tokenizer.stoi = {ch: i for i, ch in enumerate(tokenizer.chars)}
tokenizer.itos = {i: ch for i, ch in enumerate(tokenizer.chars)}
# Cargar modelo
model = TransformerKiller(
vocab_size=tokenizer.vocab_size,
dim=128,
n_layers=4,
state_dim=16
)
model.load_state_dict(cp['model_state_dict'])
model.eval()
# Generar texto
def generate(prompt, max_tokens=100):
idx = torch.tensor([tokenizer.encode(prompt)], dtype=torch.long)
with torch.no_grad():
for _ in range(max_tokens):
logits = model(idx)[:, -1, :]
probs = torch.softmax(logits / 0.8, dim=-1)
idx = torch.cat((idx, torch.multinomial(probs, 1)), dim=1)
return tokenizer.decode(idx[0].tolist())
print(generate("Hola"))
ssm_checkpoint.pth - Checkpoint del modelo (pesos + tokenizer)model.py - Arquitectura SSMtokenizer.py - Tokenizer a nivel de carácterchat.py - Script de chat interactivo⚠️ Este es un modelo experimental y educativo con solo ~770K parámetros. No está diseñado para uso en producción. Las respuestas pueden ser incoherentes.
MIT License
Entrenado con 🔥 usando PyTorch + CUDA