Downloads ยท 30 days
22
28% of all-time downloads
Lyon28/caca-650M-untrained
caca-650M-untrained is a text generation model from Lyon28. Use it when you need the model to write or continue text. It is set up for transformers. The card lists the license as apache-2.0.
Downloads ยท 30 days
22
28% of all-time downloads
All-time downloads
80
Public
Parameters
527M
1.1 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors1.1 GB ยท 100%
From the Hugging Face model README
<img src="https://img.shields.io/badge/Status-Untrained%20(Weights%20Ready)-orange?style=for-the-badge" alt="Status"/>
526,860,267 parameters โข 527M โข 20 layers โข 8,192 tokens (efektif 32,768 dgn YaRN)
๐ Dokumentasi โข ๐ป Usage โข โ๏ธ Konfigurasi โข ๐ฌ Arsitektur
</div>Status Model:
initializer_range=0.02)| โ Bisa | โ Belum Bisa |
|---|---|
| Load model architecture | Generate teks bermakna |
| Test forward pass | Menjawab pertanyaan |
| Measure memory & speed | Reasoning & understanding |
| Mulai pretraining dari nol | Production deployment |
Caca adalah arsitektur Large Language Model (LLM) yang menggabungkan Multi-head Latent Attention (MLA) ala DeepSeek-V2/V3, Multi-Token Prediction (MTP), QK-Normalization, dan sliding window attention berselang-seling โ dirancang untuk efisiensi KV cache dan skalabilitas dari model kecil (~650M) sampai sangat besar (1T+).
<blockquote style="border-left:4px solid #4A90E2;padding-left:16px;margin:16px 0;background:#f8f9fa;padding:12px;"> <p><strong>๐ Tentang Project Caca</strong></p> <p><em>Caca</em> adalah eksperimen open-source Indonesian LLM yang dibuat dari nol secara individual dan bertahap. Bukan kompetitor siapa-siapa, cuma pengen eksplorasi apa yang bisa dilakukan dengan budget terbatas, passion unlimited, dan mindset collaborative.</p> <p>Kalau berguna buat orang lain, alhamdulillah. Kalau enggak, ya tetap fun kok.</p> <p>โ <strong>Lyon</strong>, Creator</p> </blockquote>๐ก KV cache MLA jauh lebih kecil drpd attention standar karena cuma nyimpen
kv_lora_rank + qk_rope_head_dim(245 dim) per token, bukannum_heads ร head_dimpenuh. Pada 8K context, KV cache ~0.080 GB.
from transformers import AutoConfig, AutoModelForCausalLM
import torch
config = AutoConfig.from_pretrained("Lyon28/caca-650M-untrained", trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
"Lyon28/caca-650M-untrained",
config=config,
trust_remote_code=True,
torch_dtype=torch.bfloat16,
device_map="auto"
)
print(f"Model loaded: {model.num_parameters():,} parameters")
print("โ ๏ธ Model ini UNTRAINED โ output belum bermakna")
from transformers import AutoModelForCausalLM, BitsAndBytesConfig
import torch
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True
)
model = AutoModelForCausalLM.from_pretrained(
"Lyon28/caca-650M-untrained",
trust_remote_code=True,
quantization_config=bnb_config,
device_map="auto"
)
print(f"Memory footprint: ~0.28GB (4-bit)")
from transformers import TrainingArguments, Trainer
training_args = TrainingArguments(
output_dir="./output",
per_device_train_batch_size=1,
gradient_accumulation_steps=16,
learning_rate=3e-4,
max_steps=10000,
lr_scheduler_type="cosine",
warmup_steps=500,
bf16=True,
gradient_checkpointing=True,
)
trainer = Trainer(model=model, args=training_args, train_dataset=train_dataset)
trainer.train()
Weight tersimpan dalam satu file <code>model.safetensors</code>.
Tidak ada metrik training (loss, wandb, tensorboard) โ ini adalah base architecture release untuk dipakai sebagai titik awal pretraining dari nol.
Model ini dirilis di bawah Apache License 2.0 โ bebas dipakai, dimodifikasi, dan didistribusikan (dengan attribution), disediakan "as is" tanpa warranty.
๐ "Dari nol, untuk semua" ๐
</div>