Downloads · 30 days
0
fhenrivx/KIDBERT
KIDBERT is a token classification model from fhenrivx. Use it when you need labels on individual words, such as names. It is set up for adapter-transformers. The card lists the license as apache-2.0.
KDBERT: MODELO BASEADO EM TRANSFORMADORS PARA COMPREENSÃO DA LÍNGUA KIKONGO
Downloads · 30 days
0
Access
Public
Updated Dec 14, 2025
Repo size
1.3 GB
Likes
1
Public
Click a slice to open those files.
.zip1.3 GB · 100%
From the Hugging Face model README
KDBERT: MODELO BASEADO EM TRANSFORMADORS PARA COMPREENSÃO DA LÍNGUA KIKONGO
KDBERT: TRANSFORMER-BASED MODEL FOR UNDERSTANDING THE KIKONGO LANGUAGE
language: -pt # Português (ISO 639-1) tags:
KiDBERT é o primeiro modelo Transformer desenvolvido especificamente para a língua Kikongo, baseado na arquitetura DISTILBERT.
O modelo foi treinado com um grande corpus textual de Kikongo, incluindo dados linguísticos, morfológicos e contextuais, provenientes de textos literários, religiosos e culturais.
O backbone é a espinha dorsal do modelo — a parte responsável por extrair representações (features) linguísticas a partir do texto.
No KiDBERT, o backbone é o DISTILBERT, que foi adaptado e reentreinado com o corpus Kikongo para aprender as dependências e estruturas linguísticas dessa língua.
O modelo foi treinado com o Kikongo Corpus, um conjunto cuidadosamente compilado com mais de 150.000 palavras, incluindo variantes regionais como:
O corpus abrange textos religiosos, literários, conversacionais e educacionais, permitindo uma cobertura lexical e morfológica ampla da língua Kikongo.
Classe Precisão Revocação F1-score Suporte ADJ 0.82 0.94 0.87 65 ADV 0.94 0.82 0.87 81 CONJ 0.99 1.00 0.99 92 INTERJ 0.91 0.84 0.87 90 NUM 1.00 0.99 0.99 75 PREP 0.92 0.90 0.91 146 PRON 0.99 1.00 0.99 70 SUBST 0.98 1.00 0.99 75 VERB 0.97 0.99 0.98 70
Esses resultados mostram que o modelo atinge um bom nível de compreensão linguística e coerência textual, considerando a complexidade morfológica do Kikongo.


from transformers import AutoTokenizer, AutoModelForMaskedLM
import torch
# Carregar o modelo e o tokenizer
tokenizer = AutoTokenizer.from_pretrained("fhenrivx/KIDBERT")
model = AutoModelForMaskedLM.from_pretrained("fhenrivx/KIDBERT")
# Exemplo de frase
text = "Nzambi ke __ bantu yandi."
# Tokenização
inputs = tokenizer(text, return_tensors="pt")
# Predição
with torch.no_grad():
outputs = model(**inputs)
predictions = torch.argmax(outputs.logits, dim=-1)
# Resultado
predicted_token = tokenizer.decode(predictions[0])
print(predicted_token)