Downloads · 30 days
72
26% of all-time downloads
eugene702/Automatic-Scoring
Automatic-Scoring is a sentence similarity model from eugene702. Use it when you need a score for how close two texts are. It is set up for sentence-transformers. The card lists the license as apache-2.0.
Model ini merupakan hasil fine-tuning dari indobenchmark/indobert-large-p2 menggunakan Sentence Transformers untuk tugas Semantic Textual Similarity (STS) dalam bahasa Indonesia.
Downloads · 30 days
72
26% of all-time downloads
All-time downloads
282
Public
Parameters
335M
1.3 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors1.3 GB · 100%
From the Hugging Face model README
Model ini merupakan hasil fine-tuning dari indobenchmark/indobert-large-p2 menggunakan Sentence Transformers untuk tugas Semantic Textual Similarity (STS) dalam bahasa Indonesia.
Model ini dilatih secara multi-dataset menggunakan gabungan dari:
rzkamalia/stsb-indo-mt-modifiedquarkss/stsb-indo-mtAkshitaS/semrel_2024_plus (split ind_Latn)Tujuan utama dari model ini adalah untuk mendukung penilaian otomatis jawaban siswa atau sistem pembelajaran berbasis teks dalam bahasa Indonesia.
indobenchmark/indobert-large-p2sentence-transformersCosineSimilarityLoss516Cosine Similarityfrom sentence_transformers import SentenceTransformer, util
model = SentenceTransformer("eugene702/Automatic-Scoring")
score = util.cos_sim(
model.encode("Apa dampak pemanasan global?", convert_to_tensor=True),
model.encode("Bagaimana pengaruh perubahan iklim terhadap bumi?", convert_to_tensor=True)
)
print("Similarity Score:", score.item())
| Dataset | Deskripsi |
|---|---|
rzkamalia/stsb-indo-mt-modified | Versi modifikasi STS bahasa Indonesia |
quarkss/stsb-indo-mt | STS benchmark bahasa Indonesia |
AkshitaS/semrel_2024_plus | Dataset Semantic Relation multilingual split ind_Latn |
Evaluasi dilakukan pada data test dari ketiga dataset yang digabung. Penilaian dilakukan menggunakan EmbeddingSimilarityEvaluator dari sentence-transformers.
Metric utama: Cosine Similarity terhadap pasangan kalimat dalam bahasa Indonesia.
Model dilatih menggunakan sentence-transformers di platform Kaggle.
Kode pelatihan tersedia secara privat namun dapat diminta melalui email.
Model tersedia di:
Untuk pertanyaan atau kolaborasi:
Eugene Feilian Putra Rangga
📧 eugenefeilianputrarangga@gmail.com
🔗 Hugging Face Profile
🔗 GitHub
Model ini merupakan bagian dari eksperimen untuk membangun sistem penilaian otomatis berbasis semantic similarity pada teks Bahasa Indonesia.