Downloads · 30 days
113
38% of all-time downloads
check2207/CS221_vietnamese_embedding
CS221_vietnamese_embedding is a sentence similarity model from check2207. Use it when you need a score for how close two texts are. It is set up for sentence-transformers.
This is a sentence-transformers model finetuned from AITeamVN/VietnameseEmbedding. It maps sentences & paragraphs to a 1024-dimensional dense vector space and can be used for retrieval.
Downloads · 30 days
113
38% of all-time downloads
All-time downloads
296
Public
Parameters
568M
4.6 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors2.3 GB · 99%
From the Hugging Face model README
This is a sentence-transformers model finetuned from AITeamVN/Vietnamese_Embedding. It maps sentences & paragraphs to a 1024-dimensional dense vector space and can be used for retrieval.
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'XLMRobertaModel'})
(1): Pooling({'embedding_dimension': 1024, 'pooling_mode': 'cls', 'include_prompt': True})
(2): Normalize({})
)
First install the Sentence Transformers library:
pip install -U sentence-transformers
Then you can load this model and run inference.
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("sentence_transformers_model_id")
# Run inference
sentences = [
'Giấy khám sức_khỏe đi du_học có giá_trị bao_nhiêu tháng ?',
'positive: Điều 8 . Cấp Giấy khám sức_khỏe : 4 . Trường_hợp người được KSK có xét_nghiệm HIV dương_tính thì việc thông_báo kết_quả xét_nghiệm này phải theo quy_định của pháp_luật về phòng , chống HIV / AIDS.',
'negative: Điều 3 . Giấy khám sức_khỏe : 4 . Giấy khám sức_khỏe chỉ có giá_trị khi : Ghi theo đúng mẫu quy_định ; viết bằng bút mực hoặc bút_bi màu xanh hoặc đen ; chữ_viết rõ_ràng , không tẩy xóa , không viết tắt ; ghi đầy_đủ các nội_dung trong Giấy khám sức_khỏe ; kết_luận của Hội_đồng khám sức_khỏe tuyển_chọn công_dân phục_vụ có thời_hạn trong CAND có giá_trị trong 06 ( sáu ) tháng kể từ ngày khám , nếu không có những diễn_biến đặc_biệt về sức_khỏe .',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 1024]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[1.0000, 0.5422, 0.0081],
# [0.5422, 1.0000, 0.1163],
# [0.0081, 0.1163, 1.0000]])
<!--
### Direct Usage (Transformers)
<details><summary>Click to see the direct usage in Transformers</summary>
</details>
-->
<!--
### Downstream Usage (Sentence Transformers)
You can finetune this model on your own dataset.
<details><summary>Click to expand</summary>
</details>
-->
<!--
### Out-of-Scope Use
*List how the model may foreseeably be misused and address what users ought not to do with the model.*
-->
<!--
## Bias, Risks and Limitations
*What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model.*
-->
<!--
### Recommendations
*What are recommendations with respect to the foreseeable issues? For example, filtering explicit content.*
-->
| anchor | positive | negative | |
|---|---|---|---|
| type | string | string | string |
| modality | text | text | text |
| details | <ul><li>min: 16 tokens</li><li>mean: 39.72 tokens</li><li>max: 66 tokens</li></ul> | <ul><li>min: 37 tokens</li><li>mean: 163.3 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>min: 36 tokens</li><li>mean: 163.17 tokens</li><li>max: 256 tokens</li></ul> |
| anchor | positive | negative |
|---|---|---|
| <code>Công_an xã xử_phạt lỗi không mang bằng lái_xe có đúng không ?</code> | <code>positive: Điều 7 . Nhiệm_vụ của lực_lượng Cảnh_sát khác và Công_an xã : 1 . Bố_trí_lực_lượng tham_gia tuần_tra , kiểm_soát trật_tự , an_toàn giao_thông theo kế_hoạch .</code> | <code>negative: Điều 4 . Quản_lý , sử_dụng biểu_mẫu sử_dụng trong xử_phạt vi_phạm hành_chính lĩnh_vực giao_thông đường_bộ , đường_sắt : 4 . Trường_hợp người vi_phạm hành_chính có giấy_phép lái_xe tích_hợp của giấy_phép lái_xe có thời_hạn và giấy_phép lái_xe không thời_hạn , bị áp_dụng hình_thức xử_phạt tước quyền sử_dụng giấy_phép lái_xe theo quy_định tại Nghị_định của Chính_phủ quy_định xử_phạt vi_phạm hành_chính trong lĩnh_vực giao_thông đường_bộ và đường_sắt , người có thẩm_quyền quyết_định xử_phạt phải ghi rõ trong quyết_định , xử_phạt vi_phạm hành_chính các hạng xe được phép điều_khiển theo giấy_phép lái_xe và áp_dụng hình_thức xử_phạt tước quyền sử_dụng giấy_phép lái_xe có thời_hạn hoặc giấy_phép lái_xe không thời_hạn đối_với loại xe đã sử_dụng khi thực_hiện_hành_vi vi_phạm ( xe ô_tô hoặc máy_kéo hoặc xe mô_tô ) . Người vi_phạm hành_chính được quyền điều_khiển những loại xe còn lại được ghi trong giấy_phép lái_xe .</code> |
| <code>Phải thực_hiện thao_tác nạp mẫu vào bình chứa và xử_lý mẫu sơ_bộ bằng hóa_chất như thế_nào ?</code> | <code>positive: Điều 11 . Tiến_hành lấy , bảo_quản mẫu : 2 . Thao_tác lấy mẫu <br> a ) Việc lấy mẫu phải có_mặt chủ nguồn thải hoặc người đại_diện của cơ_sở có nguồn thải . Trường_hợp chủ nguồn thải hoặc người đại_diện vắng_mặt hoặc không hợp_tác thì trưởng_đoàn công_tác có trách_nhiệm lập biên_bản về sự vắng_mặt hoặc không hợp_tác và phải có người chứng_kiến việc lấy mẫu ; <br> b ) Trước khi lấy mẫu phải cho chủ nguồn thải hoặc người đại_diện của cơ_sở có nguồn thải hoặc người chứng_kiến thấy dụng_cụ lấy và chứa mẫu đảm_bảo sạch , các dụng_cụ và hóa_chất đáp_ứng các tiêu_chuẩn quốc_gia về lấy mẫu . Chụp ảnh hoặc quay_phim về điểm thu mẫu và hoạt_động thu mẫu ; <br> c ) Sử_dụng dụng_cụ lấy mẫu để múc nước_thải vào dụng_cụ chứa trung_gian ( xô bằng nhựa sạch có dung_tích từ 10 đến 15 lít ) . Nếu chiều sâu dòng nước_thải nhỏ hơn 01 mét , độ sâu lấy mẫu nước_thải nằm ở 1 / 3 chiều sâu dòng nước_thải tính từ bề_mặt_nước . Nếu chiều sâu dòng nước_thải lớn hơn 01 mét thì lấy ở độ sâu từ 20cm đến 50cm tính ...</code> | <code>negative: Điều 12 . Nhãn mẫu : 2 . Dán nhãn lên bình_chứa mẫu : nhãn phải bám chắc vào bình chứa , không để bị thấm nước , phải dùng băng_dính trong suốt rộng bản ( bề rộng ≥ 4cm ) dán đè kín lên_mặt nhãn và bao tròn hơn một vòng_quanh bình chứa để cố_định chặt và kín toàn_bộ tem nhãn vào thành bình ( nhãn mẫu có_thể được ghi và dán lên bình chứa trước khi lấy mẫu ) .</code> |
| <code>Trình_tự đánh_giá chất_lượng hàng năm đối_với Kiểm_soát viên được quy_định như thế_nào ?</code> | <code>positive: Điều 13 . Trình_tự , thủ_tục đánh_giá : 1 . Đối_với người quản_lý doanh_nghiệp nhà_nước : <br> a ) Người quản_lý doanh_nghiệp nhà_nước viết bản tự nhận_xét , đánh_giá theo nội_dung , tiêu_chí đánh_giá và tự nhận mức_độ xếp loại chất_lượng ; <br> b ) Hội_đồng thành_viên họp nhận_xét , đánh_giá đối_với người quản_lý doanh_nghiệp . Cuộc họp đánh_giá , xếp loại chất_lượng được ghi thành biên_bản , trong đó nêu rõ thành_phần tham_dự , các ý_kiến tham_gia ; <br> c ) Lấy ý_kiến bằng văn_bản về đánh_giá , xếp loại chất_lượng người quản_lý doanh_nghiệp của cấp ủy cùng cấp ; <br> d ) Trên_cơ_sở ý_kiến của cấp ủy cùng cấp , Hội_đồng thành_viên hoặc Chủ_tịch công_ty xem_xét , quyết_định đánh_giá , xếp loại chất_lượng đối_với người quản_lý doanh_nghiệp theo thẩm_quyền hoặc báo_cáo kết_quả đánh_giá , xếp loại chất_lượng Chủ_tịch Hội_đồng thành_viên , thành_viên Hội_đồng thành_viên , Chủ_tịch công_ty gửi cơ_quan đại_diện chủ sở_hữu xem_xét , quyết_định .</code> | <code>negative: Điều 8 . Xếp loại chất_lượng : Người quản_lý doanh_nghiệp nhà_nước , Kiểm_soát viên , người đại_diện phần vốn nhà_nước được đánh_giá , xếp loại chất_lượng hàng năm theo 4 mức_độ : Hoàn_thành xuất_sắc nhiệm_vụ , hoàn_thành tốt nhiệm_vụ , hoàn_thành nhiệm_vụ , không hoàn_thành nhiệm_vụ .</code> |
{
"scale": 20.0,
"similarity_fct": "cos_sim",
"gather_across_devices": false,
"directions": [
"query_to_doc"
],
"partition_mode": "joint",
"hardness_mode": null,
"hardness_strength": 0.0
}
per_device_train_batch_size: 32warmup_steps: 100gradient_accumulation_steps: 2bf16: Truegradient_checkpointing: Truegradient_checkpointing_kwargs: {'use_reentrant': False}per_device_train_batch_size: 32num_train_epochs: 3max_steps: -1learning_rate: 5e-05lr_scheduler_type: linearlr_scheduler_kwargs: Nonewarmup_steps: 100optim: adamw_torch_fusedoptim_args: Noneweight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08optim_target_modules: Nonegradient_accumulation_steps: 2average_tokens_across_devices: Truemax_grad_norm: 1.0label_smoothing_factor: 0.0bf16: Truefp16: Falsebf16_full_eval: Falsefp16_full_eval: Falsetf32: Nonegradient_checkpointing: Truegradient_checkpointing_kwargs: {'use_reentrant': False}torch_compile: Falsetorch_compile_backend: Nonetorch_compile_mode: Noneuse_liger_kernel: Falseliger_kernel_config: Noneuse_cache: Falseneftune_noise_alpha: Nonetorch_empty_cache_steps: Noneauto_find_batch_size: Falselog_on_each_node: Truelogging_nan_inf_filter: Trueinclude_num_input_tokens_seen: nolog_level: passivelog_level_replica: warningdisable_tqdm: Falseproject: huggingfacetrackio_space_id: Nonetrackio_bucket_id: Nonetrackio_static_space_id: Noneper_device_eval_batch_size: 8prediction_loss_only: Trueeval_on_start: Falseeval_do_concat_batches: Trueeval_use_gather_object: Falseeval_accumulation_steps: Noneinclude_for_metrics: []batch_eval_metrics: Falsesave_only_model: Falsesave_on_each_node: Falseenable_jit_checkpoint: Falsepush_to_hub: Falsehub_private_repo: Nonehub_model_id: Nonehub_strategy: every_savehub_always_push: Falsehub_revision: Noneload_best_model_at_end: Falseignore_data_skip: Falserestore_callback_states_from_checkpoint: Falsefull_determinism: Falseseed: 42data_seed: Noneuse_cpu: Falseaccelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}parallelism_config: Nonedataloader_drop_last: Falsedataloader_num_workers: 0dataloader_pin_memory: Truedataloader_persistent_workers: Falsedataloader_prefetch_factor: Noneremove_unused_columns: Truelabel_names: Nonetrain_sampling_strategy: randomlength_column_name: lengthddp_find_unused_parameters: Noneddp_bucket_cap_mb: Noneddp_broadcast_buffers: Falseddp_static_graph: Noneddp_backend: Noneddp_timeout: 1800fsdp: Nonefsdp_config: Nonedeepspeed: Nonedebug: []skip_memory_metrics: Truedo_predict: Falseresume_from_checkpoint: Nonewarmup_ratio: Nonelocal_rank: -1prompts: Nonebatch_sampler: batch_samplermulti_dataset_batch_sampler: proportionalrouter_mapping: {}learning_rate_mapping: {}| Epoch | Step | Training Loss |
|---|---|---|
| 0.9804 | 50 | 0.7859 |
| 1.9608 | 100 | 0.2034 |
| 2.9412 | 150 | 0.1142 |
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}
@misc{oord2019representationlearningcontrastivepredictive,
title={Representation Learning with Contrastive Predictive Coding},
author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
year={2019},
eprint={1807.03748},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/1807.03748},
}
<!--
## Glossary
*Clearly define terms in order to be accessible across audiences.*
-->
<!--
## Model Card Authors
*Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
-->
<!--
## Model Card Contact
*Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
-->