Downloads · 30 days
0
F-Haru/WMT_da-data_finetuning
WMT_da-data_finetuning is a machine learning model from F-Haru. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
提供されている学習データは89000文だが、7つ学習データから外して、「88993文」で学習を行う。
Downloads · 30 days
0
Access
Public
Updated Aug 14, 2023
Repo size
27.1 MB
Likes
0
Public
Click a slice to open those files.
.txt57.3 MB · 100%
From the Hugging Face model README
提供されている学習データは89000文だが、7つ学習データから外して、「88993文」で学習を行う。
en-mr(英語-マラーティー語)のscoreのなかで7つ明らかにおかしい点数がついていたので、学習データから外した。
明らかにおかしいと考えた理由は、一番高いscoreが100のはずなのに100点よりも高い数字が入っていた。
めっちゃ高い数字を入れた状態で正規化すると、全体の数値が下がり低い数値に密集してしまうので外した。
ちなみにおかしい数字を入れた状態で正規化を行うと、scoreが「100」だと「0.5〜6」ぐらいになった。
「WMT_da_finetuning.py」がファインチューニングをするコードになっている
「distillation.py」が知識蒸留をするコードになっている