Downloads · 30 days
11
3% of all-time downloads
LeroyDyer/SpydazWebAI_VisionEncoderDecoderModel_Mini3b
SpydazWebAI_VisionEncoderDecoderModel_Mini3b is a image-text-to-text model from LeroyDyer. Use it for the image-text-to-text task on the model card, and read the license before you ship it in a product. It is set up for transformers.
Downloads · 30 days
11
3% of all-time downloads
All-time downloads
372
Public
Parameters
4.1B
8.2 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors8.2 GB · 100%
From the Hugging Face model README
print('Add Vision...')
# ADD HEAD
# Combine pre-trained encoder and pre-trained decoder to form a Seq2Seq model
Vmodel = VisionEncoderDecoderModel.from_encoder_decoder_pretrained(
"google/vit-base-patch16-224-in21k", "LeroyDyer/Mixtral_AI_Tiny"
)
_Encoder_ImageProcessor = Vmodel.encoder
_Decoder_ImageTokenizer = Vmodel.decoder
_VisionEncoderDecoderModel = Vmodel
# Add Pad tokems
LM_MODEL.VisionEncoderDecoder = _VisionEncoderDecoderModel
# Add Sub Components
LM_MODEL.Encoder_ImageProcessor = _Encoder_ImageProcessor
LM_MODEL.Decoder_ImageTokenizer = _Decoder_ImageTokenizer
LM_MODEL