harshavaishnav
DPO
Based on Qwen/Qwen3.5-4B
Tags
- safetensors
- qwen3_5
- lora
- dpo
- qwen
- playpen
- lm-playschool
- conversational
- en
- dataset:harshavaishnav/DPO_Dataset_2
- base_model:Qwen/Qwen3.5-4B
- base_model:adapter:Qwen/Qwen3.5-4B
Languages
en
- Author
- harshavaishnav
- Task
- text-generation
- Architecture
- qwen3_5
- License
- apache-2.0
- Base model
- Qwen/Qwen3.5-4B
- Downloads
- 17
- Likes
- 2
