Skip to content

harshavaishnav

DPO

Based on Qwen/Qwen3.5-4B

Tags

  • safetensors
  • qwen3_5
  • lora
  • dpo
  • qwen
  • playpen
  • lm-playschool
  • conversational
  • en
  • dataset:harshavaishnav/DPO_Dataset_2
  • base_model:Qwen/Qwen3.5-4B
  • base_model:adapter:Qwen/Qwen3.5-4B

Languages

en

Author
harshavaishnav
Task
text-generation
Architecture
qwen3_5
License
apache-2.0
Base model
Qwen/Qwen3.5-4B
Downloads
17
Likes
2
DPO — AI Model — AIMarketly