LARK-Lab
Trainee2Trainer
Based on Qwen/Qwen3-4B
Tags
- safetensors
- qwen3
- mapf
- reinforcement-learning
- grpo
- arxiv:2606.17682
- conversational
- en
- base_model:Qwen/Qwen3-4B
- base_model:finetune:Qwen/Qwen3-4B
- license:apache-2.0
- text-generation-inference
Languages
en
- Author
- LARK-Lab
- Task
- text-generation
- Library
- transformers
- Architecture
- qwen3
- License
- apache-2.0
- Base model
- Qwen/Qwen3-4B
- Downloads
- 8
- Likes
- 1
