Downloads · 30 days
11
20% of all-time downloads
elativus/AI-SelectedTopics-W2
AI-SelectedTopics-W2 is a reinforcement learning model from elativus. Use it for the reinforcement learning task on the model card, and read the license before you ship it in a product. The card lists the license as other.
Это модель, дообученная с помощью GRPO (RL) на среде Longest Increasing Subsequence (LIS): по заданной последовательности целых чисел нужно вернуть длину LIS.
Downloads · 30 days
11
20% of all-time downloads
All-time downloads
54
Public
Parameters
1.5B
3.1 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors3.1 GB · 99%
From the Hugging Face model README
Это модель, дообученная с помощью GRPO (RL) на среде Longest Increasing Subsequence (LIS): по заданной последовательности целых чисел нужно вернуть длину LIS.
Системный промпт (должен совпадать с train/eval):
Отвечай в следующем формате:
<think>
...
</think>
<answer>
...
</answer>
Фиксированные test/dev наборы, сгенерированные в train-ноутбуке, опубликованы тут:
Nonefrom transformers import AutoTokenizer, AutoModelForCausalLM
import torch
repo = "elativus/AI-SelectedTopics-W2"
tok = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype=torch.float16, device_map="auto")
user_prompt = "..." # вопрос из датасета (одна задача)
messages = [
{"role": "system", "content": 'Отвечай в следующем формате:\n<think>\n...\n</think>\n<answer>\n...\n</answer>'},
{"role": "user", "content": user_prompt},
]
prompt = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=64, do_sample=False)
print(tok.decode(out[0], skip_special_tokens=True))