Downloads · 30 days
305
35% of all-time downloads
ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16
Qwen3.8-Flash-Next-MTP-bf16 is a text generation model from ToPo-ToPo. Use it when you need the model to write or continue text. It is set up for mlx. The card lists the license as other.
Qwen/Qwen3.8-Flash-Next の公式 bf16 チェックポイントに内蔵された MTP ヘッド(mtp. 31 テンソル)を切り出した、 投機デコード用ドラフター。単体では使わない。
Downloads · 30 days
305
35% of all-time downloads
All-time downloads
867
Public
Parameters
2.6B
5.2 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors5.2 GB · 100%
From the Hugging Face model README
Qwen/Qwen3.8-Flash-Next の公式 bf16
チェックポイントに内蔵された MTP ヘッド(mtp.* 31 テンソル)を切り出した、
投機デコード用ドラフター。単体では使わない。
Qwen/Qwen3.8-Flash-Next(revision de4b8e4)Qwen4ExpMTPSplitterqwen4_exp_mtp の抽出・実行は mlx-vlm 0.7.0 以降(リリース版 0.6.17 には未収録)。
pip install "mlx-vlm @ git+https://github.com/Blaizzy/mlx-vlm@main"
python -m mlx_vlm generate --model ToPo-ToPo/Qwen3.8-Flash-Next-mlx-4bit \
--draft-model ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16 \
--draft-kind mtp --draft-block-size 2 \
--prompt "..." --max-tokens 512
量子化版リポジトリ(4bit /
8bit)の mtp/
サブフォルダにも同じものが入っているので、本体を落とせばドラフターも付いてくる。
from mlx_vlm.speculative.drafters.qwen4_exp_mtp.split import Qwen4ExpMTPSplitter
Qwen4ExpMTPSplitter().split("Qwen/Qwen3.8-Flash-Next", "Qwen3.8-Flash-Next-MTP-bf16")
量子化後のリポジトリからは mtp.* が落ちている(mlx-vlm の sanitize が除外する)ので、
必ず公式 bf16 から切り出すこと。