Downloads · 30 days
0
xxzigou/youtu-vl-ncnn
youtu-vl-ncnn is a machine learning model from xxzigou. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
本仓库提供腾讯 Youtu-VL 多模态大模型转换到 ncnn 格式的推理权重,需配合自研 C++ 推理引擎(youtuengine + youtuvision)实现端到端图文推理。在相同输入下,ncnn 输出的最终文本与原 PyTorch 实现逐字一致。
Downloads · 30 days
0
Access
Public
Updated Jul 24, 2026
Repo size
12.2 GB
Likes
0
Public
Click a slice to open those files.
.bin12.2 GB · 100%
From the Hugging Face model README
本仓库提供腾讯 Youtu-VL 多模态大模型转换到 ncnn 格式的推理权重,需配合自研 C++ 推理引擎(youtu_engine + youtu_vision)实现端到端图文推理。在相同输入下,ncnn 输出的最终文本与原 PyTorch 实现逐字一致。
decoder_pre(输入投影 + RoPE 准备)、decoder_post_o(注意力输出投影)、decoder_post_mlp(RMSNorm + MLP)三个 ncnn 子图。MLA 因果注意力因 pnnx 无法捕获 KV cache,在 C++ 中实现。vision_block_XX_pre/o/mlp,外加 vision_embed(补丁嵌入,WoPos 结构无绝对位置编码);所有 LayerNorm 在 C++ 端精确实现。embed.bin(词嵌入表,与 lm_head 共享)、norm.bin(最终 RMSNorm)、merger 系列(VLPatchMerger)、vision_ln1/ln2/post 系列。| 文件 | 说明 |
|---|---|
embed.bin | 词嵌入表 [VOCAB=283386, HID=2560] |
norm.bin | 最终 RMSNorm 权重 [HID=2560] |
decoder_pre_XX.ncnn.{param,bin} | LLM 第 XX 层 pre 子图(00–39) |
decoder_post_o_XX.ncnn.{param,bin} | LLM 第 XX 层 注意力输出投影(00–39) |
decoder_post_mlp_XX.ncnn.{param,bin} | LLM 第 XX 层 MLP 子图(00–39) |
vision_embed.ncnn.{param,bin} | 视觉补丁嵌入 |
vision_block_XX_{pre,o,mlp}.ncnn.{param,bin} | 视觉第 XX 层(00–26) |
vision_ln1_w/b.bin、vision_ln2_w/b.bin | 视觉每层 LayerNorm 权重 |
vision_post_w/b.bin | 视觉后 LayerNorm 权重 |
merger_ln_w.bin、merger_fc1_w/b.bin、merger_fc2_w/b.bin | VLPatchMerger 权重 |
将本仓库全部文件作为 model_dir 传入 C++ 推理引擎。引擎加载逻辑见 youtu_engine.cpp / youtu_vision.cpp(随推理引擎仓库提供,本仓库仅含权重)。
图像模式下,按 pixel.bin 字节数动态推断视觉 token 数量(不写死),支持不同尺寸输入。
在 figure1(12×18 视觉网格)端到端验证:vision 输出 cosine 0.9998、visual token 0.9995、logits cosine 0.9978(argmax 一致)、贪心生成 24/24 完全一致。
权重源自腾讯 Youtu-VL,请遵守原模型许可证。本仓库仅提供转换后的 ncnn 推理权重,不包含原模型权重或训练代码。