Downloads · 30 days
0
Qapdex/MiMo-V2.5-QEdge
MiMo-V2.5-QEdge is a machine learning model from Qapdex. Use it for the machine learning task on the model card, and read the license before you ship it in a product. The card lists the license as mit.
Lass uns mathematisch berechnen, wie klein das 1.02 Terabyte schwere MiMo-V2.5-Pro durch diese kombinierte Pipeline wird: Ausgangslage: 1.02T Parameter in FP8 Mixed = ~1.000 GB (1 TB). Nach MoE-Slicing (Liquid AI): Re…
Downloads · 30 days
0
Access
Public
Updated Jun 22, 2026
Repo size
—
Likes
1
Public
Click a slice to open those files.
.json179 KB · 89%
From the Hugging Face model README
Lass uns mathematisch berechnen, wie klein das 1.02 Terabyte schwere MiMo-V2.5-Pro durch diese kombinierte Pipeline wird: Ausgangslage: 1.02T Parameter in FP8 Mixed = ~1.000 GB (1 TB). Nach MoE-Slicing (Liquid AI): Reduktion der Experten-Basis auf ein dichtes 90-Milliarden-Parameter (90B) Äquivalent. Nach 1.58-Bit Quantisierung (Qapdex/BitNet): $$\text{Größe} = \frac{90.000.000.000 \text{ Parameter} \times 1.58 \text{ Bits}}{8 \text{ Bits pro Byte}} \approx 17.775.000.000 \text{ Bytes}$$
Bei einer Matrixgröße von 12.288 x 4096 sprechen wir von exakt 50,33 Millionen Elementen, die durchgelaufen werden müssen. Da wir jegliche Verzweigungen eliminiert haben, hängt die Zeit nur noch von zwei Faktoren ab: der Taktfrequenz deiner CPU und wie gut der Compiler die SIMD-Vektorisierung (AVX2 oder AVX512) umsetzt.
Hier ist die fundierte Schätzung basierend auf kommerziellen Hardware-Klassen:
Standard Consumer CPU (z. B. AMD Ryzen 7 5800X / Intel Core i7-12700K) Schätzung: ~1,8 ms bis 3,2 ms Warum: Solide Performance über 8 bis 12 Kerne. Die Speicherbandbreite des DDR4/DDR5 RAMs limitiert hier minimal, aber da der Puffer branchless durchgezogen wird, bleibt die Pipeline absolut flüssig.
Moderner Apple Silicon Mac (M1/M2/M3/M4 Pro oder Max) Schätzung: ~0,5 ms bis 1,1 ms Warum: Apples Unified Memory Architecture besitzt eine mörderische Bandbreite (bis zu 400 GB/s). Wenn der Compiler das auf die NEON-Vektoreinheiten übersetzt, fliegt der Kernel förmlich durch den RAM.
Wenn wir von einem realistischen Mittelwert von 1,5 ms pro Schicht ausgehen.
Ein kompaktes Modell im Stil von Project Natal (nach dem MoE-Slicing) hat etwa 32 Schichten. $$1,5 \text{ ms} \times 32 \text{ Schichten} = 48 \text{ ms pro Token}$$ $$\frac{1000 \text{ ms}}{48 \text{ ms}} \approx \mathbf{20,8 \text{ Tokens pro Sekunde}}$$
Das bedeutet: Wir würden ein Modell, das im Original auf einer 10.000€ Enterprise-GPU laufen muss, mit absolut flüssiger, lesbarer Geschwindigkeit auf einer ganz normalen Office- oder Gaming-CPU servieren.