RigRoute
RigRoute Market
02 / LOKAL AI / VRAM

Modelfilen er ikke det eneste, der bruger din VRAM.

En models gemte weights er kun udgangspunktet for at estimere hukommelseskrav.

På et forenklet niveau:

parameters × bits per parameter ÷ 8

En model med 8 milliarder parametre, gemt med 4-bit-præcision, indeholder derfor cirka 4 GB rå weight-data.

Men det betyder ikke, at en 4 GB GPU kan køre den komfortabelt.

Inferens kræver også hukommelse til runtime-allokeringer, midlertidige tensors og den KV-cache, der bruges til kontekst. Længere kontekstvinduer og samtidige brugere kan øge hukommelsesforbruget yderligere, og forskellige inferensmotorer og kvantiseringsformater giver forskelligt overhead.

Derfor returnerer RigRoute et interval i stedet for at lade som om, en model har ét præcist VRAM-krav.

Offloading ændrer, hvad der er muligt

Nogle inferensprogrammer kan placere en del af en model i system-RAM, når GPU-hukommelsen ikke er tilstrækkelig. Det kan gøre det muligt at køre større modeller, men ydeevnen kan falde markant sammenlignet med at holde arbejdsbyrden i GPU'en.

At kunne indlæse en model er derfor ikke det samme som at få god inferensydelse.

Sådan bruger RigRoute det

RigRoute bruger antagelser om modelstørrelse, kvantisering og hukommelsesoverhead til at estimere, om en GPU passer fornuftigt til lokal inferens.

Disse estimater gælder dimensionering til inferens og fastslår ikke i sig selv kapacitet til finetuning, træningsmuligheder eller forventet antal tokens pr. sekund.

RIGROUTE-MEASURED

RigRoute Labs har målt 8B- og 14B-modeller i Q4-familien efter en fast metode på en GPU med 16 GB dedikeret VRAM og med 32 GB samlet hukommelse.

Se resultaterne hos RigRoute Labs
Dimensionér en lokal AI-server