Til lokale sprogmodeller har grafikkortets hukommelse (VRAM) og computerens hukommelse (RAM) forskellige opgaver. Hvad du skal opgradere, afhænger af ét spørgsmål: Kan den model, du vil køre, være i VRAM?
Start med VRAM. Kan modellen og dens kontekst allerede være i GPU'ens VRAM med god plads, er mere RAM som regel ikke den første opgradering at overveje for hastigheden; GPU'ens egen ydeevne betyder sandsynligvis mere.
Løber modellen over i RAM, kan ekstra RAM afgøre, om den overhovedet kan køre, mens mere VRAM kan mindske eller fjerne den offload. RigRoute Labs er stadig ved at måle, hvor stor hastighedsforskellen er.
RAM bliver hovedsagen, når samme maskine også kører editor, browser og Docker og løber tør for hukommelse, eller når du kører modeller på CPU'en alene.
VRAM er hukommelsen på grafikkortet. Den skal rumme modellens vægte, KV-cachen, som vokser med konteksten (hvor meget tekst modellen arbejder med), og softwarens egne arbejdsbuffere. Når det hele er i VRAM, laver GPU'en alt arbejdet, og hvor hurtigt svaret skrives, afhænger i høj grad af kortets hukommelsesbåndbredde.
RAM rummer styresystemet og dine andre programmer, og modelfilen på vej over til GPU'en. Når modellen kører helt på grafikkortet, skal RAM primært dække resten af maskinen. RAM begynder først at lave AI-arbejde, når en del af modellen skal køre uden for GPU'en.
Værktøjer som llama.cpp, LM Studio og Ollama kan lægge en del af modellens lag over i RAM (offload). Så kører modellen, men de lag behandles af CPU'en fra RAM, som har en brøkdel af et grafikkorts hukommelsesbåndbredde. Genereringen forventes derfor at gå langsommere, og mere jo større en del af modellen der ligger uden for VRAM.
Ikke målt endnu Hvor meget langsommere på en typisk maskine er endnu ikke målt af RigRoute Labs. Det er den næste planlagte måling.
Når CPU'en laver arbejdet, enten for de lag, der er lagt over i RAM, eller for hele modellen, betyder CPU'en og hukommelsessystemet noget: Flere kerner hjælper modellen med at læse din prompt, og hukommelsesbåndbredden (antal hukommelseskanaler og RAM-hastighed) begrænser, hvor hurtigt den skriver. Hvor store de effekter er, er endnu ikke målt af RigRoute Labs.
RigRoutes estimat for en 4-bit-model og én bruger. Intervallet dækker modellen plus kontekst og arbejdsbuffere; dækker din VRAM toppen af intervallet, er der plads til overs.
Beregnet Rigtige modelfiler er ofte lidt større end præcis 4 bit pr. vægt, og det faktiske forbrug afhænger af modellen og softwaren.
Alt på denne side falder i én af tre slags evidens:
Mere i dybden: hvor meget hukommelse kræver lokal AI?
Opdateret 30. september 2026. RigRoute Labs' målinger tilføjes siden, efterhånden som de bliver lavet.