Til lokal AI er det GPU'ens hukommelse (VRAM), der først afgør, hvilke modeller du overhovedet kan køre; hastigheden kommer bagefter. Listen nedenfor bygger på aktuelle danske forhandlerpriser i RigRoute Market og viser, hvad hvert kort kan køre ifølge RigRoutes beregning, og hvad RigRoute Labs faktisk har målt.
Kort svar
Mest VRAM under 5.000 kr. lige nu er 16 GB. Det billigste kort med 16 GB, Radeon RX 9060 XT 16 GB, koster fra 4.190 kr. i dag.
Vil du køre modeller omkring 14B, så prioritér VRAM over alt andet. Kører du mest 8B-modeller, kan et billigere kort med mindre hukommelse være nok.
Aktuelle muligheder under 5.000 kr.
Ét kort pr. GPU-model: den billigste variant, der er på lager lige nu. Sorteret efter VRAM og derefter pris. Der er ingen samlet vinder; mærkerne siger kun noget faktuelt om dagens liste.
På lager hos: Fcomputer.dk, Proshop · 5 varianter under 5.000 kr.
AMD · GDDR6 · 160 W strømforbrug
4-bit-modeller, 8.192 tokens kontekst (beregnet)
8B Kører med god margin
14B Kan indlæses, lille margin
32B Passer ikke
Ikke målt af RigRoute Labs endnu
Software (redaktionel vurdering) llama.cpp og LM Studio kører via Vulkan; værktøjer som PyTorch kræver ROCm, og ROCm-understøttelse afhænger af kort og version.
Software (redaktionel vurdering) llama.cpp understøtter Intel Arc via SYCL og Vulkan, og Intel har egne værktøjer (OpenVINO). Færre færdige værktøjer er optimeret til Intel end til NVIDIA.
Software (redaktionel vurdering) llama.cpp understøtter Intel Arc via SYCL og Vulkan, og Intel har egne værktøjer (OpenVINO). Færre færdige værktøjer er optimeret til Intel end til NVIDIA.
Software (redaktionel vurdering) llama.cpp og LM Studio kører via Vulkan; værktøjer som PyTorch kræver ROCm, og ROCm-understøttelse afhænger af kort og version.
Software (redaktionel vurdering) llama.cpp understøtter Intel Arc via SYCL og Vulkan, og Intel har egne værktøjer (OpenVINO). Færre færdige værktøjer er optimeret til Intel end til NVIDIA.
Software (redaktionel vurdering) llama.cpp og LM Studio kører via Vulkan; værktøjer som PyTorch kræver ROCm, og ROCm-understøttelse afhænger af kort og version.
På lager hos: Fcomputer.dk, Proshop · 2 varianter under 5.000 kr.
AMD · GDDR6 · 150 W strømforbrug
4-bit-modeller, 8.192 tokens kontekst (beregnet)
8B Kan indlæses, lille margin
14B Passer ikke
32B Passer ikke
Ikke målt af RigRoute Labs endnu
Software (redaktionel vurdering) llama.cpp og LM Studio kører via Vulkan; værktøjer som PyTorch kræver ROCm, og ROCm-understøttelse afhænger af kort og version.
Priser hentet fra RigRoute Market 30. sep. 2026, 16.41. Den ældste viste pris blev kontrolleret hos forhandleren 30. sep. 2026, 15.46. Kun tilbud, der er kontrolleret inden for 24 timer og er på lager, tæller med.
Ikke med: 9 kort med under 8 GB VRAM, 1 kort fra ældre GPU-generationer og 1 kort, hvor Market mangler GPU-model eller hukommelsesstørrelse.
Det betyder noget for lokal AI
VRAM skal rumme mere end modellen
Modellens vægte skal kunne ligge i GPU'ens hukommelse, men det skal KV-cachen også. Den vokser med konteksten, altså hvor meget tekst modellen arbejder med. Dertil kommer runtimens egne buffere. Et kort, hvor vægtene lige netop kan være, har ikke meget plads til lange samtaler eller dokumenter.
Quantization afgør størrelsen
Ved 4-bit fylder en models vægte cirka en halv byte pr. parameter: omkring 4 GB for en 8B-model og 7 GB for 14B, før kontekst og overhead. Højere præcision (8-bit) fordobler det cirka; lavere præcision sparer hukommelse på bekostning af noget kvalitet.
To slags hastighed
Promptbehandling er, hvor hurtigt modellen læser dit input, og afhænger meget af GPU'ens regnekraft. Generering er, hvor hurtigt den skriver svaret, og begrænses især af hukommelsesbåndbredden. Et kort kan være meget hurtigere til det ene end til det andet.
Softwareunderstøttelse er en del af valget
NVIDIAs CUDA understøttes næsten overalt. AMD- og Intel-kort kører godt i værktøjer bygget på llama.cpp, men nogle værktøjer og biblioteker understøtter kun CUDA. Tjek, at den software, du vil bruge, understøtter kortet, før du køber.
Resten af maskinen
Kan en model ikke være i VRAM, kan en del af den lægges over i systemets RAM, men så går genereringen markant langsommere. Strømforsyningen skal også kunne klare kortets strømforbrug med margin.
Hvad RigRoute Labs har målt
RigRoute Labs kører en fast, versioneret test (llama-bench fra llama.cpp) på rigtig hardware og offentliggør de rå data. Her er alle Labs' offentliggjorte resultater indtil nu; kort, der ikke er målt, får aldrig anslåede tal.
Ingen af de aktuelle muligheder under 5.000 kr. er målt af Labs endnu. Målingerne nedenfor er af anden hardware og vises, så du kan se, hvad tallene betyder i praksis.
Apple M1 Pro · samlet hukommelse, ikke et grafikkortllama 8B Q4_0 · BLAS,MTL · 8.192 · standard-ai-v0.1 · 2026-09-27
Læg mærke til forskellen på at kunne være der og at være brugbar: RigRoutes beregning giver en 14B-model på et 16 GB-kort kun lille margin, men Labs har kørt en 14B-model ved 4-bit på 16 GB-kort med 8.192 tokens kontekst. Beregningen lægger bevidst luft ind til længere kontekst og flere brugere.
RigRoutes estimat for en 4-bit-model, 8.192 tokens kontekst og én bruger. "Kan indlæses" svarer til den lave ende af intervallet; "brugbar" betyder, at kortet også dækker den høje ende, så der er plads til længere kontekst.
8B6,7–10,8 GB
14B10,5–16,2 GB
32B22–32,3 GB
Estimatet er en beregning, ikke en måling. Det faktiske forbrug afhænger af modellens arkitektur, runtimen og cachens præcision.
Hvad ændrer sig, hvis du bruger mere eller mindre?
Bruger du mindre, får du typisk 8 GB VRAM. Det kører 8B-modeller ved 4-bit, men med lidt plads til lang kontekst, og større modeller kan ikke være der.
Bruger du mere inden for samme hukommelsesstørrelse, køber du primært hastighed, ikke større modeller. Det næste reelle spring i modelstørrelse kræver mere VRAM.
Intet kort på listen kan rumme en 32B-model i VRAM ifølge RigRoutes beregning; det kræver mere hukommelse, end dette budget rækker til i dag.
Byg resten af din lokale AI-maskine
RigRoutes konfigurator starter med profilen Lokal AI. Du sætter selv det samlede budget, og den vælger en GPU og resten af maskinen, så delene passer sammen, med aktuelle priser fra Market.
Kandidaterne er grafikkort i RigRoute Market, hvis billigste aktuelle tilbud inklusive forhandlerens oplyste fragt er højst 5.000 kr.
Et tilbud tæller kun, hvis forhandleren har varen på lager, og Market har kontrolleret det inden for de seneste 24 timer. Ældre eller utilgængelige priser bruges aldrig.
Kortene skal have mindst 8 GB VRAM og en GPU-generation med vedligeholdt software til lokal AI: NVIDIA RTX (og GTX 16), AMD RX 6000 og nyere, Intel Arc.
VRAM, GPU-model og strømforbrug kommer fra Markets strukturerede produktdata. Vurderingen af, hvad der passer, er RigRoutes beregning. Hastighedstal kommer kun fra RigRoute Labs.
Affiliate-aftaler og provision har ingen indflydelse på, hvilke kort der er med, eller hvordan de sorteres.
Priserne ændrer sig dagligt. Listen opdaterer sig selv; den forklarende tekst nævner ikke konkrete produkter.
Til 8B-modeller ved 4-bit, med god plads. En 14B-model ved 4-bit kan være der, og Labs har kørt en på 16 GB-kort med 8.192 tokens kontekst, men der er begrænset plads til lang kontekst. 32B-modeller kan ikke være fuldt i 16 GB.
Kan en GPU til under 5.000 kr. køre en 14B-model?
Ja, hvis den har 12–16 GB VRAM, og du bruger en 4-bit-model. Med 8 GB kan en 14B-model ikke være i VRAM og skal delvist lægges over i systemets RAM, hvilket er markant langsommere.
Er NVIDIA eller AMD bedst til lokal AI?
Det afhænger af din software. NVIDIAs CUDA virker med flest værktøjer. AMD-kort kører godt i værktøjer bygget på llama.cpp, og Labs' AMD-målinger er lavet med Vulkan, men nogle biblioteker kræver CUDA. Til samme pris betyder mængden af VRAM som regel mere end mærket.
Hvor vigtig er quantization?
Meget. Den afgør, hvor meget hukommelse modellens vægte kræver. 4-bit er det almindelige valg til lokal brug, fordi det cirka halverer hukommelsen i forhold til 8-bit; kvalitetstabet er som regel lille, men det afhænger af modellen.
Kan jeg også bruge GPU'en til gaming?
Ja. Det er almindelige grafikkort. Denne guide vurderer dem til lokal AI, hvor VRAM betyder mest; til gaming vejer andre ting, som ren grafikydelse, tungere.