Skip to main content
    Tilbage til bloggen

    De reelle omkostninger ved at bygge et AI-system: LLM'er, infrastruktur og skjulte udgifter

    Af Nichita Railean, CTOUdgivet Opdateret 12 min. læsning

    "Vi tilføjer bare AI" lyder enkelt. Det er det sjældent. Guiden gennemgår de vigtigste omkostningskategorier med illustrative planlægningsscenarier; den faktiske pris afhænger af leverandør, brug, arkitektur og opgavens omfang.

    De tre omkostningskategorier, som alle undervurderer

    De fleste virksomheder budgetterer med de åbenlyse omkostninger – LLM API'er og måske noget cloud-infrastruktur. Så bliver de ramt af tre omkostningskategorier, de ikke så komme:

    • 1. Datainfrastruktur (ofte 40-50 % af de samlede omkostninger)
    • 2. LLM omkostninger (den synlige udgift alle planlægger)
    • 3. Skjulte driftsomkostninger (kan svare til eller overstige LLM-omkostninger)

    Lad os gennemgå hver kategori med praktiske planlægningseksempler.

    Del 1: LLM-omkostninger (de synlige udgifter)

    LLM-priser: planlæg i niveauer, ikke efter prislister

    Modelpriser ændrer sig med få måneders mellemrum og er for det meste faldet, så enhver prisliste bliver hurtigt forældet. Planlæg med tre niveauer, og tjek leverandørens aktuelle prisside, før du lægger budgettet.

    • Frontier-modeller: De største modeller fra OpenAI, Anthropic og Google. Den højeste pris pr. token, som er pengene værd til kompleks ræsonnering, tekstudkast og svære grænsetilfælde.
    • Mellemstore modeller: Som regel en brøkdel af prisen på frontier-modeller og gode nok til det meste udtræks-, klassificerings- og kundeservicearbejde.
    • Små og åbne modeller: De billigste pr. forespørgsel, og nogle kan køre på jeres egen infrastruktur. Velegnede til store mængder af veldefinerede opgaver.

    I praksis afhænger prisen pr. interaktion mindre af prislisten end af, hvor meget tekst du sender: lange dokumenter, chathistorik og hentet kontekst ganger antallet af tokens op. Scenarierne nedenfor viser effekten.

    Eksempler på omkostninger ved store sprogmodeller (LLM) i praksis

    Kundesupportchatbot (10.000 samtaler/måned)

    • Gennemsnitlig samtale: 8 beskeder frem og tilbage
    • Gennemsnitlige tokens pr. besked: 500 input, 300 output
    • Samlede månedlige tokens: ~64M input, ~24M output
    • Med en mellemstor model: €552/måned
    • Med en frontier-model: €1.360/måned
    • Med en lille model: €200/måned

    Dokumentanalysesystem (500 dokumenter/dag)

    • Gennemsnitligt dokument: 5,000 tokens
    • Analyseoutput: 1,000 tokens pr. dokument
    • Samlede månedlige tokens: ~75M input, ~15M output
    • Med en mellemstor model: €450/måned
    • Med en frontier-model: €1.200/måned
    • Med en lille model: €169/måned

    The Hidden LLM Cost Multiplikator: Hentning

    Her er, hvad der fanger alle på vagt: De fleste produktions-AI-systemer bruger RAG (Retrieval Augmented Generation). Det betyder, at du ikke bare sender én prompt – du er:

    1. 1. Indlejring af brugerforespørgslen: Små omkostninger (~€0.0001 pr. forespørgsel)
    2. 2. Henter relevant kontekst: Ofte 10-50k tokens af hentede data
    3. 3. Sender al den kontekst til LLM: Det er her omkostningerne eksploderer

    Reality check: RAG-systemer bruger typisk 3-5x flere tokens end simple Q&A-systemer. Budget i overensstemmelse hermed.

    Del 2: Infrastrukturomkostninger (The Foundation)

    Vektordatabase (essentiel for RAG)

    Pinecone (Managed Vector DB)

    • Starter: €70/måned (100k vektorer)
    • Standard: €400/måned (5M vektorer)
    • Enterprise: €2.000+/måned (tilpasset skala)

    Weaviate / Qdrant (selv-hostede muligheder)

    • Beregning: €200-€800/måned (AWS/GCP-instans)
    • Opbevaring: €50-€300/måned
    • Vedligeholdelse: 5-10 timer/måned ingeniørtid
    • I alt: €500-€1,500/måned + tekniske omkostninger

    Applikationsinfrastruktur

    Typisk produktionsstak:

    • API/backend-hosting: €150-€500/måned (administrerede tjenester)
    • Database (PostgreSQL/MongoDB): €100-€400/måned
    • Redis/Caching lag: €50-€200/måned
    • Lastbalancering & CDN: €100-€300/måned
    • Overvågning og logning: €100-€300/måned
    • Månedlig infrastrukturbaseline: €500-€1,700

    Datalagring og behandling

    Dette er omkostningskategorien, som alle glemmer:

    • Dokumentlagring (S3/GCS): €50-€500/måned afhængig af volumen
    • Datapipelinebehandling: €200-€1,000/måned
    • Indlejringsgenerering: €100-€500/måned (til indledende korpus + opdateringer)
    • Sikkerhedskopiering og katastrofegendannelse: €100-€300/måned

    Del 3: Skjulte driftsomkostninger (The Killers)

    1. Hurtig udvikling og optimering

    At få AI-systemer til at fungere pålideligt kræver konstant iteration:

    • Indledende udvikling: 40-80 timer (€4,000-€16,000 ved €100-€200/time)
    • Løbende optimering: 10-20 timer/måned (€1.000-€4.000/måned)
    • Test af forskellige modeller: €500-€2.000/måned i API-omkostninger

    2. Kvalitetssikring og overvågning

    Væsentlige overvågningsværktøjer:

    • LLM observerbarhed (Langfuse, Helicone): €100-€500/måned
    • Fejlsporing (vagt): €30-€100/måned
    • Analyseværktøjer (Amplitude, Mixpanel): €100-€300/måned
    • Manuel QA-test: 10-20 timer/måned (€1.000-€4.000/måned)

    3. Vedligeholdelse af datarørledning

    Din AI er kun så god som dine data. At holde data friske og relevante kræver:

    • Datarensning og forbehandling: 20-40 timer/måned
    • Genindlejring af opdaterede dokumenter: €100-€500/måned i API-omkostninger
    • Pipeline overvågning og rettelser: 10-15 timer/måned
    • Månedlig pris: €3,000-€10,000 i ingeniørtid

    4. Sikkerhed og overholdelse

    • Sikkerhedsrevision: €5,000-€20,000 årligt
    • Overholdelsesdokumentation: €10,000-€50,000 til indledende opsætning
    • Databeskyttelseskontrol: Løbende ingeniørtid (10-20 timer/måned)

    Samlede omkostninger ved ejerskab: Reelle eksempler

    Eksempel 1: Kundesupport AI (lille)

    10,000 samtaler/måned, grundlæggende RAG-system

    LLM-omkostninger (mellemstor model)€550/måned
    Vector DB (Pinecone)€70/måned
    Infrastruktur€500/måned
    Overvågning og værktøjer€230/måned
    Vedligeholdelse (20 timer @ €150/time)€3,000/måned
    TOTAL MONTHLY€4,350/måned
    TOTAL ANNUAL€52,200/år

    Eksempel 2: Document Intelligence Platform (medium)

    15,000 dokumenter/måned analyseret, flere arbejdsgange

    LLM-omkostninger (blanding af modeller)€1,800/måned
    Vektor DB€400/måned
    Infrastruktur€1.200/måned
    Datapipeline & lagring€800/måned
    Overvågning og værktøjer€500/måned
    Vedligeholdelse (60 timer @ €150/time)€9,000/måned
    TOTAL MONTHLY€13.700/måned
    TOTAL ANNUAL€164,400/år

    Eksempel 3: Enterprise AI-platform (stor)

    100,000+ interaktioner/måned, flere AI-systemer

    LLM omkostninger€8,000/måned
    Infrastruktur (enterprise-grade)€5,000/måned
    Dataplatform€3,000/måned
    Overvågning, sikkerhed, overholdelse€2,000/måned
    Team (2 FTE-ingeniører)€30.000/måned
    TOTAL MONTHLY€48,000/måned
    TOTAL ANNUAL€576,000/år

    Omkostningsoptimeringsstrategier, der faktisk virker

    1. Intelligent Model Routing

    Brug kun frontier-modeller, når det er nødvendigt, og send simple forespørgsler til billigere modeller:

    • Simple spørgsmål: en lille, hurtig model, ofte 10x billigere eller mere
    • Kompleks ræsonnering: en frontier-model
    • Potentielle besparelser: 40-60 % på LLM-omkostninger

    2. Aggressiv cachelagring

    Gem LLM-svar i cache for identiske eller lignende forespørgsler:

    • Semantisk caching: Match lignende forespørgsler, ikke kun eksakte matches
    • TTL-baseret ugyldiggørelse: Friske data efter behov, ellers cachelagret
    • Potentielle besparelser: 30-50 % på LLM-omkostninger til tilfælde af gentagne brug

    3. Optimer brugen af ​​kontekstvinduet

    • Hent kun de mest relevante bidder (ikke alt)
    • Komprimer sammenhænge ved hjælp af opsummering
    • Brug mindre kontekstvinduer, når det er muligt
    • Potentielle besparelser: 20-40 % på LLM-omkostninger

    4. Selvvært, hvor det giver mening

    For meget store mængder (1M+ anmodninger/måned) kan selvhostede open source-modeller være billigere:

    • Open-weight-modeller som Llama, Mistral eller Qwen på dedikerede GPU-instanser
    • Break-even typisk ved €5k-€10k/måned i API-omkostninger
    • Kræver ML ingeniørekspertise

    Bundlinjen: Et realistisk budgettjek

    Tommelfingerregel for TCO

    For hver €1 du bruger på LLM API-omkostninger, budgetterer du:

    • €0.50-€1.00 til infrastruktur
    • €2.00-€5.00 til teknik/drift
    • €0,30-€0,50 til overvågning/værktøjer

    Samlet multiplikator: 4-7x dine LLM-omkostninger

    Oversættelse: Hvis du bruger €2,000/måned på LLM API'er, er din sande TCO sandsynligvis €8,000-€14,000/måned, når du medregner alt.

    Dette er ikke beregnet til at skræmme dig væk fra AI – ROI er der stadig, når det gøres rigtigt. Men gå ind med realistiske forventninger om de sande omkostninger ved at bygge produktions AI-systemer.

    Byg AI-systemer uden de skjulte omkostninger

    Hos NovaGate har vi optimeret AI-implementeringer på tværs af snesevis af projekter. Vi ved, hvor omkostningerne gemmer sig, og hvordan vi minimerer dem. Få et gennemsigtigt omkostningsestimat for dit AI-projekt.

    Få din AI-omkostningsanalyse