De reële kosten van het bouwen van een AI-systeem: LLM's, infrastructuur en verborgen uitgaven
Door Nichita Railean, CTOGepubliceerd Bijgewerkt 12 min leestijd
"We voegen gewoon AI toe" klinkt eenvoudig. Dat is het zelden. Deze gids zet de belangrijkste kostencategorieën uiteen aan de hand van illustratieve planningsscenario’s; de werkelijke prijs hangt af van de aanbieder, het gebruik, de architectuur en de omvang van de opdracht.
De drie kostencategorieën Iedereen onderschat
De meeste bedrijven budget voor de voor de hand liggende kosten. LLM API's en misschien wat cloud infrastructuur. Dan krijgen ze getroffen met drie kostencategorieën die ze niet zagen aankomen:
- 1. Gegevensinfrastructuur (vaak 40-50% van de totale kosten)
- 2. LLM-kosten (de zichtbare kosten die iedereen van plan is)
- 3. Verborgen operationele kosten (kan de LLM-kosten evenaren of overschrijden)
We zetten ze uiteen met praktische planningsvoorbeelden.
Deel 1: LLM-kosten (zichtbare kosten)
LLM-prijzen: plan in niveaus, niet met prijslijsten
Modelprijzen veranderen om de paar maanden en zijn meestal gedaald, dus elke prijslijst veroudert snel. Plan met drie niveaus en controleer de actuele prijspagina van de aanbieder voordat u een budget vastlegt.
- Frontiermodellen: De grootste modellen van OpenAI, Anthropic en Google. De hoogste prijs per token, de moeite waard voor complex redeneren, schrijfwerk en lastige randgevallen.
- Middelgrote modellen: Meestal een fractie van de prijs van frontiermodellen, en goed genoeg voor het meeste extractie-, classificatie- en klantenservicewerk.
- Kleine en open modellen: Het goedkoopst per aanvraag, en sommige kunnen op uw eigen infrastructuur draaien. Geschikt voor grote volumes en duidelijk afgebakende taken.
In de praktijk hangen de kosten per interactie minder af van de prijslijst dan van hoeveel tekst u meestuurt: lange documenten, chatgeschiedenis en opgehaalde context vermenigvuldigen het aantal tokens. De scenario’s hieronder laten het effect zien.
Real-World LLM Kostenvoorbeelden
Chatbot voor klantenservice (10.000 gesprekken per maand)
- Gemiddeld gesprek: 8 berichten heen en weer
- Gemiddelde tokens per bericht: 500 input, 300 output
- Totale maandelijkse tokens: ~64M input, ~24M output
- Met een middelgroot model: €552/maand
- Met een frontiermodel: €1,360/maand
- Met een klein model: €200/maand
Systeem voor documentanalyse (500 documenten/dag)
- Gemiddelde document: 5.000 tokens
- Analyse output: 1.000 tokens per document
- Totale maandelijkse tokens: ~75M input, ~15M output
- Met een middelgroot model: 450 euros/maand
- Met een frontiermodel: 1.200 euros/maand
- Met een klein model: €169/maand
De verborgen LLM-kostenfactor: retrieval
Dit is wat iedereen verrast: de meeste productie-AI systemen gebruiken RAG (Retrieval Augmented Generation). Dit betekent dat je niet alleen een prompt stuurt
- 1. Inbedding van de gebruikersopdracht: Kleine kosten (~€0,0001 per query)
- 2. De relevante context ophalen: Vaak 10-50k tokens van opgehaalde gegevens
- 3. Al die context naar de LLM sturen: Hier ontploffen de kosten
Realiteitscontrole: RAG-systemen gebruiken meestal 3-5x meer tokens dan eenvoudige Q&A-systemen. Budget dienovereenkomstig.
Deel 2: Infrastructuurkosten (de Stichting)
Vectordatabase (Essentieel voor RAG)
Pinecone (managed vector DB)
- Starter: €70/maand (100k vectoren)
- Standaard: €400/maand (5M vectoren)
- Onderneming: €2.000+/maand (gewone schaal)
Weaviate / Qdrant (zelfgehoste opties)
- Bereken: €200-€800/maand (AWS / GCP instantie)
- Opslag: €50-€300/maand
- Onderhoud: 5-10 uur/maand ingenieurstijd
- Totaal: €500-€1,500/maand + engineering overhead
Toepassingsinfrastructuur
Typische productiestack:
- API-/backendhosting: €150-€500/maand (beheerde diensten)
- Database (PostgreSQL/MongoDB): €100-€400/maand
- Laag opnieuw bewerken/verpakken: €50-€200/maand
- Uitbalanceren & CDN laden: €100-€300/maand
- Monitoring & loggen: €100-€300/maand
- Maandelijkse infrastructuurbasis: €500-€1,700
Gegevensopslag en -verwerking
Dit is de kostencategorie die iedereen vergeet:
- Documentopslag (S3/GCS): €50-€500/maand afhankelijk van volume
- Verwerking van gegevenspijpleidingen: €200-€1000/maand
- Inbeddingsgeneratie: €100-€500/maand (voor initiële corpus + updates)
- Reservekopie en herstel van rampen: €100-€300/maand
Deel 3: Verborgen operationele kosten (De moordenaars)
1. Prompt Engineering & Optimalisatie
Om AI-systemen betrouwbaar te laten werken, is constante iteratie nodig:
- Eerste ontwikkeling: 40-80 uur (€ 4000-€ 16.000 bij € 100-€ 200/uur)
- Continue optimalisatie: 10-20 uur/maand (€1000-€4000/maand)
- Testen van verschillende modellen: €500-€2000/maand in API kosten
2. Kwaliteitsborging en monitoring
Essentiële bewakingsinstrumenten:
- Observeerbaarheid van LLM (langfuse, Helicone): €100-€500/maand
- Fout bij volgen (Sentry): €30-€100/maand
- Analyse (Amplitude, Mixpanel): €100-€300/maand
- Handmatige QA-test: 10-20 uur/maand (€1000-€4000/maand)
3. Onderhoud van de gegevenspijpleiding
Uw AI is slechts zo goed als uw gegevens. Het bewaren van gegevens vers en relevant vereist:
- Gegevensreiniging en voorverwerking: 20-40 uur/maand
- Geactualiseerde documenten opnieuw invoegen: €100-€500/maand in API kosten
- Controle van de pijpleiding en correcties: 10-15 uur/maand
- Maandelijkse kosten: €3,000-€10.000 in engineering tijd
4. Beveiliging en naleving
- Veiligheidsaudits: €5,000-€20.000 per jaar
- Compliancedocumentatie: €10.000-€50,000 voor de eerste setup
- Controles op gegevensbescherming: Lopende engineeringtijd (10-20 uur/maand)
Totale kosten van eigendom: Echte voorbeelden
Voorbeeld 1: AI voor klantenservice (klein)
10.000 gesprekken/maand, basis RAG-systeem
| LLM-kosten (middelgroot model) | €550/maand |
| Vectordatabase (Pinecone) | €70/maand |
| Infrastructuur | €500/maand |
| Controle-instrumenten | 230 euros/maand |
| Onderhoud (20 uur @ €150/uur) | €3,000/maand |
| TOTAAL PER MAAND | €4,350/maand |
| TOTAAL PER JAAR | 52.200 euros per jaar |
Voorbeeld 2: Document Intelligence Platform (Medium)
15.000 documenten/maand geanalyseerd, meerdere workflows
| LLM-kosten (mix van modellen) | € 1.800/maand |
| Vectordatabase | €400/maand |
| Infrastructuur | 1.200 euros/maand |
| Gegevenspijpleiding en opslag | €800/maand |
| Controle-instrumenten | €500/maand |
| Onderhoud (60 uur @ €150/uur) | €9.000/maand |
| TOTAAL PER MAAND | €13.700/maand |
| TOTAAL PER JAAR | € 164,400/jaar |
Voorbeeld 3: Enterprise AI Platform (Groot)
100.000+ interacties/maand, meerdere AI systemen
| LLM-kosten | 8.000 euros/maand |
| Infrastructuur (bedrijfsklasse) | 5.000 euros/maand |
| Gegevensplatform | €3,000/maand |
| Monitoring, beveiliging, naleving | €2.000/maand |
| Team (2 VTE ingenieurs) | €30.000/maand |
| TOTAAL PER MAAND | 48.000 euros/maand |
| TOTAAL PER JAAR | 576.000 euros per jaar |
Kostenoptimalisatie Strategieën die eigenlijk werken
1. Intelligente Model Routing
Gebruik frontiermodellen alleen waar nodig en stuur eenvoudige vragen naar goedkopere modellen:
- Eenvoudige vragen: een klein, snel model, vaak 10x goedkoper of meer
- Complex redeneren: een frontiermodel
- Potentiële besparingen: 40-60% op LLM-kosten
2. Agressieve Caching
Cache LLM antwoorden voor identieke of soortgelijke vragen:
- Semantische caching: Komt overeen met soortgelijke queries, niet alleen exacte overeenkomsten
- TTL-gebaseerde ongeldigheid: Verse gegevens indien nodig, anders gecached
- Potentiële besparingen: 30-50% over LLM-kosten voor gevallen van herhaald gebruik
3. Optimaliseer Context Venstergebruik
- Alleen de meest relevante brokken ophalen (niet alles)
- Context comprimeren met behulp van samenvattingen
- Kleinere contextvensters gebruiken indien mogelijk
- Potentiële besparingen: 20-40% op LLM-kosten
4. Zelf hosten waar dat zinvol is
Voor zeer hoge volumes (1M+ aanvragen/maand) kunnen zelfgehoste opensourcemodellen goedkoper zijn:
- Open-weight-modellen zoals Llama, Mistral of Qwen op eigen GPU-instances
- Break-even meestal op €5k-€10k/maand in API kosten
- Vereist ML engineering expertise
De onderste lijn: Budget Reality Check
Regel van Thumb voor TCO
Voor elke € 1 die je besteedt aan LLM API kosten, budget:
- €0,50-€1,00 voor infrastructuur
- €2,00-€5,00 voor engineering/operaties
- €0,30-€0,50 voor monitoring/tools
Totale multiplier: 4-7x uw LLM kosten
Vertaling: Als je €2.000/maand uitgeeft aan LLM API's, dan is jouw echte TCO waarschijnlijk €8.000-€14.000/maand zodra je alles meerekent.
Dit is niet bedoeld om je weg te jagen van AI de ROI is er nog steeds wanneer gedaan goed. Maar ga in met realistische verwachtingen over de werkelijke kosten van het bouwen van productie AI systemen.
Keep reading
Bouwen van AI-systemen zonder de verborgen kosten
Bij NovaGate hebben we AI-implementaties geoptimaliseerd in tientallen projecten. We weten waar de kosten zich verbergen en hoe ze te minimaliseren. Krijg een transparante kostenraming voor uw AI project.
Krijg uw AI kosten analyse