Audio en video transcriberen op schaal: wanneer een GPU huren loont
Een los interview transcribeer je op je laptop. Honderd opnames per maand niet. Wanneer eigen GPU-capaciteit huren goedkoper is dan een per-minuut-dienst.
/ KORT GEZEGD
Een los interview transcribeer je op je laptop. Honderd opnames per maand niet. Wanneer eigen GPU-capaciteit huren goedkoper is dan een per-minuut-dienst.
Onderdeel van
AI capaciteit en computeSPOKE/AI CAPACITEIT
PUBLICATIE·25 JULI 2026
Een los interview transcriberen kost je niets: een gratis tool, een paar minuten wachten, klaar. Honderd opnames per maand is een ander verhaal. Garantiegesprekken, opleveringen, klantgesprekken en locatiebezoeken stapelen zich op tot een berg audio en video die niemand meer uitwerkt, simpelweg omdat het met de hand te veel tijd kost. Op dat moment kantelt transcriptie van een incidentele klus naar een structureel werkproces, en verandert ook de vraag die je jezelf moet stellen: niet "welke app gebruik ik voor dit ene gesprek", maar "welke capaciteit heb ik structureel nodig". Dit artikel legt uit waar dat omslagpunt ligt en wanneer eigen GPU-capaciteit huren goedkoper wordt dan een per-minuut-dienst.
/ 01Omslagpunt
Het omslagpunt: van los interview naar bulkvolume
Bij incidenteel gebruik, een enkel gesprek per week of per maand, is de keuze simpel: een los abonnement of een API-call bij een transcriptiedienst kost weinig en de kwaliteit is voor de meeste toepassingen ruim voldoende. Het wordt anders zodra het volume structureel wordt. Monteurs die elke oplevering opnemen, adviseurs die elk klantgesprek vastleggen, veldonderzoekers die elk bezoek documenteren: bij elkaar loopt dat al snel op tot tientallen uren opnames per maand.
Op dat punt verandert niet alleen de rekensom, maar ook de vraag wie de opnames ziet. Een per-minuut-dienst is prima voor een enkel gesprek, maar bij honderd uur per maand komt daar een tweede vraag bij: waar staat die data, en wie heeft er toegang toe. Beide vragen, volume en datagevoeligheid, komen verderop in dit artikel apart aan bod.
Een los interview transcribeer je op je laptop. Honderd opnames per maand transcribeer je met een systeem, niet met geduld.Werkdefinitie · Dossier transcriptie en GPU-capaciteit
/ 02VRAM
Wat transcriptie technisch vraagt: Whisper en de VRAM erachter
Spraak-naar-tekst-modellen zoals de Whisper-varianten zijn geen uitzondering op de regel dat een AI-model in het geheugen van een GPU moet passen. Ze vragen minder VRAM dan een groot taalmodel, maar de vraag loopt op met de modelgrootte: van de kleinste, snelste varianten die op een paar gigabyte draaien tot de grootste varianten met de beste nauwkeurigheid, die aanzienlijk meer geheugen vragen.1 Voor de onderliggende rekenkunde van modelgrootte naar VRAM, inclusief de rol van quantisatie, verwijzen we naar hoeveel VRAM je nodig hebt voor een AI-model: dezelfde vuistregels gelden hier, alleen dan toegepast op een spraakmodel in plaats van een taalmodel.
Waar het bij transcriptie specifiek op aankomt, is het verschil tussen een los bestand en een batch. Eén opname van twintig minuten verwerken kost weinig geheugen en is in de praktijk op bijna elke machine te doen. Honderd bestanden tegelijk in een wachtrij zetten om 's nachts te laten verwerken, is een andere vraag: dan telt niet alleen de modelgrootte, maar ook hoeveel bestanden parallel in het geheugen passen. Dat is precies waarom bulk-transcriptie als aparte workload wordt genoemd op onze GPU-huren-pagina: de rekenvraag van een los bestand en die van een dagelijkse batch van honderd bestanden verschillen wezenlijk, ook al draait er hetzelfde model onder. Of dat moment vraagt om eigen GPU-capaciteit of om een agent die de orkestratie eromheen doet, is dezelfde afweging als in AI capaciteit huren: wanneer GPU's en wanneer agents.
/ 03Drie bronnen
Drie bronnen die MKB'ers laten opstapelen
In de praktijk zien we drie herkenbare bronnen die audio- en video-opnames laten opstapelen zonder dat iemand dat als zodanig benoemt.
Bij een installatiebedrijf zijn dat de garantiegesprekken en opleveringsmomenten op locatie: een monteur die met de klant doorloopt wat er is opgeleverd, wat de garantie dekt en wat de klant nog moet weten. Bij een accountantskantoor zijn dat de klant- en adviesgesprekken, vaak met fiscale details die je niet uit je hoofd wil onthouden. Bij een engineering-bureau voor netcongestie en batterijen zijn dat de locatiebezoeken en het veldonderzoek, waarbij een technicus ter plekke bevindingen inspreekt in plaats van ze handmatig te noteren.
/ 04Rekenmodel
Per-minuut-dienst versus eigen GPU-uur: het rekenmodel
Het rekenmodel achter de keuze is simpel op te schrijven, ook zonder vaste bedragen: leg de kosten van een per-minuut-dienst (aantal uur opnames per maand vermenigvuldigd met de prijs per minuut van die dienst) naast de kosten van eigen GPU-uur (verwacht aantal GPU-uren vermenigvuldigd met het uurtarief). Bij een paar uur opnames per maand wint de per-minuut-dienst bijna altijd: er is geen instapdrempel en je betaalt alleen voor wat je gebruikt. Bij tientallen uren per maand kantelt dat, omdat een per-minuut-tarief lineair meeschaalt met het volume, terwijl een eigen GPU-uur bij hoog gebruik relatief goedkoper wordt naarmate de kaart meer uren draait.
Het exacte omslagpunt hangt af van de actuele tarieven aan beide kanten, en die bewegen. Het actuele overzicht van externe GPU-aanbieders naast ons eigen aanbod staat op /gpu-huren, dus die bedragen typen we hier bewust niet over.2 Loopt het volume verder op, tot een punt waarop je structureel elke maand veel GPU-uren draait, dan is de vervolgvraag niet meer huren versus dienst, maar huren versus een eigen server aanschaffen. Die bredere rekenregel, inclusief de aanname over bezettingsgraad die de uitkomst kantelt, staat uitgewerkt in GPU huren of kopen.
| Aspect | Per-minuut-dienst | Eigen GPU-uur huren | Eigen server (on-premise) |
|---|---|---|---|
| Past bij volume | Incidenteel tot licht (enkele uren per maand) | Maandelijks tot fors (tientallen uren per maand) | Dagelijks en continu, structureel hoog volume |
| Instapkosten | Geen, direct te gebruiken | Geen aanschaf, wel inrichting | Aanschaf en installatie vooraf |
| Kostenkarakter | Lineair per minuut, schaalt mee met volume | Per GPU-uur, relatief goedkoper bij hoge bezetting | Vast per maand, ongeacht bezetting |
| Datalocatie | Afhankelijk van aanbieder, vaak niet EU-gegarandeerd | Te kiezen, inclusief EU/EER-opties | Volledig eigen beheer |
| Beheerlast | Geen | Beperkt, wij richten dit desgewenst in | Doorlopend, wij kunnen dit beheren |
/ 05Datagevoeligheid
Datagevoeligheid: waarom een klantgesprek niet overal mag landen
Een garantiegesprek, een klantgesprek of een adviesgesprek bevat vrijwel altijd persoonsgegevens: een naam, een adres, soms fiscale of financiele details. Dat verandert de vraag "welke transcriptiedienst gebruiken we" in een vraag die verder gaat dan prijs en snelheid alleen. Niet elk platform garandeert waar de opname en de transcriptie worden opgeslagen, en niet elk platform biedt een verwerkersovereenkomst die daarbij past.
Een garantiegesprek is net zo goed persoonsgegevens als een e-mail. De vraag is niet of je het transcribeert, maar waar dat gebeurt en wie erbij kan.Inzicht · datagevoeligheid bij transcriptie
/ 06Drie scenarios
Drie scenario's: incidenteel, maandelijks, dagelijks
In de praktijk valt bijna elk bedrijf in een van drie scenario's.
Incidenteel. Een handvol opnames per kwartaal, een los interview of een enkel klantgesprek. Een abonnement of een losse API-call bij een transcriptiedienst volstaat, en de moeite van een eigen opzet weegt niet op tegen het volume.
Maandelijks. Tientallen uren per maand, structureel terugkerend vanuit een van de drie bronnen uit sectie 03. Dit is het scenario waarin eigen GPU-uur huren aantrekkelijk wordt: het rekenmodel uit sectie 04 kantelt hier vaak, en de datagevoeligheid uit sectie 05 begint mee te wegen omdat het om terugkerende klantgesprekken gaat.
Dagelijks of continu. Structureel hoog volume, elke dag opnames die verwerkt moeten worden. Hier wordt de vraag relevant of een eigen server op locatie goedkoper uitpakt dan doorlopend huren, zoals uitgewerkt in GPU huren of kopen.
/ 07Eigen praktijk
Wat wij zelf transcriberen
We passen dit zelf toe binnen onze drie operationele bedrijven. Ons installatiebedrijf voor zon en warmtepompen transcribeert opleverings- en garantiegesprekken, onze webshop in zonne-energie legt klantgesprekken vast voor after-sales, en ons engineering-bureau voor netcongestie en batterijen zet locatiebezoeken en veldonderzoek om in doorzoekbare tekst. Handmatig uitwerken kostte voorheen al gauw een veelvoud van de opnameduur zelf. Nu loopt dat automatisch mee in de agent-orkestratie die ook de rest van onze operatie draait: 57 agents over 5 servers, lokaal en cloud, volledig automatisch.3
0
EIGEN BEDRIJVEN MET TRANSCRIPTIE-WORKFLOW
0
RICHTWAARDE · UUR/MAAND OMSLAGPUNT
0 tot 10
GB VRAM · WHISPER-VARIANTEN
0
AGENTS OVER 5 SERVERS
/ 08Volgende stap
Drie volgende stappen
- Tel hoeveel uur opnames je nu per maand hebt liggen. Reken op basis van sectie 03 wat er structureel binnenkomt aan garantiegesprekken, klantgesprekken of veldbezoeken. Dat getal bepaalt in welk scenario uit sectie 06 je valt.
- Bekijk het actuele GPU-prijsoverzicht. Op /gpu-huren staan de actuele tarieven van externe aanbieders naast ons eigen aanbod, zodat je het rekenmodel uit sectie 04 met echte cijfers kan invullen. Wil je eerst het bredere rekenmodel van GPU-uur naar maandbedrag zien, dan staat dat in AI-capaciteit kosten 2026.
- Plan een gratis adviesgesprek. Twijfel je tussen een externe dienst, eigen GPU-capaciteit of een on-premise machine, plan dan een gratis adviesgesprek. We kijken samen naar je volume, je datagevoeligheid en welke route daar het beste bij past.
BRONVERMELDINGEN
- 01Richtwaarde: Whisper-achtige spraakmodellen vragen doorgaans van circa 1 GB VRAM voor de kleinste, snelste varianten tot circa 10 GB voor de grootste varianten met de hoogste nauwkeurigheid, bij verwerking van een los bestand. Batch-verwerking van meerdere bestanden tegelijk verhoogt de vraag. Geen exacte specificatie per implementatie of contextlengte.
- 02Richtwaarde op basis van de rekenlogica in dit dossier: onder ongeveer 10 uur opnames per maand blijft een per-minuut-dienst doorgaans goedkoper, omdat de instapdrempel voor eigen GPU-capaciteit dan nog niet is terugverdiend. Geen vaste grens, het exacte omslagpunt verschuift met de actuele tarieven op /gpu-huren.
- 03Eigen praktijkcijfer, stand medio 2026: 57 agents over 5 servers, lokaal en cloud, volledig automatisch, voor onze eigen drie bedrijven. Geen belofte voor jouw situatie.
OVER DE AUTEURS
Oprichter
Bouwt en runt MKB Compute samen met Tom. Verantwoordelijk voor operations, agent-orkestratie en klant-implementatie.
Oprichter
Bouwt en runt MKB Compute samen met Milan. Verantwoordelijk voor sales, klant-relatie en technische architectuur.
/ FAQ/VEELGESTELDE VRAGEN
Wat je waarschijnlijk wil weten.
Veelgestelde vragen over dit onderwerp.
Q01
Vanaf wanneer loont GPU huren voor transcriptie?
Een vuistregel: onder een uur of tien per maand is een los abonnement of API-call meestal goedkoper. Loopt dat op tot tientallen uren per maand, dan wordt eigen GPU-capaciteit huren aantrekkelijker. Het exacte omslagpunt hangt af van de actuele tarieven, zie het GPU-prijsoverzicht.
Q02
Hoeveel VRAM vraagt Whisper-transcriptie?
Aanzienlijk minder dan een groot taalmodel: de kleinere Whisper-varianten draaien al op een paar GB VRAM, de grootste varianten met de beste nauwkeurigheid vragen meer, vooral bij batch-verwerking van meerdere bestanden tegelijk.
Q03
Mag een klantgesprek overal getranscribeerd worden?
Niet zonder na te denken over datalocatie en verwerkersovereenkomst. Een klantgesprek bevat persoonsgegevens, dus voor gevoelige gesprekken kijk je naar aanbieders met een Europese datacenterlocatie of naar transcriptie op eigen GPU-capaciteit.
Q04
Is dit relevant voor mijn branche?
Zeker als je structureel opnames van garantiegesprekken, opleveringen of klantgesprekken laat liggen omdat uitwerken tijd kost. Dat geldt voor installateurs, accountants en engineering-bureaus die veel op locatie of met klanten praten.
Q05
Kan MKB Compute dit voor ons inrichten?
Ja. Wij richten transcriptie-workflows in op de aanbieder die bij jouw volume en datagevoeligheid past, of op eigen GPU-capaciteit die wij voor je beheren, en koppelen dat waar gewenst aan je bestaande systemen.
VOLGENDE STAP/AI CAPACITEIT
Plan een capaciteits-gesprek van 30 minuten. Binnen 24 uur reactie.
We luisteren naar je workload, schetsen welke laag het meest oplevert en geven een eerlijke kosten-inschatting.
VERDER LEZEN IN HETZELFDE DOSSIER
Meer uit AI capaciteit en compute.
VELDVERSLAG·9 min
AI capaciteit huren: wanneer GPU's en wanneer agents
Het belangrijkste beslismoment in AI capaciteit: vermenigvuldig je compute of vermenigvuldig je mensen. Een eerlijk beslismodel voor MKB.
Lees verder →VELDVERSLAG·10 min
AVG en je AI-werkplek: wat moet je geregeld hebben
Wat AVG-bewust opzetten van een AI-werkplek in de praktijk betekent. Een concrete checklist, eerlijk geformuleerd, zonder schijngaranties.
Lees verder →VELDVERSLAG·11 min
AI-capaciteit kosten 2026: wat kost GPU-compute voor MKB?
Echte prijzen voor AI-rekenkracht in 2026: van 0,99 euro per GPU-uur tot een eigen server. Met een rekenmodel van GPU-uur naar maandkosten, plus de vraag of je die GPU wel nodig hebt.
Lees verder →VELDVERSLAG·10 min
Hoeveel VRAM heb je nodig voor een AI-model?
GB per model, in gewone taal. Van een 7B-model dat op een zware laptop past tot een 70B-model dat om datacenter-GPU's vraagt, plus de vertaalslag naar wat dat kost.
Lees verder →