Wat niet-uploaden je werkelijk kost
Een spraakmodel dat in een browser past is kleiner dan een model op een serverrek. Dit is hoe groot dat verschil is, gemeten op dezelfde audio, voor alle negen talen.
woordfoutpercentage, lager is beter · FLEURS test · n = 111–120 · 2026-09-26
Hoe dit gemeten is
Beide systemen kregen dezelfde 150 zinnen per taal uit Googles FLEURS-testset, op dezelfde machine, met dezelfde normalisatie: hoofdletters en leestekens tellen niet mee. Een zin wordt volledig uitgesloten als de referentietekst, of de uitvoer van een van beide systemen, cijfers bevat — „1940” en „negentienhonderdveertig” zijn allebei goed, en geen enkele regel normaliseert dat over negen talen heen. Voor beide systemen vallen dezelfde zinnen af, en dat maakt het verschil groter in plaats van kleiner. Het referentiesysteem is Whisper large-v3, het model dat de meeste gratis online transcriptiediensten draaien, gekwantiseerd naar q5_0. Veel gratis diensten draaien in werkelijkheid een kleinere Whisper-variant, dus het verschil dat hier staat is het grootste dat je hoeft te verwachten.
Wat deze cijfers niet zeggen
FLEURS is voorgelezen spraak die in stilte is opgenomen, dus beide kolommen zijn optimistisch vergeleken met een echte vergaderopname. Kijk naar het verschil tussen de kolommen, niet naar de absolute waarden. FLEURS bevat bovendien alleen Latijns-Amerikaans Spaans en Braziliaans Portugees, dus de Europese varianten van die twee zijn niet apart gemeten.
Snelheid is het deel van de echte tijd dat de transcriptie kost: 0,20× betekent dat een opname van een uur twaalf minuten duurt. Gemeten op een Apple-laptop met M-chip; op jouw machine wijkt dat af.