Was der Verzicht auf den Upload wirklich kostet
Ein Sprachmodell, das in einen Browser passt, ist kleiner als eines auf einem Server-Rack. Hier ist dieser Abstand, auf demselben Audio gemessen, für alle neun Sprachen.
Wortfehlerrate, niedriger ist besser · FLEURS test · n = 111–120 · 2026-09-26
Wie gemessen wurde
Beide Systeme bekamen dieselben 150 Sätze pro Sprache aus Googles FLEURS-Testset, auf derselben Maschine, mit derselben Normalisierung: Groß- und Kleinschreibung sowie Satzzeichen bleiben unberücksichtigt. Ein Satz wird vollständig ausgeschlossen, wenn sein Referenztext oder die Ausgabe eines der beiden Systeme Ziffern enthält — „1940“ und „neunzehnhundertvierzig“ sind beide richtig, und keine einzelne Regel normalisiert das über neun Sprachen hinweg. Ausgeschlossen werden für beide Systeme dieselben Sätze, und das vergrößert den Abstand, statt ihn zu verkleinern. Referenzsystem ist Whisper large-v3, das Modell, das die meisten kostenlosen Online-Transkriptionsdienste einsetzen, quantisiert auf q5_0. Viele kostenlose Dienste setzen tatsächlich eine kleinere Whisper-Variante ein, der hier gezeigte Abstand ist also der größte, mit dem zu rechnen ist.
Was diese Zahlen nicht sagen
FLEURS ist vorgelesene Sprache aus ruhiger Aufnahmeumgebung, beide Spalten sind also optimistisch gegenüber einer echten Besprechungsaufnahme. Lies den Abstand zwischen den Spalten, nicht die absoluten Werte. FLEURS enthält außerdem nur lateinamerikanisches Spanisch und brasilianisches Portugiesisch, die europäischen Varianten dieser beiden Sprachen sind also nicht separat gemessen.
Das Tempo ist der Anteil an Echtzeit, den die Transkription braucht: 0,20× heißt, eine Stunde Aufnahme dauert zwölf Minuten. Gemessen auf einem Apple-Laptop mit M-Chip; auf deinem Rechner fällt es anders aus.