Ce que coûte vraiment le fait de ne rien envoyer
Un modèle vocal qui tient dans un navigateur est plus petit qu’un modèle tournant sur une baie de serveurs. Voici l’ampleur de cet écart, mesurée sur le même audio, pour les neuf langues.
taux d’erreur sur les mots, plus bas est mieux · FLEURS test · n = 111–120 · 2026-09-26
Comment la mesure a été faite
Les deux systèmes ont reçu les mêmes 150 phrases par langue, tirées du jeu de test FLEURS de Google, sur la même machine, avec la même normalisation : casse et ponctuation ignorées. Une phrase est entièrement exclue si son texte de référence, ou la sortie de l’un des deux systèmes, contient des chiffres — « 1940 » et « mille neuf cent quarante » sont tous deux corrects, et aucune règle unique ne normalise cela dans neuf langues. Ce sont les mêmes phrases qui sont écartées pour les deux systèmes, et les écarter élargit l’écart au lieu de le réduire. Le système de référence est Whisper large-v3, le modèle qu’utilisent la plupart des services de transcription en ligne gratuits, quantisé en q5_0. Beaucoup de services gratuits utilisent en réalité une variante plus petite de Whisper : l’écart montré ici est donc le plus large auquel s’attendre.
Ce que ces chiffres ne disent pas
FLEURS est de la parole lue enregistrée au calme : les deux colonnes sont donc optimistes par rapport à un vrai enregistrement de réunion. Lisez l’écart entre les colonnes, pas les valeurs absolues. FLEURS ne fournit par ailleurs que l’espagnol d’Amérique latine et le portugais du Brésil ; les variantes européennes de ces deux langues ne sont pas mesurées séparément.
La vitesse est la fraction de temps réel nécessaire à la transcription : 0,20× signifie qu’une heure d’enregistrement prend douze minutes. Mesurée sur un portable Apple à puce M ; sur votre machine ce sera différent.