Le site arthur.bebou.netlib.re - retour accueil
Anonyme, en lecture seule : git clone git://bebou.netlib.re/arthur.bebou
Authentifié·e, en écriture : git clone ssh://git@bebou.netlib.re:1459/srv/git/arthur.bebou
Log | Files | Refs | zip | tar.gz |
index.sh (17158B)
1 #! page
2 title: Les IA de transcription d\'audio font-t\-elles baisser la qualité des sous-titres \?
3 author: Arthur Pons
4 description: du moins pour le moment
5 publication: 2026-12-23
6
7 section: main
8
9 **Attention: cet article raconte plus ou moins n'importe quoi.
10 Puisque je consulte presque tous les jours la liste des vidéos de mes
11 abonnements je les regarde généralement très peu de temps après leurs
12 publications. C'était le cas de la vidéo de Veritasium sur le caoutchoux. A ce
13 moment seuls les sous-titres automatiques étaient disponibles. Lors de
14 l'écriture je me suis rendu compte que la vidéo proposait des sous-titres
15 "manuels" dès le lendemain. L'hypothèse que je formule dans cet article au sujet
16 de la dégradation de la qualité des sous-titres pour les grosses productions
17 n'est donc pas corroborée par l'exemple de Veritasium. Puisqu'il se pourrait que
18 ce soit vrai pour d'autres chaînes je publie tout de même l'article en le
19 modifiant légèrement**
20
21 **Ah aussi, je connais rien au monde du sous-titrage donc je raconte sûrement
22 n'imp**.
23
24 ----
25
26 ## L'émergence des IA de transcription
27
28 Depuis quelques temps maintenant le domaine de la transcription automatique
29 d'audio a été chamboulé par l'arrivée des modèles des intelligences
30 artificielles à "self-supervised transformers". Entre nous, j'y connais rien.
31 Simplement entre Chirp de Google, Whisper d'OpenAI, et les nombreux modèles
32 d'Nvidia il n'a à priori jamais été aussi facile de transcrire de l'audio avec
33 une précision relativement bonne. Whisper étant open source[^1] même framasoft
34 est entré dans la danse avec [lokas](https://lokas.app/fr/). D'ailleurs [n
35 leaderboard](https://huggingface.co/spaces/hf-audio/open_asr_leaderboard) des
36 modèles classés par justesse est disponible sur Huggingface.
37
38 Il se trouve que j'aime beaucoup les sous-titres. J'en utilise dès que je peux,
39 y compris parfois pour les vidéos en français. C'est selon moi un excellent
40 exemple de mesure d'accessibilité qui profite à tout le monde. Pour certaines
41 châines Youtube, dont je sais que les sous-titres sont de très bonne qualité et
42 les images rarement utiles, il m'arrive même de ne télécharger que les
43 sous-titres et les lire comme si la vidéo était un article écrit.
44
45 C'est donc avec tristesse que je constate que les sous-titres de certaines
46 chaînes auxquelles je suis abonné sont de mois bonne qualité que par le passé
47 et je pense savoir qui blamer.
48
49 ## L'exemple de Veritasium
50
51 Prenons pour exemple la chaîne de vulgarisation scientifique[^2] [Veritasium].
52 Veritasium a débuté avec son fondateur Derek posant des questions de culture
53 générale scientifique à des personnes sur un campus universitaire australien
54 dans des vidéos courtes de quelques minutes. La chaîne s'est assez rapidement
55 professionalisée, produisant des vidéos avec un meilleur son, une meilleure
56 image, mieux écrites et plus longues[^3]. Avec cette amélioration de la
57 production sont arrivés les sous-titres. Par exemple, la vidéo concernant la
58 préférence que certains moustiques ont pour certains personnes propose une très
59 grande liste de sous-titres automatiques, la plupart traduits depuis l'anglais,
60 mais également cinq pistes de sous-titres "manuels" :
61
62 $ yt-dlp --list-subs --simulate https://www.youtube.com/watch?v=38gVZgE39K8
63 [...]
64 [info] Available subtitles for 38gVZgE39K8:
65 Language Name Formats
66 ar Arabic vtt, srt, ttml, srv3, srv2, srv1, json3
67 en English vtt, srt, ttml, srv3, srv2, srv1, json3
68 fr French vtt, srt, ttml, srv3, srv2, srv1, json3
69 pt-BR Portuguese (Brazil) vtt, srt, ttml, srv3, srv2, srv1, json3
70 es Spanish vtt, srt, ttml, srv3, srv2, srv1, json3
71
72 Ces sous-titres ont probablement été produits par une entreprise spécialisée
73 payé par Veritasium pour transcrire la vidéo. Vous pouvez récupérer la version
74 vtt anglaise [ici](/whisper-qualite-sub/mosquito.vtt) ou la télécharger vous
75 même avec `yt-dlp` ainsi :
76
77 $ yt-dlp --write-subs --skip-download https://www.youtube.com/watch?v=38gVZgE39K8
78
79 Au visionnage de la vidéo il devient évident que ces sous-titres ont été écrits
80 par des humain·es. Par exemple dans cet extrait au tout début de la vidéo :
81
82 > 00:00:45.200 --> 00:00:50.660
83 > Derek: Here, he maintains colonies of many different species of mosquitoes, and one exotic strain
84 >
85 > 00:00:50.760 --> 00:00:53.420
86 > he actually feeds with his own blood(!)
87 >
88 > 00:00:53.420 --> 00:00:56.620
89 > Hansen: No, no, I'm serious. These ones are made from my blood.
90 >
91 > 00:00:56.740 --> 00:00:58.780
92 > D: Really!?
93 > H: Yes! Absolutely, yeah.
94 >
95 > 00:00:58.900 --> 00:01:03.800
96 > D: You feed these!?
97 > H: And I'm the only one feeding them - I can't ask my students, you know, that would be a nightmare
98
99 on remarque que les sous-titres désignent qui parle dans la pièce, la vidéo ne
100 montrant pas toujours les visages des personnes. Les sous-titres ajoutent même
101 un peu d'émotion avec le `(!)` puis raccourcisent les noms des deux
102 protagonistes pour le reste de la vidéo.
103
104 Plus tard on peut voir cet extrait :
105
106 > 00:10:20.820 --> 00:10:24.740
107 > D: is it just by accident that some people are less attractive to mosquitoes than others?
108 >
109 > 00:10:25.780 --> 00:10:27.560
110 > H: .......
111 >
112 > 00:10:27.560 --> 00:10:30.620
113 > H: ...That is a really good question!
114 > [both laugh]
115
116 ou celui-ci :
117
118 > 00:07:08.320 --> 00:07:15.660
119 > D: DNA. So, at the first location, you have one copy of a letter change which actually makes you significantly
120 >
121 > 00:07:15.900 --> 00:07:18.660
122 > D: *protected* from mosquitoes.
123 > R: Oh, no way!
124
125 dans lequel les sous-titres rendent compte de l'ambiance de la conversation avec
126 des pauses et des didascalyes. Dans l'ensemble les sous-titres ne contiennent
127 aucune erreur de transcription y compris sur des composés chimiques :
128
129 > 00:09:09.460 --> 00:09:17.780
130 > Those chemicals we naturally give off are octanal, nonanal, decanal, and 6-methyl-5-hepten-2-one.
131
132 On peut comparer ces sous-titres avec ceux de [la dernière vidéo concernant le
133 caoutchoux](https://www.youtube.com/watch?v=AFXLZ7FEJc4). Elle ne comporte que
134 des sous-titres automatiques, à priori générés par Youtube avec `chirp`. Le
135 fichier anglais est [ici (300Ko)](/whisper-qualite-sub/rubber.en.vtt). Voici le
136 tout début de la vidéo :
137
138 > 00:00:00.880 --> 00:00:02.869 align:start position:0%
139 >
140 > What<00:00:01.199><c> happens</c><00:00:01.520><c> if</c><00:00:01.760><c> I</c><00:00:01.920><c> heat</c><00:00:02.159><c> up</c><00:00:02.320><c> this</c><00:00:02.560><c> rubber</c>
141 >
142 > 00:00:02.869 --> 00:00:02.879 align:start position:0%
143 > What happens if I heat up this rubber
144 >
145 >
146 > 00:00:02.879 --> 00:00:05.510 align:start position:0%
147 > What happens if I heat up this rubber
148 > band?<00:00:03.600><c> When</c><00:00:03.840><c> you</c><00:00:04.080><c> heat</c><00:00:04.400><c> materials</c><00:00:04.880><c> like</c><00:00:05.200><c> glass</c>
149 >
150 > 00:00:05.510 --> 00:00:05.520 align:start position:0%
151 > band? When you heat materials like glass
152 >
153 >
154 > 00:00:05.520 --> 00:00:08.629 align:start position:0%
155 > band? When you heat materials like glass
156 > or<00:00:05.839><c> plastic,</c><00:00:06.560><c> the</c><00:00:06.879><c> atoms</c><00:00:07.359><c> vibrate</c><00:00:07.839><c> faster.</c>
157
158 Première remarque, le transcripteur automatique fait un usage plus poussé du
159 format `vtt`. Il encode un peu de style (`align:start position:0%`) et fait
160 apparaitre les mots un à un au fur et à mesure qu'ils sont prononcés.
161 Personnellement je n'ai pas ne vois pas bien l'intérêt hormis pour éviter de
162 spoiler la fin d'une phrase, ce qu'un humain peut également faire en
163 s'arrangeant avec l'affichage des sous-titre. Ca donne un style un peu `tik`
164 `tok` `je` `te` `montre` `un` `mot` `à` `la` `fois`. Cet encodage de
165 sous-titrage met à mal ma pratique de lecture de sous-titre dont je parlais plus
166 tôt mais il est possible de le contourner en téléchargeant un format plus simple
167 comme les srt.
168
169 Les vrais soucis commencent lorsque l'on s'intéresse à la qualité de ce qui a
170 été transcrit. Par exemple :
171
172 > 00:38:14.870 --> 00:38:14.880 align:start position:0%
173 > permission in night trial we see maybe
174
175 Vers la fin de la vidéo il est question du "nirtal", un composant de certains
176 caoutchoux. Non seulement le transcripteur se trompe en l'écrivant "night trial"
177 mais il n'est pas cohérent avec lui même puisque plus tard il l'écrit
178 encore autrement :
179
180 > 00:38:24.069 --> 00:38:24.079 align:start position:0%
181 > >> Nitrial gloves were developed in the
182
183 Il lui arrive aussi de faire des erreurs sur des mots assez communs comme
184 "flakes" :
185
186 > 00:23:14.230 --> 00:23:14.240 align:start position:0%
187 > flexcks of soot. But by the afternoon,
188
189 Lorsque Derek discute avec ??? les sous-titres n'offrent aucune indication
190 sur la personne en train de parler :
191
192 > 00:34:44.000 --> 00:34:45.349 align:start position:0%
193 > >> So stretch stretch it fast. What do you
194 > notice?
195 >
196 > 00:34:45.349 --> 00:34:45.359 align:start position:0%
197 > notice?
198 >
199 >
200 > 00:34:45.359 --> 00:34:46.869 align:start position:0%
201 > notice?
202 > >> It's<00:34:45.520><c> a</c><00:34:45.679><c> little</c><00:34:45.839><c> warm.</c><00:34:46.320><c> Maybe</c>
203 >
204 > 00:34:46.869 --> 00:34:46.879 align:start position:0%
205 > >> It's a little warm. Maybe
206 >
207 >
208 > 00:34:46.879 --> 00:34:48.550 align:start position:0%
209 > >> It's a little warm. Maybe
210 > >> it's<00:34:47.119><c> hot.</c><00:34:47.440><c> It's</c><00:34:47.599><c> gone</c><00:34:47.760><c> up</c><00:34:47.919><c> in</c><00:34:48.079><c> temperature</c><00:34:48.320><c> by</c>
211 >
212 > 00:34:48.550 --> 00:34:48.560 align:start position:0%
213 > >> it's hot. It's gone up in temperature by
214
215 L'exemple ici n'est pas très flagrant puisque le montage montre systématiquement
216 à l'écran la personne en train de parler. Dans un cas similaire à la vidéo
217 sur les moustiques la situation pourrait être particulièrement confuse pour une
218 personne n'entendant pas les voix. De plus les lignes sont terminées sans grand
219 soin apporté à la logique de la conversation donnant l'impression d'un flot
220 ininterrompu de parole.
221
222 On note tout de même que le modèle est capable de reconnaître des moments sans
223 discours avec de la musique en fond :
224
225 > 00:33:43.990 --> 00:33:44.000 align:start position:0%
226 > [Music]
227
228 Le lendemain de la publication la chaîne a ajouté des sous-titres elle-même. Ils
229 sont, je trouve, de meilleur qualité. Evidemment on ne retrouve pas les fautes
230 d'orthographe :
231
232 > 00:23:10.770 --> 00:23:12.330
233 > like flakes of soot.
234 >
235 > [...]
236 >
237 > 00:37:55.830 --> 00:37:58.620
238 > Nitrile rubber, a synthetic
239 > rubber used for gloves,
240
241 et le rythme est bien meilleur. On retrouve également les indications de qui
242 parle mais avec plus d'économie que la vidéo sur les moustiques. Par exemple,
243 vers 10m30s Derek parle visiblement à la caméra puis la vidéo coupe vers une
244 animation racontée par une autre personne. Il n'est plus possible d'induire qui
245 parle depuis la vidéo alors l'information apparaît dans les sous-titres.
246
247 > 00:10:31.620 --> 00:10:35.190
248 > by walking around in all rubber outfits.
249 >
250 > 00:10:35.190 --> 00:10:36.840
251 > - [Henry] His hands were always covered
252 >
253 > 00:10:36.840 --> 00:10:38.190
254 > with gum elastic.
255
256 On trouve une seule dydascalie à la fin :
257
258 > 00:40:55.097 --> 00:40:58.180
259 > (bright music fades)
260
261 Il est tout à fait possible que ces sous-titres soient générés au moins
262 partiellement automatiquement puis corrigés à la main, par une entreprise
263 spécialisée ou l'équipe elle même[^4].
264
265 ## Baisse de la qualité : pourquoi et pour qui ?
266
267 **L'argument développé ici n'est pas soutenu par l'exemple de Veritasium. Il est
268 peut-être vrai pour d'autres chaînes mais faute de preuve il se peut qu'il soit
269 totalement fantasque.**
270
271 Youtube a lancé la [transcription automatique en novembre
272 2009](https://research.google/blog/automatic-captioning-in-youtube/). De mémoire
273 la justesse du système laissait à désirer, même pour l'anglais qui n'avait pas à
274 passer par une étape de traduction. Quelques centaines de millier de vidéos
275 seulement avaient des sous-titres et très peu de chaînes avaient de grosses
276 productions. Autrement dit la transription automatique, aussi mauvaise
277 soit-elle, était du pur bonus. Si elle était mauvaise, tant pis, et si l'on
278 parlait anglais, que l'on avait un accent américain prototypique et une bonne
279 diction, tant mieux.
280
281 Avec la professionalisation de Youtube de plus en plus de grosses chaînes ont
282 commencé à vouloir proposer des sous-titres. A ce stade là l'outil de
283 transcription automatique n'était pas d'une qualité satisfaisante pour quiconque
284 se prennait un peu au sérieux. La seule option était alors de transcrire la
285 vidéo soit-même ou de payer une personne pour le faire. Dans les deux cas ça
286 coûtait cher.
287
288 Avec l'avènement des transformeurs, des gros datasets et des gros GPU les
289 systèmes de transcription ont fait un grand bond en avant en terme de qualité.
290 Soudainement il était possible d'avoir une transcription pour pas cher[^5] et
291 honorable. Le rapport qualité/prix étant dorénavant à l'avantage de la
292 transcription automatique, selon que l'on accorde beaucoup d'importance aux
293 subtilités documentées plus tôt, certaines chaînes ont délaissés les sous-titres
294 professionels pour la transcription automatique. Autrement dit *les outils de
295 transcription automatique sont perçus comme suffisamment bons pour être
296 substitués à de la transcription professionelles par certaines productions mais
297 encore trop mauvais pour égaler leurs qualités*. Les sous-titres des vidéos
298 concernées voient donc leur qualité baisser. *Cette situation concernerait
299 paradoxalement les productions soucieuses d'avoir des sous-titres de qualité*,
300 ayant donc eu recours à du sous-titrage professionnel durant des années.
301
302 Les conclusions du paragraphes précédant paraissent moins probable suite à
303 l'upload de sous-titre par Veritasium. Il est cependant probable que la qualité
304 croissante du sous-titre automatique ait par ailleurs une influence sur le monde
305 du sous-titrage professionnel. Etant donné le temps que cela peut économiser je
306 serais très surpris que les boites spécialisée ne travaillent pas en
307 corrigeant/remaniant des transcriptions génèrées automatiquement. Comment cela
308 impacte-t-il la qualité des sous-titres ? Est-ce que ce pourrait être la raison
309 derrière le style un peu différent des sous-titres "manuels" de la vidéo des
310 moustiques et de la vidéo du caoutchoux[^6] ? Je ne sais pas, il faudrait
311 demander à une personne du métier.
312
313 Une chose est sûr, la transcription automatique à fait exploser le nombre de
314 vidéo sous-titrée. Boostée par la consommation de vidéo courtes dans des lieux
315 communs où la bien séance nous dicte de ne pas mettre ses hauts-parleur, il est
316 possible qu'une proportion croissante de vidéos produites soit sous-titrée, même
317 mal.
318
319 ## L'avenir du sous-titrage automatique et son sombre secret
320
321 Aujourd'hui c'est moins bien que les humains mais c'est beaucoup mieux qu'avant.
322 Il est très probable que ça s'améliorer, monsieur phi. Pas parce que la
323 tehcnique magique le progrés mais parce que les gros ont un intérêt économique.
324
325 En 2009 Google dit que c'est pour l'accéssibilité : https://research.google/blog/automatic-captioning-in-youtube/
326 A priori c'est pas parce que c'est des gentils mais c'est pour étendre
327 l'ensemble de vidéos qu'une personne donnée, avant sa langue etc, peut regarder.
328 Youtube n'est encore qu'au début de sa phase d'expansion et le nerf de la guerre
329 est simple, faire croître la quantité de contenu et croître les heures de
330 visionnage.
331
332 Des années plus tard, Youtube
333
334 Est-ce que le but de whisper c'est pas juste de faire du texet pour les LLM,
335 comme le but de markitdown est des générer du texte pour les LLM ?
336
337 https://www.theverge.com/2024/4/6/24122915/openai-youtube-transcripts-gpt-4-training-data-google
338
339 Anna's archive financé par les LLM
340
341 [^1]: dans la où une énorme IA entrainée sur on sait pas trop quoi peut l'être
342 [^2]: et aprfois de [pub déguiser pour la tech], voir [cette vidéo]
343 [^3]: bien que l'ancienne règle Youtube ne permettant l'ajout de pubs
344 supplémentaires au milieu de la vidéo que si elle dépasse les 10 minutes n'y
345 soit pas pour rien non plus. A l'époque les titres et les miniatures n'étant
346 pas encore trop clickbait, c'est en regardant la longueur des vidéos que
347 l'on pouvait supposer de leurs qualités avant des les avoir regarder. Une
348 vidéo de 12m34 ou 9m15s de long étaient probablement honnêtes, une vidéo de
349 10m02s avait plus de chance d'être pleine de filler.
350 [^4]: mais personne n'est crédités à ce sujet
351 [^5]: voir gratuitement du point de vue de la personne qui fait la vidéo puisque
352 youtube ne fait pas payer la transcription automatique
353 [^6]: ou certainement : avec 8 ans d'écart entre les deux, le sous-titrage n'a
354 pas été fait par les mêmes personnes avec les mêmes pratiques et outils.