arthur.bebou

Le site arthur.bebou.netlib.re - retour accueil

Anonyme, en lecture seule : git clone git://bebou.netlib.re/arthur.bebou
Authentifié·e, en écriture : git clone ssh://git@bebou.netlib.re:1459/srv/git/arthur.bebou

Log | Files | Refs | zip | tar.gz |

index.sh (17158B)


      1 #! page
      2 title: Les IA de transcription d\'audio font-t\-elles baisser la qualité des sous-titres \?
      3 author: Arthur Pons
      4 description: du moins pour le moment
      5 publication: 2026-12-23
      6 
      7 section: main
      8 
      9 **Attention: cet article raconte plus ou moins n'importe quoi.  
     10 Puisque je consulte presque tous les jours la liste des vidéos de mes
     11 abonnements je les regarde généralement très peu de temps après leurs
     12 publications. C'était le cas de la vidéo de Veritasium sur le caoutchoux. A ce
     13 moment seuls les sous-titres automatiques étaient disponibles. Lors de
     14 l'écriture je me suis rendu compte que la vidéo proposait des sous-titres
     15 "manuels" dès le lendemain. L'hypothèse que je formule dans cet article au sujet
     16 de la dégradation de la qualité des sous-titres pour les grosses productions
     17 n'est donc pas corroborée par l'exemple de Veritasium. Puisqu'il se pourrait que
     18 ce soit vrai pour d'autres chaînes je publie tout de même l'article en le
     19 modifiant légèrement**
     20 
     21 **Ah aussi, je connais rien au monde du sous-titrage donc je raconte sûrement
     22 n'imp**.
     23 
     24 ----
     25 
     26 ## L'émergence des IA de transcription
     27 
     28 Depuis quelques temps maintenant le domaine de la transcription automatique
     29 d'audio a été chamboulé par l'arrivée des modèles des intelligences
     30 artificielles à "self-supervised transformers". Entre nous, j'y connais rien.
     31 Simplement entre Chirp de Google, Whisper d'OpenAI, et les nombreux modèles
     32 d'Nvidia il n'a à priori jamais été aussi facile de transcrire de l'audio avec
     33 une précision relativement bonne. Whisper étant open source[^1] même framasoft
     34 est entré dans la danse avec [lokas](https://lokas.app/fr/). D'ailleurs [n
     35 leaderboard](https://huggingface.co/spaces/hf-audio/open_asr_leaderboard) des
     36 modèles classés par justesse est disponible sur Huggingface.
     37 
     38 Il se trouve que j'aime beaucoup les sous-titres. J'en utilise dès que je peux,
     39 y compris parfois pour les vidéos en français. C'est selon moi un excellent
     40 exemple de mesure d'accessibilité qui profite à tout le monde. Pour certaines
     41 châines Youtube, dont je sais que les sous-titres sont de très bonne qualité et
     42 les images rarement utiles, il m'arrive même de ne télécharger que les
     43 sous-titres et les lire comme si la vidéo était un article écrit.
     44 
     45 C'est donc avec tristesse que je constate que les sous-titres de certaines
     46 chaînes auxquelles je suis abonné sont de mois bonne qualité que par le passé
     47 et je pense savoir qui blamer.
     48 
     49 ## L'exemple de Veritasium
     50 
     51 Prenons pour exemple la chaîne de vulgarisation scientifique[^2] [Veritasium].
     52 Veritasium a débuté avec son fondateur Derek posant des questions de culture
     53 générale scientifique à des personnes sur un campus universitaire australien
     54 dans des vidéos courtes de quelques minutes. La chaîne s'est assez rapidement
     55 professionalisée, produisant des vidéos avec un meilleur son, une meilleure
     56 image, mieux écrites et plus longues[^3]. Avec cette amélioration de la
     57 production sont arrivés les sous-titres. Par exemple, la vidéo concernant la
     58 préférence que certains moustiques ont pour certains personnes propose une très
     59 grande liste de sous-titres automatiques, la plupart traduits depuis l'anglais,
     60 mais également cinq pistes de sous-titres "manuels" :
     61 
     62     $ yt-dlp --list-subs --simulate https://www.youtube.com/watch?v=38gVZgE39K8
     63     [...]
     64     [info] Available subtitles for 38gVZgE39K8:
     65     Language Name                Formats
     66     ar       Arabic              vtt, srt, ttml, srv3, srv2, srv1, json3
     67     en       English             vtt, srt, ttml, srv3, srv2, srv1, json3
     68     fr       French              vtt, srt, ttml, srv3, srv2, srv1, json3
     69     pt-BR    Portuguese (Brazil) vtt, srt, ttml, srv3, srv2, srv1, json3
     70     es       Spanish             vtt, srt, ttml, srv3, srv2, srv1, json3
     71 
     72 Ces sous-titres ont probablement été produits par une entreprise spécialisée
     73 payé par Veritasium pour transcrire la vidéo. Vous pouvez récupérer la version
     74 vtt anglaise [ici](/whisper-qualite-sub/mosquito.vtt) ou la télécharger vous
     75 même avec `yt-dlp` ainsi :
     76 
     77     $ yt-dlp --write-subs --skip-download https://www.youtube.com/watch?v=38gVZgE39K8
     78 
     79 Au visionnage de la vidéo il devient évident que ces sous-titres ont été écrits
     80 par des humain·es. Par exemple dans cet extrait au tout début de la vidéo :
     81 
     82 > 00:00:45.200 --> 00:00:50.660
     83 > Derek: Here, he maintains colonies of many different species of mosquitoes, and one exotic strain
     84 > 
     85 > 00:00:50.760 --> 00:00:53.420
     86 > he actually feeds with his own blood(!)
     87 > 
     88 > 00:00:53.420 --> 00:00:56.620
     89 > Hansen: No, no, I'm serious. These ones are made from my blood.
     90 > 
     91 > 00:00:56.740 --> 00:00:58.780
     92 > D: Really!?
     93 > H: Yes! Absolutely, yeah.
     94 > 
     95 > 00:00:58.900 --> 00:01:03.800
     96 > D: You feed these!?
     97 > H: And I'm the only one feeding them - I can't ask my students, you know, that would be a nightmare
     98 
     99 on remarque que les sous-titres désignent qui parle dans la pièce, la vidéo ne
    100 montrant pas toujours les visages des personnes. Les sous-titres ajoutent même
    101 un peu d'émotion avec le `(!)` puis raccourcisent les noms des deux
    102 protagonistes pour le reste de la vidéo.
    103 
    104 Plus tard on peut voir cet extrait :
    105 
    106 > 00:10:20.820 --> 00:10:24.740
    107 > D: is it just by accident that some people are less attractive to mosquitoes than others?
    108 >
    109 > 00:10:25.780 --> 00:10:27.560
    110 > H: .......
    111 >
    112 > 00:10:27.560 --> 00:10:30.620
    113 > H: ...That is a really good question!
    114 > [both laugh]
    115 
    116 ou celui-ci :
    117 
    118 > 00:07:08.320 --> 00:07:15.660
    119 > D: DNA. So, at the first location, you have one copy of a letter change which actually makes you significantly
    120 >
    121 > 00:07:15.900 --> 00:07:18.660
    122 > D: *protected* from mosquitoes.
    123 > R: Oh, no way!
    124 
    125 dans lequel les sous-titres rendent compte de l'ambiance de la conversation avec
    126 des pauses et des didascalyes. Dans l'ensemble les sous-titres ne contiennent
    127 aucune erreur de transcription y compris sur des composés chimiques :
    128 
    129 > 00:09:09.460 --> 00:09:17.780
    130 > Those chemicals we naturally give off are octanal, nonanal, decanal, and 6-methyl-5-hepten-2-one.
    131 
    132 On peut comparer ces sous-titres avec ceux de [la dernière vidéo concernant le
    133 caoutchoux](https://www.youtube.com/watch?v=AFXLZ7FEJc4). Elle ne comporte que
    134 des sous-titres automatiques, à priori générés par Youtube avec `chirp`. Le
    135 fichier anglais est [ici (300Ko)](/whisper-qualite-sub/rubber.en.vtt). Voici le
    136 tout début de la vidéo :
    137 
    138 > 00:00:00.880 --> 00:00:02.869 align:start position:0%
    139 >
    140 > What<00:00:01.199><c> happens</c><00:00:01.520><c> if</c><00:00:01.760><c> I</c><00:00:01.920><c> heat</c><00:00:02.159><c> up</c><00:00:02.320><c> this</c><00:00:02.560><c> rubber</c>
    141 >
    142 > 00:00:02.869 --> 00:00:02.879 align:start position:0%
    143 > What happens if I heat up this rubber
    144 >
    145 >
    146 > 00:00:02.879 --> 00:00:05.510 align:start position:0%
    147 > What happens if I heat up this rubber
    148 > band?<00:00:03.600><c> When</c><00:00:03.840><c> you</c><00:00:04.080><c> heat</c><00:00:04.400><c> materials</c><00:00:04.880><c> like</c><00:00:05.200><c> glass</c>
    149 >
    150 > 00:00:05.510 --> 00:00:05.520 align:start position:0%
    151 > band? When you heat materials like glass
    152 >
    153 >
    154 > 00:00:05.520 --> 00:00:08.629 align:start position:0%
    155 > band? When you heat materials like glass
    156 > or<00:00:05.839><c> plastic,</c><00:00:06.560><c> the</c><00:00:06.879><c> atoms</c><00:00:07.359><c> vibrate</c><00:00:07.839><c> faster.</c>
    157 
    158 Première remarque, le transcripteur automatique fait un usage plus poussé du
    159 format `vtt`. Il encode un peu de style (`align:start position:0%`) et fait
    160 apparaitre les mots un à un au fur et à mesure qu'ils sont prononcés.
    161 Personnellement je n'ai pas ne vois pas bien l'intérêt hormis pour éviter de
    162 spoiler la fin d'une phrase, ce qu'un humain peut également faire en
    163 s'arrangeant avec l'affichage des sous-titre. Ca donne un style un peu `tik`
    164 `tok` `je` `te` `montre` `un` `mot` `à` `la` `fois`. Cet encodage de
    165 sous-titrage met à mal ma pratique de lecture de sous-titre dont je parlais plus
    166 tôt mais il est possible de le contourner en téléchargeant un format plus simple
    167 comme les srt.
    168 
    169 Les vrais soucis commencent lorsque l'on s'intéresse à la qualité de ce qui a
    170 été transcrit. Par exemple :
    171 
    172 > 00:38:14.870 --> 00:38:14.880 align:start position:0%
    173 > permission in night trial we see maybe
    174 
    175 Vers la fin de la vidéo il est question du "nirtal", un composant de certains
    176 caoutchoux. Non seulement le transcripteur se trompe en l'écrivant "night trial"
    177 mais il n'est pas cohérent avec lui même puisque plus tard il l'écrit
    178 encore autrement :
    179 
    180 > 00:38:24.069 --> 00:38:24.079 align:start position:0%
    181 > &gt;&gt; Nitrial gloves were developed in the
    182 
    183 Il lui arrive aussi de faire des erreurs sur des mots assez communs comme
    184 "flakes" :
    185 
    186 > 00:23:14.230 --> 00:23:14.240 align:start position:0%
    187 > flexcks of soot. But by the afternoon,
    188 
    189 Lorsque Derek discute avec ??? les sous-titres n'offrent aucune indication
    190 sur la personne en train de parler :
    191 
    192 > 00:34:44.000 --> 00:34:45.349 align:start position:0%
    193 > &gt;&gt; So stretch stretch it fast. What do you
    194 > notice?
    195 >
    196 > 00:34:45.349 --> 00:34:45.359 align:start position:0%
    197 > notice?
    198 >
    199 >
    200 > 00:34:45.359 --> 00:34:46.869 align:start position:0%
    201 > notice?
    202 > &gt;&gt; It's<00:34:45.520><c> a</c><00:34:45.679><c> little</c><00:34:45.839><c> warm.</c><00:34:46.320><c> Maybe</c>
    203 >
    204 > 00:34:46.869 --> 00:34:46.879 align:start position:0%
    205 > &gt;&gt; It's a little warm. Maybe
    206 >
    207 >
    208 > 00:34:46.879 --> 00:34:48.550 align:start position:0%
    209 > &gt;&gt; It's a little warm. Maybe
    210 > &gt;&gt; it's<00:34:47.119><c> hot.</c><00:34:47.440><c> It's</c><00:34:47.599><c> gone</c><00:34:47.760><c> up</c><00:34:47.919><c> in</c><00:34:48.079><c> temperature</c><00:34:48.320><c> by</c>
    211 >
    212 > 00:34:48.550 --> 00:34:48.560 align:start position:0%
    213 > &gt;&gt; it's hot. It's gone up in temperature by
    214 
    215 L'exemple ici n'est pas très flagrant puisque le montage montre systématiquement
    216 à l'écran la personne en train de parler. Dans un cas similaire à la vidéo
    217 sur les moustiques la situation pourrait être particulièrement confuse pour une
    218 personne n'entendant pas les voix. De plus les lignes sont terminées sans grand
    219 soin apporté à la logique de la conversation donnant l'impression d'un flot
    220 ininterrompu de parole.
    221 
    222 On note tout de même que le modèle est capable de reconnaître des moments sans
    223 discours avec de la musique en fond :
    224 
    225 > 00:33:43.990 --> 00:33:44.000 align:start position:0%
    226 > [Music]
    227 
    228 Le lendemain de la publication la chaîne a ajouté des sous-titres elle-même. Ils
    229 sont, je trouve, de meilleur qualité. Evidemment on ne retrouve pas les fautes
    230 d'orthographe :
    231 
    232 > 00:23:10.770 --> 00:23:12.330
    233 > like flakes of soot.
    234 >
    235 > [...]
    236 >
    237 > 00:37:55.830 --> 00:37:58.620
    238 > Nitrile rubber, a synthetic
    239 > rubber used for gloves,
    240 
    241 et le rythme est bien meilleur. On retrouve également les indications de qui
    242 parle mais avec plus d'économie que la vidéo sur les moustiques. Par exemple,
    243 vers 10m30s Derek parle visiblement à la caméra puis la vidéo coupe vers une
    244 animation racontée par une autre personne. Il n'est plus possible d'induire qui
    245 parle depuis la vidéo alors l'information apparaît dans les sous-titres.
    246 
    247 > 00:10:31.620 --> 00:10:35.190
    248 > by walking around in all rubber outfits.
    249 >
    250 > 00:10:35.190 --> 00:10:36.840
    251 > - [Henry] His hands were always covered
    252 >
    253 > 00:10:36.840 --> 00:10:38.190
    254 > with gum elastic.
    255 
    256 On trouve une seule dydascalie à la fin :
    257 
    258 > 00:40:55.097 --> 00:40:58.180
    259 > (bright music fades)
    260 
    261 Il est tout à fait possible que ces sous-titres soient générés au moins
    262 partiellement automatiquement puis corrigés à la main, par une entreprise
    263 spécialisée ou l'équipe elle même[^4].
    264 
    265 ## Baisse de la qualité : pourquoi et pour qui ?
    266 
    267 **L'argument développé ici n'est pas soutenu par l'exemple de Veritasium. Il est
    268 peut-être vrai pour d'autres chaînes mais faute de preuve il se peut qu'il soit
    269 totalement fantasque.**
    270 
    271 Youtube a lancé la [transcription automatique en novembre
    272 2009](https://research.google/blog/automatic-captioning-in-youtube/). De mémoire
    273 la justesse du système laissait à désirer, même pour l'anglais qui n'avait pas à
    274 passer par une étape de traduction. Quelques centaines de millier de vidéos
    275 seulement avaient des sous-titres et très peu de chaînes avaient de grosses
    276 productions. Autrement dit la transription automatique, aussi mauvaise
    277 soit-elle, était du pur bonus. Si elle était mauvaise, tant pis, et si l'on
    278 parlait anglais, que l'on avait un accent américain prototypique et une bonne
    279 diction, tant mieux.
    280 
    281 Avec la professionalisation de Youtube de plus en plus de grosses chaînes ont
    282 commencé à vouloir proposer des sous-titres. A ce stade là l'outil de
    283 transcription automatique n'était pas d'une qualité satisfaisante pour quiconque
    284 se prennait un peu au sérieux. La seule option était alors de transcrire la
    285 vidéo soit-même ou de payer une personne pour le faire. Dans les deux cas ça
    286 coûtait cher.
    287 
    288 Avec l'avènement des transformeurs, des gros datasets et des gros GPU les
    289 systèmes de transcription ont fait un grand bond en avant en terme de qualité.
    290 Soudainement il était possible d'avoir une transcription pour pas cher[^5] et
    291 honorable. Le rapport qualité/prix étant dorénavant à l'avantage de la
    292 transcription automatique, selon que l'on accorde beaucoup d'importance aux
    293 subtilités documentées plus tôt, certaines chaînes ont délaissés les sous-titres
    294 professionels pour la transcription automatique. Autrement dit *les outils de
    295 transcription automatique sont perçus comme suffisamment bons pour être
    296 substitués à de la transcription professionelles par certaines productions mais
    297 encore trop mauvais pour égaler leurs qualités*. Les sous-titres des vidéos
    298 concernées voient donc leur qualité baisser. *Cette situation concernerait
    299 paradoxalement les productions soucieuses d'avoir des sous-titres de qualité*,
    300 ayant donc eu recours à du sous-titrage professionnel durant des années.
    301 
    302 Les conclusions du paragraphes précédant paraissent moins probable suite à
    303 l'upload de sous-titre par Veritasium. Il est cependant probable que la qualité
    304 croissante du sous-titre automatique ait par ailleurs une influence sur le monde
    305 du sous-titrage professionnel. Etant donné le temps que cela peut économiser je
    306 serais très surpris que les boites spécialisée ne travaillent pas en
    307 corrigeant/remaniant des transcriptions génèrées automatiquement. Comment cela
    308 impacte-t-il la qualité des sous-titres ? Est-ce que ce pourrait être la raison
    309 derrière le style un peu différent des sous-titres "manuels" de la vidéo des
    310 moustiques et de la vidéo du caoutchoux[^6] ? Je ne sais pas, il faudrait
    311 demander à une personne du métier.
    312 
    313 Une chose est sûr, la transcription automatique à fait exploser le nombre de
    314 vidéo sous-titrée. Boostée par la consommation de vidéo courtes dans des lieux
    315 communs où la bien séance nous dicte de ne pas mettre ses hauts-parleur, il est
    316 possible qu'une proportion croissante de vidéos produites soit sous-titrée, même
    317 mal.
    318 
    319 ## L'avenir du sous-titrage automatique et son sombre secret
    320 
    321 Aujourd'hui c'est moins bien que les humains mais c'est beaucoup mieux qu'avant.
    322 Il est très probable que ça s'améliorer, monsieur phi. Pas parce que la
    323 tehcnique magique le progrés mais parce que les gros ont un intérêt économique.
    324 
    325 En 2009 Google dit que c'est pour l'accéssibilité : https://research.google/blog/automatic-captioning-in-youtube/
    326 A priori c'est pas parce que c'est des gentils mais c'est pour étendre
    327 l'ensemble de vidéos qu'une personne donnée, avant sa langue etc, peut regarder.
    328 Youtube n'est encore qu'au début de sa phase d'expansion et le nerf de la guerre
    329 est simple, faire croître la quantité de contenu et croître les heures de
    330 visionnage.
    331 
    332 Des années plus tard, Youtube 
    333 
    334 Est-ce que le but de whisper c'est pas juste de faire du texet pour les LLM,
    335 comme le but de markitdown est des générer du texte pour les LLM ?
    336 
    337 https://www.theverge.com/2024/4/6/24122915/openai-youtube-transcripts-gpt-4-training-data-google
    338 
    339 Anna's archive financé par les LLM
    340 
    341 [^1]: dans la où une énorme IA entrainée sur on sait pas trop quoi peut l'être
    342 [^2]: et aprfois de [pub déguiser pour la tech], voir [cette vidéo]
    343 [^3]: bien que l'ancienne règle Youtube ne permettant l'ajout de pubs
    344     supplémentaires au milieu de la vidéo que si elle dépasse les 10 minutes n'y
    345     soit pas pour rien non plus. A l'époque les titres et les miniatures n'étant
    346     pas encore trop clickbait, c'est en regardant la longueur des vidéos que
    347     l'on pouvait supposer de leurs qualités avant des les avoir regarder. Une
    348     vidéo de 12m34 ou 9m15s de long étaient probablement honnêtes, une vidéo de
    349     10m02s avait plus de chance d'être pleine de filler.
    350 [^4]: mais personne n'est crédités à ce sujet
    351 [^5]: voir gratuitement du point de vue de la personne qui fait la vidéo puisque
    352     youtube ne fait pas payer la transcription automatique
    353 [^6]: ou certainement : avec 8 ans d'écart entre les deux, le sous-titrage n'a
    354     pas été fait par les mêmes personnes avec les mêmes pratiques et outils.