Les grands modèles de langage sont de plus en plus utilisés pour coder de grands corpus en sciences sociales. Mais leur caractère probabiliste pose un problème : le même texte et la même requête peuvent produire des réponses différentes. Comment assurer la fiabilité et la validité des résultats ? À partir d’un projet d’analyse semi-automatisée de pétitions dans la presse russe, je propose de considérer le LLM comme un codeur probabiliste accomplissant des tâches interprétatives. Je discuterai les limites d’une validation fondée principalement sur un codage humain de référence et présenterai une approche alternative combinant répétition des codages, mesure de leur stabilité, audits humains ciblés et conservation explicite des cas ambigus. L’enjeu est de traiter l’incertitude du modèle comme une information à analyser, plutôt que comme un simple défaut.

Intervenant(e)
Guillaume Sauvé
Guillaume Sauvé est chercheur en résidence à l'Institut d'études avancées de Paris. Il enseigne à l’Université du Québec à Montréal et à l’Université de Montréal. Ses recherches se situent à l’intersection de la politique comparée, de la sociologie politique et de l’histoire intellectuelle, avec un intérêt particulier pour la Russie de la fin de l’ère soviétique et de l’après-soviétique. S’appuyant sur des recherches archivistiques et des entretiens, il intègre également des méthodes des sciences sociales computationnelles.
Discutant(e)
Jérémy Robine
Maître de conférence à l'Université Paris 8, directeur de l'Institut français de géopolitique
📍 Campus Condorcet, bâtiment recherche Nord, salle 0.009
🕐 10h00-12h00