Jump to content

Les lecteurs/Récupération d'informations/Phase 0

From mediawiki.org
This page is a translated version of the page Readers/Information Retrieval/Phase 0 and the translation is 98% complete.

Phase 0 : Validation de l'idée

La Fondation mène actuellement une première phase d'étude afin de mieux comprendre pourquoi les lecteurs trouvent plus facile de trouver des informations Wikipédia ailleurs que sur Wikipédia même, et comment améliorer la recherche d'informations tout en restant fidèle à une connaissance vérifiable et axée sur la communauté.

À ce stade, l'accent est mis sur l'identification de la réalité du problème, la clarification des hypothèses à l'aide de données et des points de vue de la communauté, et la compréhension de nos capacités et limites techniques.

Cette exploration vise notamment à répondre aux questions suivantes :

  • Pourquoi les lecteurs trouvent-ils plus facile de trouver des informations Wikipédia ailleurs que sur Wikipédia même ?
  • Quelles sont les attentes des lecteurs d'aujourd'hui lorsqu'ils recherchent des informations ?
  • Comment améliorer la recherche de réponses au sein de Wikipédia tout en préservant la vérifiabilité et les normes communautaires ?

Objectifs

  • Déterminer si et dans quelle mesure les lecteurs rencontrent de réelles difficultés pour trouver des informations sur Wikipédia.
  • Évaluer les points de vue de la communauté et déterminer les concepts qui méritent d'être testés en production.
  • Déterminer des méthodes opportunes, mais efficaces pour mieux répondre aux besoins des lecteurs.
  • Vérifier la faisabilité de prototypes légers conformes à l'infrastructure et aux normes de confidentialité de Wikimédia.

Hypothèses possibles à évaluer

  • Les lecteurs veulent saisir des requêtes et obtenir des résultats qui vont au-delà de la simple correspondance de mots-clés.
  • Il peut être plus satisfaisant de faire apparaître des extraits et des fragments au niveau des sections plutôt que de renvoyer uniquement vers des articles complets.
  • Présenter des questions dérivées de l'article peut améliorer l'engagement en guidant les lecteurs vers les sections pertinentes et les encourager à explorer plus intuitivement les sujets connexes.

Mesures prises

Depuis octobre 2025, nous prenons actuellement les mesures suivantes pour comprendre et partager nos connaissances dans ce domaine problématique :

  • Examen des recherches antérieures menées auprès des lecteurs sur les frustrations liées à l'expérience de recherche sur Wikipédia.
  • Analyse de la fréquence d'apparition des questions en langage naturel dans les journaux de recherche.
  • Comparaison de la perception des résultats sémantiques et des mots-clés à l'aide de maquettes conceptuelles.
  • Collecte de commentaires qualitatifs auprès de nouveaux lecteurs sur l'affichage d'extraits ou de liens vers des articles complets lors de l'affichage des résultats de requêtes à l'aide de maquettes conceptuelles.
  • Recueillir des commentaires qualitatifs sur la facilité de recherche des informations
  • Étude de faisabilité des infrastructures en vue de modifications apportées à la recherche et à la récupération
  • Réalisation de prototypes internes à petite échelle afin de comprendre diverses approches techniques et contraintes.
    • Remarque : ces prototypes sont uniquement à titre exploratoire et ne sont pas prêts à être mis en production devant de vrais utilisateurs.
  • Collaborer avec la communauté pour affiner l'espace problématique

Objectif de cette phase

Les concepts et hypothèses présentés ici ont pour but de susciter la discussion et d'éclairer les décisions futures. L'objectif de la phase 0 est d'identifier et de tester de manière collaborative les opportunités susceptibles de renforcer le rôle de Wikipédia en tant que destination et espace de découverte d'informations fiables.

Rapport : Améliorer la manière dont les lecteurs trouvent des informations sur Wikipédia

Synthèse des résultats

Signal global

La synthèse suivante résume les principaux enseignements tirés du système de recherche de Wikipédia dans différentes disciplines. D'après cette étude, les résultats montrent que le système de recherche actuel de Wikipédia n'est pas à la hauteur des attentes des lecteurs modernes lorsqu'ils utilisent des requêtes sémantiques et des requêtes en langage naturel.

Dans ce rapport, nous définissons la recherche sémantique comme la recherche d'informations basée sur le sens, les concepts ou les relations contextuelles d'une recherche, et la recherche lexicale comme la recherche d'informations basée sur des mots exacts, tels que la correspondance de mots-clés.

La recherche assistée par sémantique, qui s'appuie sur des contenus rédigés par des humains, peut améliorer la satisfaction des lecteurs et la réussite des tâches. Bien que chaque équipe ait abordé le problème sous un angle différent, les conclusions collectives soulignent clairement la valeur pour le lecteur, l'ouverture de la communauté et la faisabilité technique d'une expérience à petite échelle avec un produit minimum viable (MVP) de recherche hybride (c'est-à-dire un mélange de recherche sémantique et lexicale), à condition que la mise en œuvre reste transparente, centrée sur l'humain, itérative et axée sur la conception.

En fonction des résultats du MVP et des conclusions des discussions communautaires, nous déterminerons s'il est opportun de créer une fonctionnalité permanente. Si nous décidons d'aller de l'avant, nous travaillerons en collaboration avec la communauté pour déterminer à quoi devrait ressembler une telle fonctionnalité.

Principales conclusions issues de l'ensemble des projets de recherche

Veuillez noter que les recherches préliminaires ont été menées en anglais.

Thème Evidence interdisciplinaire
Les lecteurs quittent dès que la découverte semble inefficace. La revue de la littérature et les études de design confirment que la plupart des sessions sont des visites d'une seule page ; les utilisateurs ont l'habitude de poursuivre leurs recherches ailleurs.
La recherche hybride offre le meilleur équilibre entre expérience utilisateur et couverture. Les preuves de concept et les recherches montrent que la recherche sémantique n'est pas suffisante à elle seule ; la recherche lexicale reste nécessaire (et peut être optimisée) pour certains types de requêtes.
Les améliorations de l'UX sont aussi importantes que les améliorations du modèle. Des tests de design montrent que la manière dont les résultats sont présentés (extraits ancrés, provenance claire) reste le facteur le plus important, indépendamment des résultats affichés.
La communauté fait preuve d'un optimisme prudent. Les discussions sur WikiCon North America et ENWP Discord révèlent un intérêt pour la modernisation de la recherche, notamment dans le cadre de la lutte contre la baisse du nombre de lecteurs et de la priorité accordée à la découverte de contenus générés par des humains. Il est nécessaire d'engager des discussions avec un groupe de bénévoles plus large et plus représentatif.
La confiance repose sur la transparence, pas sur les clauses de non-responsabilité. Les résultats des Q&R et des entrettiens sémantiques avec les utilisateurs ont montré que ces derniers étaient déroutés lorsque la fonctionnalité tentait de signaler l'IA, que ce soit par une étiquette ou une icône.
Des écarts d'évaluation subsistent. Toutes les équipes soulignent l'absence d'un référentiel unifié et multilingue ou d'indicateurs de réussite détaillés pour un produit final potentiel.

Conclusion stratégique

La phase 0 établit que la recherche interne doit évoluer pour passer de la simple recherche par mot-clé à une recherche tenant compte de l'intention, c'est-à-dire un modèle de recherche capable de comprendre le sens profond d'une requête afin de diriger les lecteurs vers les réponses qu'ils recherchent.

Nous souhaitons également profiter de cette occasion pour explorer les avantages et les risques des différents modèles de recherche, y compris ceux qui exploitent les LLM.

Le moyen le plus rapide de comprendre comment faire évoluer la recherche sur les wikis serait de mener une expérience à petite échelle avec un MVP afin de valider les hypothèses relatives à l'expérience utilisateur, de collecter des données de référence et de définir les décisions infrastructurelles nécessaires à une recherche hybride durable et fiable dans l'ensemble de l'écosystème Wikimédia.

Répartition de la recherche par discipline

Chaque sous-section résume les méthodes, les principales conclusions et les preuves représentatives.

Équipe de recherche Revue de la littérature

Research conducted by Martin Gerlach, Senior Research Scientist on the Research Team .

Hypothèse : si nous examinons les recherches existantes sur la manière dont les lecteurs interagissent avec les outils de recherche et de navigation sur Wikipédia, et sur la manière dont ils utilisent la recherche externe pour trouver des informations sur Wikipédia, nous serons en mesure de fournir aux équipes chargées des lecteurs au moins trois recommandations et conclusions exploitables qui les aideront à définir un MVP (produit minimum viable) de recherche et de découverte afin de combler les lacunes en matière d'attentes et de besoins des lecteurs.

Statut: Pris en charge.

Méthodes et données :

  • Synthèse des études Wikimedia et externes sur : l'utilisation et les requêtes de recherche interne, les références de recherche externe, les expériences de recherche sémantique et les obstacles connus en matière d'expérience utilisateur.
  • Analyse du comportement en mode texte intégral par rapport au mode de saisie semi-automatique, des résultats nuls et des abandons, des cas d'utilisation multilingues et hors espace de noms principal, et de la recherche multimédia Commons.

Résultats clés :

  • La recherche interne est sous-utilisée et biaisée en faveur des éditeurs.
    • Seulement ~0,8 à 2 % des pages vues proviennent de recherches internes ; 4 à 12 % des acteurs du site utilisent la recherche, les éditeurs étant surreprésentés parmi les utilisateurs de la recherche. De nombreuses sessions sont des visites d'une seule page.
  • La saisie automatique domine le comportement.
    • ~80 à 95 % des sessions de recherche utilisent la fonction de saisie semi-automatique ; seules 5 à 8 % utilisent uniquement le texte intégral. La satisfaction et le CTR (taux de clics) sont bien plus élevés pour la saisie semi-automatique que pour le texte intégral.
  • Les requêtes en langage naturel sont peu courantes.
    • Estimé à ~4–7 % des requêtes en texte intégral sur le wiki ; les références externes contenant des mots interrogatifs explicites semblent également représenter une très faible part. Certains utilisateurs s'attendent à ce que des phrases plus longues et plus naturelles fonctionnent.
  • Les utilisateurs sont confrontés à des obstacles en matière de découvrabilité et de compréhension.
    • De nombreux lecteurs ne réalisent pas que Special:Search effectue une recherche en texte intégral ; l'absence de suggestions de saisie semi-automatique est interprétée à tort comme un manque de couverture, ce qui entraîne des sorties prématurées. Les points d'entrée et les affordances du texte intégral sont enfouis/peu clairs.
  • La recherche externe est habituelle et utilisée pour la navigation.
    • Les lecteurs rebondissent fréquemment vers des moteurs externes (en particulier Google) pour passer d'une page Wikipédia à l'autre, même lorsqu'il existe des liens bleus sur le wiki. La commodité et l'habitude jouent un rôle majeur.
  • Les espaces de noms communs et non principaux constituent des points faibles.
    • La précision de la recherche dans Commons est faible (en particulier pour les langues autres que l'anglais) ; les éditeurs demandent une amélioration de la recherche pour les modèles, l'aide/les politiques et les fils de discussion.
  • Il n'existe pas de méthode de récupération qui soit globalement supérieure aux autres.
    • Les modèles lexicaux et sémantiques ont tous deux leurs avantages ; l'important est d'adapter la méthode à la requête et à l'intention de l'utilisateur. Les modèles hybrides qui utilisent la mémorisation lexicale avec reclassement sémantique sont susceptibles d'offrir le meilleur équilibre entre pertinence et efficacité.
  • Elles présentent des écarts.
    • Nous manquons d'un référentiel fiable et représentatif de requêtes/passages permettant de comparer les modèles et de quantifier les améliorations en matière de pertinence.

Recommandations à court terme :

  • R1 — Créer un référentiel et une boucle d'évaluation.
    • Créer un ensemble de requêtes représentatif et multilingue avec des passages pertinents annotés ; couvrir les cas d'utilisation par les lecteurs et les éditeurs. Mettre en place une évaluation continue hors ligne/en ligne (A/B, entrelacement) afin de comparer les variantes lexicales, hybrides et sémantiques. T406207
  • R2 — Améliorer la recherche UI & affordances dès maintenant.
    • Clarifier la relation entre la saisie semi-automatique et le texte intégral ; éviter le risque « pas de suggestion = pas de couverture » ; ajouter des points d'entrée plus clairs aux résultats au niveau des sections et entre les espaces de noms.
  • R3 — Appliquer la récupération hybride.
    • Utilisez les composants sémantiques de manière sélective, par exemple, pour reclasser les meilleurs résultats lexicaux, rechercher des passages dans un article ou dans des domaines dépourvus de métadonnées textuelles (par exemple, Commons via des modèles de langage visuel). Cela permet d'équilibrer les capacités et les coûts sans trop se focaliser sur les questions d'infrastructure à ce stade.

Recommandations à moyen terme :

  • R4 — Améliorer les requêtes dans la pile actuelle.
    • Utilisez la reformulation/l'amélioration des requêtes (détection d'entités, expansion des alias, orthographe/lemmatisation) pour améliorer les formulations longues/naturelles sans infrastructure sémantique complète.
  • R5 — Renforcer la découverte multilingue.
    • Améliorer la mise en évidence interlinguistique via les étiquettes/alias Wikidata ; envisager un couplage avec MinT pour les lecteurs (facultatif), en particulier pour les publics monolingues.

Concepts de design

Research conducted by Tais Lessa, Lead UX Designer on the Apps Team , and Justin Scherer, Lead UX Designer on the Reader Growth team.

Hypothèse : si nous présentons des concepts de conception haute fidélité pour la découverte de contenu via la recherche sémantique à 10 à 20 lecteurs occasionnels de Wikipédia dans le cadre d'une étude qualitative, nous constaterons un sentiment positif à l'égard de cette fonctionnalité et gagnerons la confiance nécessaire pour poursuivre le développement d'un MVP de recherche et de découverte qui s'appuie sur de courts extraits rédigés par des humains pour répondre aux requêtes de recherche.

Statut: Pris en charge.

Objectif : Deux explorations conceptuelles complémentaires ont été menées afin de comprendre comment Wikipédia pourrait faire évoluer son expérience de recherche d'informations sur sa plateforme : l'une axée sur la recherche sémantique initiée par l'utilisateur (aidant les lecteurs à trouver plus efficacement des réponses grâce à la recherche sur le wiki) et l'autre sur les interfaces de questions-réponses (aidant les lecteurs à reconnaître ce qu'une page peut répondre grâce à des méthodes de découverte d'informations passives).

Il s'agissait d'explorations parallèles, et non d'un test comparatif. Chaque concept éclaire une facette différente du parcours du lecteur et sera probablement abordé dans l'ordre plutôt que dans un esprit de concurrence.

Concept A – Recherche sémantique

Hypothèse : les extraits ancrés et au niveau de la section seront plus satisfaisants que les liens vers l'article complet.

Méthodologie: Quatre études mobiles (n = 20 ; mélange de lecteurs occasionnels et réguliers) ont comparé l'expérience actuelle basée sur les mots-clés à deux prototypes (à consulter sur un navigateur mobile).

Gif du prototype de recherche sémantique, présentant la question complète, les suggestions de recherche empilées et les résultats dans l'article.

Résultats clés :

  • Hypothèse principale validée.
    • 17 des 20 testeurs (85 %) ont préféré les extraits au niveau de la section aux liens vers des pages entières.
  • Écart d'attente avec la recherche actuelle.
    • L'expérience actuelle est précise mais lente pour la recherche d'informations ; les lecteurs attendent des réponses rapides et directes, avec une profondeur facultative.
  • Le concept 1 a surpassé le concept 2 en termes de clarté, de rapidité et de confiance.
    • Les lecteurs ont apprécié l'ancrage direct et la mise en évidence dans l'article ; 11 sur 20 ont salué cette fonctionnalité.
  • La création de sens exige de la clarté, pas seulement un classement.
    • Les utilisateurs parcourent les extraits pour s'orienter.
  • Certains participants ont attribué à tort des extraits à l'IA, soulignant la nécessité d'un étiquetage transparent de la provenance, mais de nombreux participants ont déclaré qu'ils seraient favorables à l'intégration d'un plus grand nombre d'outils d'IA dans Wikipédia.

Concept B — Interfaces de questions-réponses

Hypothèse : l'ajout de modules « Réponses dans cet article » et d'aperçus de pages étendus aidera les lecteurs à découvrir plus rapidement des faits spécifiques, tout en clarifiant ce à quoi une page peut répondre.

Méthodologie: Trois études non modérées (n = 30 ; lecteurs « inactifs/anciens ») ont été testées :

  • Accordéons (questions + réponses intégrées)
  • Liens profonds (accéder à des sections ancrées)
  • Aperçus de page étendus (cartes flottantes plus grandes)
Un exemple de conception potentielle de questions-réponses de type accordéon.

Résultats clés :

  • Accueil globalement positif.
    • Tous les concepts ont amélioré l'efficacité perçue du contenu (« 100 % utile pour toute personne qui ne souhaite pas lire l'intégralité de l'article »).
  • Les accordéons et les liens profonds ont rendu Wikipédia plus dynamique et conversationnel (« ciblé », « rapide », « vif »).
    • Les accordéons risquent d'être perçus comme des impasses sans les affordances explicites « Voir dans l'article ».
  • Les divulgations ont semé la confusion chez les utilisateurs.
    • L'icône représentant un robot et la mention « IA » n'ont pas permis de clarifier ce qui était généré par une machine et ce qui était généré par un humain, mais ont au contraire accru la confusion.
  • La pertinence de la question est le facteur déterminant.
    • Lorsque les questions correspondaient aux besoins des utilisateurs, leur satisfaction était élevée ; dans le cas contraire, leur utilité diminuait.
  • Les aperçus de page étendus ont réduit la surcharge des onglets, mais risquaient de distraire l'attention lorsqu'ils étaient nombreux.
  • Bien que les questions aient été générées par l'IA, les participants ont souvent supposé qu'elles provenaient du crowdsourcing (production participative) ou qu'elles avaient été sélectionnées par des éditeurs.
    • Les participants ont bien compris que les réponses n'étaient pas générées par l'IA.
  • Les lecteurs « occasionnels » de cette cohorte avaient tendance à s'identifier comme d'anciens lecteurs qui s'appuient désormais sur les outils GenAI, ce qui suggère que les questions-réponses pourraient réengager ce groupe.

Synthèse des enseignements :

  • Les besoins de l'utilisateur:
    • Recherche sémantique - Des réponses plus rapides et plus claires dans le flux de recherche
    • Interfaces Q&R - Indications contextuelles pour « ce à quoi cette page peut répondre »
  • Publics principaux :
    • Recherche sémantique : lecteurs/chercheurs actifs
    • Interface Q&R : anciens lecteurs ou lecteurs occasionnels
  • Interaction principale :
    • Recherche sémantique : requête → extraits classés
    • Q&R : Interface : Navigation → questions apparues
  • Dépendance :
    • Recherche sémantique : récupération fiable (modèle hybride)
    • Interface Q&R : génération fiable de questions
  • Risque lié à la transparence de l'IA
    • Recherche sémantique : les utilisateurs peuvent confondre les extraits générés par des humains avec ceux générés par l'IA.
    • Interface Q&R : les utilisateurs interprètent mal les icônes de divulgation et pensent que le contenu généré par des humains est issu de l'IA.
  • Faisabilité de la conception
    • Recherche sémantique : risque moindre à court terme
    • Interface Q&R : nécessite la maturité du modèle + des garde-fous de conception

Commentaires de la communauté

Research conducted by Eliza Blackorby, Movement Communications Specialist on the Reader Growth and Reader Experience teams.

Engagement précoce sur le wiki :

Une page de projet a été créée afin de présenter le contexte, le raisonnement et les premiers résultats de recherche de cette initiative. Il s'agit d'un espace transparent où les éditeurs et les lecteurs peuvent suivre les progrès, discuter des questions en suspens et partager leurs points de vue sur les défis liés à la recherche d'informations.

Engagement précoce en personne :

Lors de la WikiCon North America (octobre 2025), nous avons présenté un exposé éclair sur le thème suivant :

  • Fonctionnement actuel des fonctions de recherche de Wikipédia et leurs lacunes par rapport aux attentes modernes
  • Premières explorations de la recherche sémantique
  • Possibilités de participation communautaire

In a December community call with members of the English Wikipedia Discord, Jazmin Tanner and Tais Lessa presented some of the research detailed in this report, as well as early stage design ideas.

Ces sessions ont encouragé les questions, les commentaires et les discussions sur l'avenir de la découverte sur wiki.

Résultats clés :

  • Les membres de la communauté sont conscients et préoccupés par la baisse du nombre de lecteurs sur le wiki.
  • Les rédacteurs ont indiqué que de nombreux lecteurs, y compris des amis, des membres de leur famille et des collègues, se tournent désormais vers les chatbots IA pour obtenir des réponses rapides, ce qui soulève des inquiétudes quant à la visibilité de Wikipédia.
  • À maintes reprises, les éditeurs ont fait part de leur frustration face à l'utilisation du contenu de Wikipédia sans mention de la source et au fait que les moteurs de recherche puisent dans Wikipédia, de sorte que les lecteurs ne consultent plus directement l'article.
  • Les participants ont été enthousiasmés par l'idée que la recherche sémantique pourrait être une solution pour réengager les lecteurs et encourager de nouveaux éditeurs à rejoindre le projet à l'avenir.
  • Les membres de la communauté ont compris que la recherche sémantique utilisera des outils d'IA/ML pour rendre la recherche plus moderne et plus pertinente.
  • Les membres de la communauté ont exprimé leur inquiétude quant à la création d'incitations pour les éditeurs à « optimiser » les articles afin d'améliorer leur visibilité dans les résultats de recherche, ainsi que leurs préoccupations potentielles concernant les outils d'IA générative.
  • Les membres de la communauté voient dans les questions-réponses un moyen potentiel de rediriger les lecteurs qui arrivent avec des requêtes non encyclopédiques, de la même manière que les pages de désambiguïsation redirigent les ambiguïtés thématiques.
  • Il est nécessaire de développer une méthode adaptée à Wikipédia pour rediriger les lecteurs qui posent des questions auxquelles Wikipédia ne peut répondre, c'est-à-dire « les décevoir en douceur ».
  • Les éditeurs d'articles pourraient fournir des métadonnées ou des annotations qui améliorent la pertinence de la recherche sémantique.
  • Parmi les autres idées proposées, citons :
    • Utilisation d'un score de confiance interne pour évaluer dans quelle mesure une question correspond au contenu, et affichage uniquement des réponses supérieures à un seuil défini.
    • Exploration de la recherche dans les articles alimentée par le ML (recherche dans une page) plutôt que de placer des encadrés de questions-réponses en haut des articles, à la manière de Google.
    • Permettre de combiner la recherche exacte et la recherche sémantique dans une seule requête.

enseignements :

  • Nous continuerons à partager notre réflexion sur la recherche sémantique dès le début et régulièrement, tant dans les conversations sur le wiki que lors d'événements communautaires en personne.
  • Les communautés du monde entier nous aideront à transformer nos apprentissages en une fonctionnalité de recherche efficace, adaptée aux besoins des lecteurs et fidèle à l'esprit de Wikipédia.
  • Nous travaillerons avec les communautés wiki du monde entier afin de garantir que les solutions de recherche sémantique sur Wikipédia soient adaptées et efficaces sur le plan multilingue et multiculturel.
  • La recherche sémantique et les fonctionnalités associées ne seront pas déployées sans la participation et le consensus de la communauté.

Prototype de données d'apprentissage automatique

Research was conducted by the Apprentissage automatique Team with contributions from Fabian Kaelin, Research Engineer, and Santhosh Thottingal, Software Engineer, and led by Sucheta Salgaonkar, Lead AI Product Manager.

Hypothèse: si nous produisons un prototype interne pour la recherche sémantique et les questions-réponses dans les articles, présenté sous la forme d'une interface de démonstration qui compare l'approche actuelle à de nouvelles approches exploratoires, les équipes Reader seront alors en mesure d'évaluer qualitativement les performances de chaque approche dans différents parcours utilisateurs et de mettre en évidence les lacunes ou les opportunités d'itération supplémentaire.

Statut: Pris en charge.

Méthodologie : L'équipe ML a exploré plusieurs prototypes d'implémentation : recherche de similarité basée sur l'intégration, correspondance et récupération question-question, génération et notation LLM pour les questions relatives aux articles.

Prototypes : Ces prototypes ont été conçus dans un souci de rapidité et ne reposent pas sur la « meilleure » approche :

Considérations apparentes :

  • La recherche hybride est essentielle.
    • La recherche sémantique seule n'est pas suffisamment performante pour la plupart des requêtes lexicales ; il est nécessaire de combiner la recherche lexicale et le reclassement sémantique pour obtenir un niveau de satisfaction élevé.
  • Compromis en matière de granularité
    • Il existe un équilibre entre coût et précision entre les intégrations au niveau de l'article, de la section et du paragraphe. Des recherches supplémentaires sur le découpage en morceaux et les architectures alternatives (par exemple, les modèles de mise en évidence sémantique) sont nécessaires pour améliorer l'efficacité.
  • État de préparation des infrastructures
    • Un MVP prêt pour la production nécessite des pipelines évolutifs pour l'intégration, la mise à jour et le stockage. La capacité actuelle permet d'effectuer des tests à petite échelle, mais pas de cycles de rafraîchissement continus.
  • Le choix du modèle est important.
    • Les modèles d'intégration varient en termes de performances ; il convient d'explorer un plus large éventail de modèles et de comparer les options natives OpenSearch et open source. Les systèmes à passages multiples avec reclassement peuvent atténuer les problèmes liés à la dimensionnalité et aux performances.
  • Risques de biais et d'hallucinations
    • Dans le cas des Q&R, les questions générées par l'IA peuvent potentiellement introduire un biais factuel ou représentatif. Une telle génération par IA devrait se faire hors ligne et être validée par des humains avant son déploiement.
  • De nouveaux mesures de succès sont nécessaires.
    • Les mesures traditionnelles du taux de clics ne permettent pas de savoir quand les utilisateurs trouvent des réponses sans cliquer. Introduire le concept de « bon abandon » et l'évaluation humaine pour mieux mesurer la qualité de la recherche.

Ce qui serait nécessaire pour une production à grande échelle:

Pour passer d'un prototype interne à un état prêt pour la production à grande échelle, les composants suivants sont nécessaires :

  • Infrastructure d'intégration : pipeline évolutif pour générer, actualiser et stocker des intégrations de texte sur plusieurs wikis.
  • Service de recherche hybride : meilleurs chemins d'accès et traitement des requêtes de différents types, garantissant que chaque requête est traitée par la méthode de recherche la plus appropriée.
  • Cadre d'évaluation : ensemble de données de référence annotées par des humains et tests A/B pour mesurer les améliorations en matière de pertinence.
  • Surveillance et observabilité : télémétrie en temps réel pour les performances des services de modélisation (latence, erreurs, etc.) et outils permettant de surveiller la qualité des prévisions des modèles au fil du temps.
  • Contrôles éthiques et qualité : audit des biais, filtrage du contenu et rubriques d'évaluation de l'exactitude pour tous les résultats générés par l'IA.
  • Design collaboratif : veillez à ce que la conception détermine les données nécessaires dans une expérience utilisateur donnée et à ce que les systèmes d'apprentissage automatique fournissent ces données avec le niveau de qualité et les performances techniques attendues.

Assouplissement de la correspondance des mots-clés dans notre recherche existante

Research conducted by Peter Fischer, Senior Software Engineer on the Data Platform Engineering team.

Hypothèse: si nous assouplissons la correspondance des mots-clés dans la recherche, nous pourrons mieux prendre en charge les requêtes en langage naturel et permettre au produit d'évaluer cette capacité, en l'intégrant dans la manière dont il conçoit, hiérarchise et fournit son travail dans l'espace de recherche sémantique.

Statut: Non pris en charge.

Questions clé :

  • Avons-nous réellement besoin d'investir dans de nouvelles méthodes de recherche pour offrir l'expérience que nous avons en tête ?
  • Notre méthode de recherche actuelle est-elle suffisamment flexible pour prendre en charge différents types de requêtes ?

Méthodologie : Prototype work was conducted under phab:T405869, where engineers tested variations of query matching strictness within CirrusSearch/OpenSearch.

L'approche consistait à :

  • Assouplissement des contraintes de correspondance des mots-clés afin de permettre une recherche plus flexible (par exemple, correspondance partielle des termes, lemmatisation, dérivation).
  • Réalisation d'évaluations comparatives de pertinence sur un ensemble représentatif de requêtes en langage naturel.
  • Mesure des effets sur la mémorisation et la pertinence perçue par rapport à la recherche de référence et aux échantillons de récupération basés sur l'intégration produits par l'équipe ML.

Résultats clés :

  • Il ne suffit pas de se contenter d'assouplir la correspondance des mots clés.
    • Une correspondance lexicale plus souple augmente le rappel, mais pas la pertinence ; la qualité des correspondances reste inférieure à celle obtenue avec les plongements.
  • Valeur incrémentielle dans le prétraitement.
    • L'extraction d'entités, l'expansion d'alias et la reformulation de requêtes peuvent améliorer le rappel pour les requêtes en langage naturel à un coût relativement faible. Ces optimisations méritent d'être poursuivies, mais elles ne peuvent pas reproduire entièrement la pertinence sémantique.
  • Limites actuelles du système.
    • CirrusSearch/OpenSearch peut prendre en charge des améliorations lexicales modestes et des extensions de reclassement, mais ne dispose pas de l'architecture nécessaire pour gérer de manière native les intégrations vectorielles ou la recherche basée sur le sens à grande échelle.

Implications :

  • À court terme :
    • L'ingénierie de recherche peut améliorer la recherche lexicale existante afin d'améliorer la qualité de base et l'expérience utilisateur, indépendamment de la mise en œuvre sémantique.
    • Un MVP devrait s'appuyer sur l'approche hybride de récupération recommandée par les équipes ML et Design. Les améliorations existantes en matière de recherche pourraient alimenter ce pipeline, mais ne pourraient pas le remplacer.
  • À long terme :
    • À mesure que l'infrastructure hybride mûrit, Search peut intégrer des améliorations au niveau du prétraitement afin de réduire les coûts de calcul et d'étendre la prise en charge multilingue.
    • Les optimisations de recherche doivent compléter, et non remplacer, les capacités sémantiques ou lexicales. Notre objectif reste de garantir que Wikipédia puisse traiter à la fois les requêtes traditionnelles basées sur des mots-clés et celles basées sur le sens, dans le cadre d'une expérience unifiée.

Recherche design du prototype de données

Research conducted by Mike Raish, Lead Design Researcher on the Design Research Team .

Hypothèse: si nous évaluons deux prototypes de recherche sémantique (recherche en langage naturel et questions-réponses) avec des participants externes, nous pourrons déterminer si les utilisateurs voient l'intérêt d'outils de recherche améliorés et fournir aux équipes Readers une recommandation sur la manière de procéder pour mettre au point un MVP de recherche et de découverte.

Statut: Partiellement pris en charge.

Méthodologie : Une enquête aléatoire auprès de 52 personnes lisant Wikipédia en anglais (recrutées via Userlytics) a été menée à l'aide de Qualtrics. Les participants ont évalué la pertinence des résultats de recherche pour 14 requêtes réelles sur Wikipédia (10 sans fautes de frappe et 4 contenant des fautes de frappe) en comparant les résultats de la recherche sémantique aux résultats de recherche par mot-clé existants sur Wikipédia.

Chaque participant a examiné des ensembles de résultats randomisés et a rapporté :

  • Quel ensemble de résultats ils ont trouvé le plus pertinent (sémantique, Wikipédia, les deux ou aucun des deux).
  • Leur connaissance approfondie de chaque sujet, leur maîtrise des technologies et leur maîtrise de la lecture en anglais.

Les participants ont pu voir les pages de résultats de recherche réelles issues du prototype de données de recherche sémantique (octobre 2025).

Résultats clés

  • Préférence générale pour la recherche sémantique.
    • Sur 10 requêtes sans faute de frappe, les participants ont préféré la recherche sémantique pour 8 d'entre elles, la recherche Wikipédia pour 1 et ont jugé les deux comme non pertinentes pour 1.
  • Gestion des fautes de frappe
    • Pour 2 des 4 requêtes contenant des fautes de frappe, les participants ont préféré la recherche sémantique ; pour les 2 autres, aucun des deux ensembles n'a été jugé pertinent.
  • Conformité élevée avec le « test visuel » interne.
    • Les préférences des participants correspondaient aux évaluations internes de pertinence de l'équipe WMF pour 7 requêtes sur 10 sans faute de frappe et pour les 4 requêtes comportant des fautes de frappe.
  • Performances variables selon les thèmes.
    • La recherche sémantique a rencontré des difficultés avec des entités nommées très spécifiques (par exemple, « General Grievous »), pour lesquelles la précision des mots-clés de Wikipédia s'est avérée supérieure.
  • Perspective comportementale
    • Les testeurs pilotes (dont les écrans ont été enregistrés) ont cliqué sur des articles Wikipédia avant de remplir leurs évaluations, ce qui suggère que les lecteurs peuvent percevoir la recherche principalement comme un outil de navigation et d'exploration, et non comme une fin en soi.
  • Facteurs démographiques
    • Aucune différence significative en fonction des connaissances techniques, du niveau d'éducation ou de la familiarité avec Wikipédia. Légère indication d'un lien entre un niveau élevé de maîtrise de l'anglais et une préférence pour la recherche sémantique.

Recommendations Mener une étude à plus grande échelle dans une interface « wikifiée » afin de formuler des recommandations pour :

  • Longueur du texte du résultat (phrase ou paragraphe)
  • Type de requête (factuelle ou exploratoire)
  • Ordre de présentation et étiquetage
  • Indicateurs d'évaluation pour des résultats significatifs chez les lecteurs
  • Pertinence évaluée par des humains

Prochaines étapes possibles

Expérience de recherche hybride

Objectif: traduire les conclusions validées de la phase 0 en une expérience de production qui fonctionne comme un environnement de recherche à grande échelle.

Domaines clés

  • Mise en œuvre de la recherche hybride – Mettre en œuvre une approche initiale légère utilisant à la fois des méthodes de recherche sémantique et lexicale basées sur l'intention de la requête.
  • Validation de l'expérience utilisateur – Testez comment la longueur des extraits, le style des snippets et l'étiquetage de provenance affectent la satisfaction, le taux de clics et les « abandons positifs ».
  • SLO du service de recherche – Veiller à ce que notre infrastructure MVP nous permette de surveiller les SLO clés tels que la latence, le coût, le taux d'erreur, etc. dans des conditions de trafic réelles.
  • Collaboration communautaire – Collaborez avec les wikis cibles pour mener une expérience à grande échelle avec des discussions ouvertes sur les pages de discussion, des discussions sur Discord et des newsletters périodiques.
  • Cadre d'évaluation – Commencez une analyse comparative continue hors ligne/en ligne à l'aide d'ensembles de requêtes évaluées par des humains afin d'orienter le réglage du modèle.

Travail en parallèle

  • Améliorations apportées à la recherche lexicale – Continuer à améliorer le prétraitement des requêtes (par exemple, extraction d'entités, lemmatisation) et la logique de classement dans la pile actuelle. Ces améliorations seront finalement intégrées à l'approche de recherche hybride, potentiellement après la livraison du MVP.
  • Infrastructure d'évaluation – Développer des outils communs pour la journalisation, l'annotation et la télémétrie afin que les recherches lexicales et sémantiques puissent être mesurées de la même manière.
  • Exploration du modèle ML – Testez des modèles supplémentaires d'intégration et de reclassement afin d'améliorer l'efficacité et la précision sans retarder le déploiement du MVP.
  • Communauté et communications – Maintenir les activités de sensibilisation, les boucles de rétroaction et la documentation parallèlement au développement technique afin d'éclairer le travail à court terme et d'explorer les possibilités ou les pivots à long terme.

Expérience Q&R

Objectif: S'appuyer sur l'infrastructure et les connaissances comportementales pour explorer des expériences de découverte « lean-back » qui aident les lecteurs à comprendre rapidement ce qu'une page peut leur apporter.

Domaines d'intérêt potentiels :

  • Explorez les modèles de collaboration entre éditeurs pour la génération ou l'approbation des questions.
  • Poursuivre l'itération UX sur les affordances des liens profonds, la clarté des informations divulguées et le nombre de questions affichées.
  • N'introduisez les modules de Q&R qu'une fois que la génération de questions atteint une précision suffisante et a été validée par des humains.

Dépendances :

  • Ensemble de données d'évaluation fiable et pipeline de métriques
  • Latence prouvée de la récupération hybride.
  • Normes communautaires établies et mécanismes de rétroaction.

Flux de travail parallèles :

  • Analyse détaillée des produits à l'aide de la télémétrie MVP pour améliorer la génération de questions et la correspondance sémantique.
  • Cycles de recherche en conception explorant la navigation basée sur la curiosité et la compréhension par l'utilisateur des fonctionnalités de Recul « lean-back ».

Questions pour les communautés

Nous souhaitons collaborer avec les communautés afin de comprendre :

  • Quelles sont vos réactions générales à ce rapport ? Y a-t-il quelque chose qui vous frappe particulièrement ?
  • Souhaiteriez-vous que nous contactions votre communauté linguistique afin d'évoquer la possibilité de mener des expériences pilotes à petite échelle dans un avenir proche ?
  • Quels signaux/données seraient utiles pour déterminer s'il serait intéressant de mettre à disposition des modules de recherche hybride et/ou de Q&R plus perfectionnés pour votre wiki linguistique après l'expérimentation ?