9/10 pour le modèle A et 8/10 pour le modèle B) sont généralement plus difficiles à attribuer que les métriques relatives (par ex. le modèle A est plus performant que le modèle B). L’évaluation par paires vous permet de comparer les sorties de deux modèles en les classant l’une par rapport à l’autre. Cette approche est particulièrement utile lorsque vous souhaitez déterminer quel modèle est le plus performant pour des tâches subjectives telles que la génération de texte, le résumé ou les questions-réponses. Avec l’évaluation par paires, vous pouvez obtenir un classement de préférence relatif qui indique quel modèle est le meilleur pour des entrées spécifiques.
L’exemple de code suivant montre comment implémenter une évaluation par paires dans Weave en créant un scorer défini sous forme de classe appelé PreferenceScorer. Le PreferenceScorer compare deux modèles, ModelA et ModelB, et renvoie un score relatif des sorties des modèles en fonction d’indices explicites présents dans le texte d’entrée.
Évaluation