Skip to main content
Lorsque vous évaluez des modèles dans le cadre d’une évaluation Weave, les métriques à valeur absolue (par ex. 9/10 pour le modèle A et 8/10 pour le modèle B) sont généralement plus difficiles à attribuer que les métriques relatives (par ex. le modèle A est plus performant que le modèle B). L’évaluation par paires vous permet de comparer les sorties de deux modèles en les classant l’une par rapport à l’autre. Cette approche est particulièrement utile lorsque vous souhaitez déterminer quel modèle est le plus performant pour des tâches subjectives telles que la génération de texte, le résumé ou les questions-réponses. Avec l’évaluation par paires, vous pouvez obtenir un classement de préférence relatif qui indique quel modèle est le meilleur pour des entrées spécifiques.
Cette approche est une solution de contournement et pourra évoluer dans de futures versions. Nous travaillons activement sur une API plus robuste pour prendre en charge les évaluations par paires. Restez à l’écoute des prochaines mises à jour !
L’exemple de code suivant montre comment implémenter une évaluation par paires dans Weave en créant un scorer défini sous forme de classe appelé PreferenceScorer. Le PreferenceScorer compare deux modèles, ModelA et ModelB, et renvoie un score relatif des sorties des modèles en fonction d’indices explicites présents dans le texte d’entrée.

Évaluation