Skip to main content
Il s’agit d’un notebook interactif. Vous pouvez l’exécuter en local ou utiliser les liens ci-dessous :

Leaderboard Quickstart

Dans ce notebook, nous allons apprendre à utiliser le Leaderboard de Weave pour comparer les performances des modèles sur différents jeux de données et fonctions de scoring. Plus précisément, nous allons :
  1. Générer un jeu de données de faux codes postaux
  2. Rédiger quelques fonctions de scoring et évaluer un modèle de référence.
  3. Utiliser ces techniques pour évaluer une matrice modèles/évaluations.
  4. Examiner le leaderboard dans Weave UI.

Étape 1 : Générer un jeu de données fictif de codes postaux

Nous allons d’abord créer une fonction generate_dataset_rows qui génère une liste de données fictives de codes postaux.

Étape 2 : Créez des fonctions de score

Nous allons ensuite créer 3 fonctions de score :
  1. check_concrete_fields : vérifie si la sortie du modèle correspond à la ville et à l’État attendus.
  2. check_value_fields : vérifie si la sortie du modèle se situe dans une marge de 10 % par rapport à la population et au revenu médian attendus.
  3. check_subjective_fields : utilise un LLM pour vérifier si la sortie du modèle correspond au champ “known for” attendu.

Étape 3 : Créer une Évaluation simple

Nous définissons ensuite une Évaluation simple à l’aide de nos données factices et des scoring functions.

Étape 4 : Évaluer un modèle de base

Nous allons maintenant évaluer un modèle de base qui renvoie une réponse statique.

Étape 5 : Créer d’autres Models

Nous allons maintenant créer 2 modèles supplémentaires pour les comparer à la référence.

Étape 6 : Créez davantage d’évaluations

Nous allons maintenant évaluer une matrice croisant des modèles et des évaluations.

Étape 7 : consultez le Leaderboard

Vous pouvez créer un nouveau Leaderboard en accédant à l’onglet Leaderboard dans l’interface utilisateur, puis en cliquant sur “Create Leaderboard”. Vous pouvez également générer un Leaderboard directement depuis Python :