Skip to main content
Il s’agit d’un notebook interactif. Vous pouvez l’exécuter en local ou utiliser les liens ci-dessous :

Prérequis

Avant de commencer, installez et importez les bibliothèques requises, obtenez votre clé API W&B et initialisez votre projet Weave.

1. Créez et itérez des prompts avec Weave

Une bonne conception de prompts est essentielle pour guider le modèle afin qu’il extraie correctement les entités. Commencez par créer un prompt de base qui indique au modèle quoi extraire de nos données d’image et sous quel format. Ensuite, vous stockerez le prompt dans Weave pour en assurer le suivi et l’itération.
Ensuite, améliorez le prompt en ajoutant davantage d’instructions et de règles de validation afin de réduire les erreurs dans la sortie générée.

2. Obtenir le jeu de données

Ensuite, récupérez le jeu de données de notes manuscrites à utiliser comme entrée du pipeline OCR. Les images du jeu de données sont déjà encodées en base64, ce qui signifie que les données peuvent être utilisées par le LLM sans prétraitement.

3. Construire le pipeline NER

Ensuite, construisez le pipeline NER. Le pipeline se composera de deux fonctions :
  1. Une fonction encode_image qui prend une image PIL du jeu de données et renvoie une chaîne représentant l’image encodée en base64, pouvant être transmise au VLM
  2. Une fonction extract_named_entities_from_image qui prend une image et un prompt système, et renvoie les entités extraites de cette image conformément au prompt système
Maintenant, créez une fonction appelée named_entity_recognation qui :
  • Envoie les données de l’image au pipeline NER
  • Renvoie un JSON correctement formaté avec les résultats
Utilisez le décorateur @weave.op() pour suivre et tracer automatiquement l’exécution de la fonction dans l’interface W&B. À chaque exécution de named_entity_recognation, les résultats complets de la trace sont visibles dans la Weave UI. Pour voir les traces, accédez à l’onglet Traces de votre projet Weave.
Enfin, exécutez le pipeline sur le jeu de données et consultez les résultats. Le code suivant parcourt le jeu de données et enregistre les résultats dans un fichier local processing_results.json. Les résultats sont également consultables dans Weave UI.
Vous verrez un résultat semblable à celui-ci dans le tableau Traces de Weave UI.
Screenshot 2025-05-02 at 12.03.00 PM.png

4. Évaluer le pipeline avec Weave

Maintenant que vous avez créé un pipeline pour effectuer de la NER à l’aide d’un VLM, vous pouvez utiliser Weave pour l’évaluer de façon systématique et voir dans quelle mesure il est performant. Pour en savoir plus sur les évaluations dans Weave, consultez Aperçu des évaluations. Les évaluateurs constituent un élément fondamental d’une évaluation dans Weave. Les évaluateurs servent à évaluer les sorties de l’IA et à renvoyer des métriques d’évaluation. Ils prennent la sortie de l’IA, l’analysent et renvoient un dictionnaire de résultats. Les évaluateurs peuvent utiliser vos données d’entrée comme référence si nécessaire et peuvent également renvoyer des informations supplémentaires, comme des explications ou le raisonnement issu de l’évaluation. Dans cette section, vous allez créer deux évaluateurs pour évaluer le pipeline :
  1. Évaluateur programmatique
  2. Évaluateur LLM-as-a-judge

Scorer programmatique

Le scorer programmatique, check_for_missing_fields_programatically, prend la sortie du modèle (la sortie de la fonction named_entity_recognition) et identifie quelles keys sont manquantes ou vides dans les résultats. Cette vérification est particulièrement utile pour repérer les échantillons où le modèle n’a extrait aucun champ.

LLM-as-a-judge scorer

À l’étape suivante de l’évaluation, les données de l’image et la sortie du modèle sont toutes deux fournies afin de garantir que l’évaluation reflète les performances réelles en NER. Le contenu de l’image est explicitement pris en compte, et pas seulement la sortie du modèle. Le scorer utilisé pour cette étape, check_for_missing_fields_with_llm, utilise un LLM pour effectuer le scoring (plus précisément le gpt-4o d’OpenAI). Comme indiqué dans le contenu de eval_prompt, check_for_missing_fields_with_llm renvoie une valeur Boolean. Si tous les champs correspondent aux informations de l’image et que le formatage est correct, le scorer renvoie true. Si un champ est manquant, vide, incorrect ou ne correspond pas aux informations attendues, le résultat est false, et le scorer renvoie également un message expliquant le problème.

5. Lancer l’Évaluation

Enfin, définissez un appel d’évaluation qui parcourra automatiquement le dataset transmis et enregistrera les résultats dans la Weave UI. Le code suivant lance l’évaluation et applique les deux évaluateurs à chaque sortie du pipeline NER. Les résultats sont visibles dans l’onglet Evals de la Weave UI.
Lorsque vous exécutez le code ci-dessus, un lien vers le tableau d’Évaluation dans la Weave UI est généré. Suivez ce lien pour afficher les résultats et comparer différentes itérations du pipeline sur les modèles, prompts et jeux de données de votre choix. La Weave UI crée automatiquement une visualisation comme celle ci-dessous pour votre équipe.
Screenshot 2025-05-02 at 12.26.15 PM.png