Skip to main content
이 문서는 대화형 노트북입니다. 로컬에서 실행하거나 아래 링크를 사용할 수 있습니다:

🔑 사전 요구 사항

Weave 평가를 실행하려면 먼저 다음 사전 요구 사항을 완료하세요.
  1. W&B Weave SDK를 설치하고 API 키로 로그인합니다.
  2. OpenAI SDK를 설치하고 API 키로 로그인합니다.
  3. W&B 프로젝트를 초기화합니다.

🐝 첫 번째 평가 실행하기

다음 코드 예제는 Weave의 ModelEvaluation API를 사용해 LLM을 평가하는 방법을 보여줍니다. 먼저 weave.Model을 상속해 Weave 모델을 정의하고, 모델 이름과 프롬프트 형식을 지정한 다음 @weave.oppredict 메서드를 추적합니다. predict 메서드는 프롬프트를 OpenAI로 보내고, Pydantic 스키마(FruitExtract)를 사용해 응답을 구조화된 출력으로 파싱합니다. 그런 다음 입력 문장과 기대 정답으로 구성된 작은 평가 데이터셋을 만듭니다. 다음으로 모델 출력을 대상 레이블과 비교하는 맞춤형 스코어링 함수(이 함수도 @weave.op로 추적됨)를 정의합니다. 마지막으로 모든 것을 weave.Evaluation으로 묶고 데이터셋과 scorers를 지정한 뒤, evaluate()를 호출해 평가 파이프라인을 비동기적으로 실행합니다.

🚀 더 많은 예제를 찾고 계신가요?