Skip to main content
이 문서는 대화형 노트북입니다. 로컬에서 실행하거나 아래 링크를 사용할 수 있습니다:

Leaderboard Quickstart

이 노트북에서는 Weave의 Leaderboard를 사용해 서로 다른 데이터셋과 채점 함수에서 모델 성능을 비교하는 방법을 알아봅니다. 구체적으로는 다음을 수행합니다:
  1. 가짜 우편번호 데이터 데이터셋 생성
  2. 몇 가지 채점 함수를 작성하고 기준 모델을 평가
  3. 이러한 기법을 사용해 모델과 평가의 조합 행렬을 평가
  4. Weave UI에서 Leaderboard 검토

Step 1: 가짜 우편번호 데이터셋 생성

먼저 가짜 우편번호 데이터 목록을 생성하는 함수 generate_dataset_rows를 만듭니다.

Step 2: 채점 함수 작성

다음으로 채점 함수 3개를 작성합니다:
  1. check_concrete_fields: 모델 출력이 예상한 도시와 주에 일치하는지 확인합니다.
  2. check_value_fields: 모델 출력이 예상한 인구수와 중위 소득의 10% 이내인지 확인합니다.
  3. check_subjective_fields: LLM을 사용해 모델 출력이 예상한 “known for” 필드와 일치하는지 확인합니다.

Step 3: 단순한 Evaluation 만들기

다음으로 가짜 데이터와 채점 함수를 사용해 단순한 Evaluation을 정의합니다.

Step 4: 기준 모델 Evaluate

이제 정적 응답을 반환하는 기준 모델을 Evaluate합니다.

Step 5: Models 더 만들기

이제 기준 모델과 비교할 Models 2개를 더 만듭니다.

Step 6: 더 많은 평가 만들기

이제 모델과 평가 조합으로 이루어진 행렬을 평가하겠습니다.

7단계: Leaderboard 검토

UI에서 Leaderboard 탭으로 이동한 다음 “Create Leaderboard”를 클릭하여 새 Leaderboard를 만들 수 있습니다. Python에서 직접 Leaderboard를 생성할 수도 있습니다: