Skip to main content
これはインタラクティブなノートブックです。ローカルで実行することも、以下のリンクを使用することもできます。

🔑 前提条件

Weave の評価を実行する前に、次の準備を済ませてください。
  1. W&B Weave SDK をインストールし、APIキーを使用してログインします。
  2. OpenAI SDK をインストールし、APIキーを使用してログインします。
  3. W&B のプロジェクトを初期化します。

🐝 最初の評価を実行する

次のコードサンプルでは、Weave の Model API と Evaluation API を使って LLM を評価する方法を示します。まず、weave.Model を継承して Weave モデルを定義し、モデル名とプロンプト形式を指定したうえで、@weave.op を使って predict メソッドをトラッキングします。predict メソッドは OpenAI にプロンプトを送信し、Pydantic スキーマ (FruitExtract) を使ってレスポンスを構造化された出力として解析します。次に、入力文と期待されるターゲットからなる小規模な評価用データセットを作成します。続いて、モデルの出力とターゲットラベルを比較するカスタムのスコアリング関数 (これも @weave.op でトラッキング) を定義します。最後に、データセットと scorers を指定して、これらをまとめて weave.Evaluation に渡し、evaluate() を呼び出して評価パイプラインを非同期に実行します。

🚀 さらに多くの例をお探しですか?