Skip to main content
Weaveの評価でモデルをスコアリングする際、絶対値のメトリクス (例: Model A が 9/10、Model B が 8/10) は、相対的なメトリクス (例: Model A のほうが Model B より優れている) よりも、一般に付与しにくい傾向があります。ペアワイズ評価では、2つのモデルの出力を相対的に順位付けすることで比較できます。この手法は、テキスト生成、要約、質問応答のような主観的なタスクで、どのモデルの性能がより高いかを判断したい場合に特に有用です。ペアワイズ評価を使用すると、特定の入力に対してどのモデルが最適かを明らかにする、相対的な選好順位を得られます。
この手法は暫定的な回避策であり、今後のバージョンで変更される可能性があります。現在、ペアワイズ評価をサポートするための、より堅牢なAPIを積極的に開発しています。今後の更新をお待ちください。
次のコードサンプルは、PreferenceScorer というクラスベースのスコアラーを作成して、Weaveでペアワイズ評価を実装する方法を示しています。PreferenceScorerModelAModelB の2つのモデルを比較し、入力テキスト内の明示的なヒントに基づいて、モデル出力の相対スコアを返します。

評価