イントロ
基盤モデルの評価方法と指標
自動指標、人の評価、モデル評価を役割別に組み合わせる
モデル出力を、参照データ、自動指標、人の判断、または別モデルの判定で測り、用途の品質基準を満たすか確認する活動です。
上下にスクロールするかキーボードの上下キーを使うと、次の学習カードへ進めます。
自動指標、人の評価、モデル評価を役割別に組み合わせる
モデル出力を、参照データ、自動指標、人の判断、または別モデルの判定で測り、用途の品質基準を満たすか確認する活動です。
正確さ、網羅性、簡潔さ、安全性など評価観点を定義する。
代表ケースと失敗しやすい境界ケースをにする。
自動指標、専門家、、LLM評価の役割を組み合わせる。
者間の差、judgeモデルの偏り、基準漏れを監査する。
参照文と表現が違っても意味が正しい回答がある一方、単語が重なっていても事実関係が逆の場合があります。LLM-as-a-judgeにも偏りがあるため、重要ケースはと根拠照合を残します。
評価観点を用途から定義
自動指標は測る性質が異なる
人・ベンチマーク・LLM評価を相互補完
LLM-as-a-judgeを使う場合の適切な注意はどれですか。
評価観点は用途の成功条件から作る
ROUGE・BLEU・BERTScoreは異なる近さを測る
LLM-as-a-judgeは効率化するが偏りを持つ
人・自動・ベンチマークを組み合わせる
今の内容と近いトピックを並べて、学習範囲を広げやすくしています。