設定
学習モード
外観
責任あるAIに戻る
学習モード
外観
1 / 11 ブロック9%

上下にスクロールするかキーボードの上下キーを使うと、次の学習カードへ進めます。

イントロ

データ品質・バイアス・分散と監視

代表性と誤りの偏りを、全体平均の外側まで見る

実際に利用する人、状況、入力条件の重要な違いが、学習・評価データへ十分に含まれている性質です。

定義
とは、対象となる利用者や状況の分布を、データが適切に反映している性質です。
見分けるポイント
を確かめ、を用途に合わせます。を区別します。
手順

偏りを見つける順序

  1. 1

    で利用者群と重要条件を定義する。

  2. 2

    の下で、欠測、重複、収集経路を監査する。

  3. 3

    全体指標に加えてで誤りと信頼度を測る。

  4. 4

    本番入力の変化を監視し、で継続する。

要点

判断で押さえる境界

全体が同じでも、群ごとのは異なります。を、検出・監視・の役割で区別します。

  1. 1

    代表性は利用場面との対応

  2. 2

    全体平均と群別誤りを併記

  3. 3

    データ・モデル・本番変化を継続監視

図解データ品質・バイアス・分散と監視についてデータ分布、学習・評価、群別結果、本番変化・人監査の関係を文字ラベルと矢印で示した図
データ分布、モデル評価、群別影響、本番監視を循環させる図です。全体平均だけで判断しません。
場面
音声認識モデルの全体精度は高いのに、一部の話者群で文字起こし誤りが多い状況です。
順に考えると
話者群、録音環境、言語・方言などの分布と誤り率を分けて確認します。とラベル品質を調べ、改善後は全体だけでなく群別の誤りと利用者影響を再評価します。
ここが結論
平均性能を保ちながら、見えにくい不均衡な影響を検出・改善できます。
注意

データ数を同じにすれば公平とは限らない

確認

AIF-C01 判断チェック

Q1

全体精度が高いモデルの偏り確認として最も適切なのはどれですか。

まとめ

まとめ

  1. 1

    代表性は実利用の人と状況を含むこと

  2. 2

    バイアス・分散・過学習・学習不足を区別

  3. 3

    ラベル品質と群別結果を監査

  4. 4

    本番変化と人の評価を継続する

What's New

新しいカテゴリが追加されました

  1. AWS Certified AI Practitioner
  2. 日商簿記3級
  3. FP3級
更新履歴をすべて見る