[{"data":1,"prerenderedAt":203},["ShallowReactive",2],{"topic-page:\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Ffoundation-model-evaluation-methods-and-metrics":3},{"topic":4,"category":161,"seo":165,"breadcrumbs":170,"prerequisites":180,"nextTopics":181,"relatedTopics":190},{"id":5,"slug":6,"title":7,"summary":8,"canonicalPath":9,"categoryPath":10,"difficulty":11,"targetAudience":12,"estimatedMinutes":13,"generatedAt":14,"publishedAt":14,"updatedAt":14,"reviewStatus":15,"tags":16,"expectedKnowledge":26,"learningGoal":29,"keyTerms":30,"blocks":73},"it-aws-aws-certified-ai-practitioner-foundation-model-applications-foundation-model-evaluation-methods-and-metrics","foundation-model-evaluation-methods-and-metrics","基盤モデルの評価方法と指標","基盤モデルの評価方法と指標を、AIF-C01の公式objective 3.4.1・3.4.2に沿って、用語、判断順序、例、誤解修正で整理します。","\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Ffoundation-model-evaluation-methods-and-metrics","\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications","beginner","cert_candidate",6,"2026-08-06","ai_generated",[17,18,19,20,21,22,23,24,25],"AWS Certified AI Practitioner","AIF-C01","基盤モデルの活用","モデル評価","ROUGE","BLEU","BERTScore","LLM-as-a-judge","Amazon Bedrock Model Evaluation",[27,28],"AWSクラウドの基本用語を聞いたことがある","AIを使う業務例を日常的な言葉で考えられる","基盤モデルの評価方法と指標について、試験で問われる違いと選択基準を説明し、短い業務例へ適用できる。",[31,36,40,44,47,50,53,59,62,69],{"id":32,"label":33,"shortDefinition":34,"role":35},"foundation-model-evaluation","基盤モデル評価","基盤モデルの出力を複数の方法と指標で測り、用途の品質基準を満たすか確認する活動です。","primary",{"id":37,"label":38,"shortDefinition":39,"role":35},"human-in-the-loop-evaluation","人手評価","人が出力を基準に沿って確認し、品質や安全性を判定する評価です。",{"id":41,"label":42,"shortDefinition":43,"role":35},"benchmark-dataset","ベンチマークデータセット","共通条件でモデルの性能を比較するために用いる評価データです。",{"id":45,"label":21,"shortDefinition":46,"role":35},"rouge","生成要約と参照要約の語句の重なりを中心に測る自動評価指標です。",{"id":48,"label":22,"shortDefinition":49,"role":35},"bleu","翻訳などで、生成文と参照文のn-gram一致を測る自動評価指標です。",{"id":51,"label":23,"shortDefinition":52,"role":35},"bertscore","文脈表現を使い、生成文と参照文の意味的な近さを測る指標です。",{"id":54,"label":24,"shortDefinition":55,"supplement":56,"role":35},"llm-as-a-judge","別の大規模言語モデルへ評価基準を与え、出力品質を判定させる方法です。",{"kind":57,"text":58},"misconception","judgeモデルにも偏りや誤りがあるため、人の評価との照合が必要です。",{"id":60,"label":25,"shortDefinition":61,"role":35},"amazon-bedrock-model-evaluation","基盤モデルの自動評価や人手評価を支援するAmazon Bedrockの機能です。",{"id":63,"label":64,"shortDefinition":65,"supplement":66,"role":68},"human-oversight","人による監督","AIの判断や出力を人が確認し、必要に応じて介入・承認する統制です。",{"kind":57,"text":67},"確認者へ根拠・時間・権限がなければ機能しません。","contextual",{"id":70,"label":71,"shortDefinition":72,"role":68},"evaluation","評価","定めたデータと基準で、モデルやアプリの品質・安全性・価値を測る活動です。",[74,79,90,99,108,114,120,126,142,151],{"id":75,"type":76,"title":7,"subtitle":77,"shortDefinition":78},"hero","HeroBlock","自動指標、人の評価、モデル評価を役割別に組み合わせる","モデル出力を、参照データ、自動指標、人の判断、または別モデルの判定で測り、用途の品質基準を満たすか確認する活動です。",{"id":80,"type":81,"term":33,"definition":82,"plainExplanation":83,"presentation":84,"supportLabel":85,"keywords":86},"definition","DefinitionBlock","[[cloze:foundation-model-evaluation|基盤モデル評価]]とは、複数の方法と指標で基盤モデルを測り、用途の品質基準を満たすか確認する活動です。","[[term:rouge|ROUGE]]は語句の重なり、[[term:bleu|BLEU]]はn-gram一致、[[term:bertscore|BERTScore]]は意味的な近さを測ります。[[term:llm-as-a-judge|LLM-as-a-judge]]は別のLLMで判定を補助します。[[term:amazon-bedrock-model-evaluation|Amazon Bedrock Model Evaluation]]は自動・人手評価を支援します。","natural","見分けるポイント",[87,88,89],"評価基準","参照データ","相互補完",{"id":91,"type":92,"steps":93,"title":98},"decision-steps","StepBlock",[94,95,96,97],"正確さ、網羅性、簡潔さ、安全性など評価観点を定義する。","代表ケースと失敗しやすい境界ケースを[[term:benchmark-dataset|ベンチマークデータセット]]にする。","自動指標、専門家、[[term:human-in-the-loop-evaluation|人手評価]]、LLM評価の役割を組み合わせる。","[[term:evaluation|評価]]者間の差、judgeモデルの偏り、基準漏れを監査する。","評価設計の順序",{"id":100,"type":101,"title":102,"points":103,"body":107},"exam-cues","KeyPointBlock","判断で押さえる境界",[104,105,106],"評価観点を用途から定義","自動指標は測る性質が異なる","人・ベンチマーク・LLM評価を相互補完","参照文と表現が違っても意味が正しい回答がある一方、単語が重なっていても事実関係が逆の場合があります。LLM-as-a-judgeにも偏りがあるため、重要ケースは[[term:human-oversight|人の確認]]と根拠照合を残します。",{"id":109,"type":110,"src":111,"alt":112,"caption":113},"diagram","DiagramBlock","\u002Fassets\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Ffoundation-model-evaluation-methods-and-metrics\u002Ffoundation-model-evaluation-methods-and-metrics.svg","基盤モデルの評価方法と指標について自動指標：速い、人評価：文脈深い、LLM judge：拡張可能、ベンチマーク：比較可能の関係を文字ラベルと矢印で示した図","評価方法を速度と文脈理解の二軸で配置する図です。一つに依存せず、用途の重要度で組み合わせます。",{"id":115,"type":116,"scenario":117,"explanation":118,"result":119},"worked-example","ExampleBlock","要約モデルAとBを評価し、ROUGEではA、人の事実確認ではBが高い結果になりました。","ROUGEは参照要約との表現の重なりを捉えますが、事実の正確さを直接保証しません。用途が会議決定の正確な共有なら、人の事実評価を主要基準にし、ROUGEは網羅や変化検知の補助として使います。基準と重みを事前に定め、都合の良い指標だけを後から選びません。","指標の不一致を失敗とせず、各指標が測る性質から最終判断を説明できます。",{"id":57,"type":121,"warningTitle":122,"message":123,"severity":124,"action":125},"WarningBlock","高い自動スコアは業務合格と同義ではない","安全性、根拠、法令、利用者満足など、自動指標に含まれない条件があります。評価設計にない品質は測れません。","warning","各指標について『何を測るか』『何を測らないか』を評価表へ書きます。",{"id":127,"type":128,"title":129,"questions":130},"quiz","QuizBlock","AIF-C01 判断チェック",[131],{"question":132,"choices":133,"answerIndex":137,"choiceExplanations":138},"LLM-as-a-judgeを使う場合の適切な注意はどれですか。",[134,135,136],"評価基準を明示し、人の評価との一致や偏りを確認する","judgeの出力を絶対的な真実とみなす","重要ケースから人の確認をすべて外す",0,[139,140,141],"正解です。judge自体も評価対象です。","モデル評価にも偏りと誤りがあります。","高影響判断の検証が弱くなります。",{"id":143,"type":144,"title":145,"points":146},"summary","SummaryBlock","まとめ",[147,148,149,150],"評価観点は用途の成功条件から作る","ROUGE・BLEU・BERTScoreは異なる近さを測る","LLM-as-a-judgeは効率化するが偏りを持つ","人・自動・ベンチマークを組み合わせる",{"id":152,"type":153,"title":154,"nextTopics":155,"relatedKeywords":157},"next-action","NextActionBlock","次は「FMアプリ評価と事業目標の整合」へ",[156],"it-aws-aws-certified-ai-practitioner-foundation-model-applications-application-evaluation-and-business-alignment",[158,159,160],"エンドツーエンド評価","タスク完了率","利用者満足",{"path":10,"title":19,"description":162,"parentPath":163,"accentToken":164},"基盤モデルの選択、RAG、プロンプト、カスタマイズ、エージェント、評価をAIF-C01の設計判断として整理します。","\u002Fit\u002Faws\u002Faws-certified-ai-practitioner","cloud-amber",{"title":166,"description":167,"canonicalUrl":168,"ogImage":169},"基盤モデルの評価方法と指標 | AWS Certified AI Practitioner","AIF-C01対策として基盤モデルの評価方法と指標の定義、判断軸、具体例、誤解しやすい境界を公式試験範囲に沿って学びます。","https:\u002F\u002Fzeqnilo.com\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Ffoundation-model-evaluation-methods-and-metrics","https:\u002F\u002Fzeqnilo.com\u002Fassets\u002Fsite\u002Fdefault-og.svg",[171,174,177,178,179],{"title":172,"path":173},"IT","\u002Fit",{"title":175,"path":176},"AWS","\u002Fit\u002Faws",{"title":17,"path":163},{"title":19,"path":10},{"title":7,"path":9},[],[182],{"id":156,"title":183,"summary":184,"canonicalPath":185,"categoryPath":10,"categoryTitle":19,"difficulty":11,"targetAudience":12,"estimatedMinutes":13,"publishedAt":14,"updatedAt":14,"reviewStatus":15,"tags":186},"FMアプリ評価と事業目標の整合","FMアプリ評価と事業目標の整合を、AIF-C01の公式objective 3.4.3・3.4.4・3.4.5に沿って、用語、判断順序、例、誤解修正で整理します。","\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Fapplication-evaluation-and-business-alignment",[17,18,19,158,159,160,187,188,189],"対話費用","RAG評価","エージェント評価",[191],{"id":192,"title":193,"summary":194,"canonicalPath":195,"categoryPath":10,"categoryTitle":19,"difficulty":11,"targetAudience":12,"estimatedMinutes":13,"publishedAt":14,"updatedAt":14,"reviewStatus":15,"tags":196},"it-aws-aws-certified-ai-practitioner-foundation-model-applications-foundation-model-training-fine-tuning-and-data","基盤モデルの学習・微調整・データ準備","基盤モデルの学習・微調整・データ準備を、AIF-C01の公式objective 3.3.1・3.3.2・3.3.3に沿って、用語、判断順序、例、誤解修正で整理します。","\u002Fit\u002Faws\u002Faws-certified-ai-practitioner\u002Ffoundation-model-applications\u002Ffoundation-model-training-fine-tuning-and-data",[17,18,19,197,198,199,200,201,202],"事前学習","微調整","instruction tuning","transfer learning","RLHF","データキュレーション",1787370539863]