設定
学習モード
外観
基盤モデルの活用に戻る
学習モード
外観
1 / 11 ブロック9%

上下にスクロールするかキーボードの上下キーを使うと、次の学習カードへ進めます。

イントロ

FMアプリ評価と事業目標の整合

モデル単体から、検索・ツール・業務結果まで評価範囲を広げる

モデルだけでなく、検索、ツール、ワークフロー、人の確認を含むアプリ全体が、利用者の仕事と事業目標を達成するか測ることです。

定義
とは、検索・ツール・工程・人の確認を含むアプリ全体が目的を達成するか測る評価です。
見分けるポイント
単体に加え、を分けます。を組み合わせます。
手順

評価を分解する順序

  1. 1

    利用者が完了したいタスクと成功条件を定義する。

  2. 2

    モデル、検索、ツール選択、ワークフロー、へ失敗点を分ける。

  3. 3

    各部品の指標と、タスク完了率・満足・費用の全体指標を取る。

  4. 4

    改善後に別部品や利用者行動へ悪影響がないか再評価する。

要点

判断で押さえる境界

チャットが短く終わることは、解決が速い場合と利用者が諦めた場合の両方があります。を、完了確認、、満足度、総費用でします。

  1. 1

    モデル・検索・ツール・工程を分けて診断

  2. 2

    部品指標とタスク全体指標を持つ

  3. 3

    費用を人の修正や再問い合わせまで含める

図解FMアプリ評価と事業目標の整合についてモデル出力、検索・ツール、ワークフロー完了、満足・費用・事業成果の関係を文字ラベルと矢印で示した図
モデル単体から事業成果まで評価範囲を広げる積層図です。上位指標の悪化を下位部品へ診断して戻します。
場面
社内ITエージェントの回答正確率は上がったのに、問い合わせ解決率が変わりません。
順に考えると
ログを分解すると、回答は正しいものの、権限申請ツールへの引き継ぎが失敗していました。モデル再調整ではなくツール呼び出しとワークフローを修正し、タスク完了率、担当者への再問い合わせ、利用者満足、対話費用を再測定します。
ここが結論
改善対象をモデルへ決めつけず、アプリ全体のボトルネックへ当てられます。
注意

代理指標だけを最適化しない

確認

AIF-C01 判断チェック

Q1

エージェントアプリの事業整合を最も直接示す指標はどれですか。

まとめ

まとめ

  1. 1

    FMアプリはモデル以外の部品でも失敗する

  2. 2

    エンドツーエンドでタスク完了を測る

  3. 3

    満足度・費用・修正率を組み合わせる

  4. 4

    失敗箇所へ改善を戻して再評価する

What's New

新しいカテゴリが追加されました

  1. AWS Certified AI Practitioner
  2. 日商簿記3級
  3. FP3級
更新履歴をすべて見る