イントロ
トークン費用とコンテキストエンジニアリング
必要な情報だけを文脈へ入れ、品質・遅延・費用を整える
モデルが一回の処理で参照する指示、会話、検索結果、ツール出力、例などを目的に合わせて選び、順序付け、管理する設計です。
上下にスクロールするかキーボードの上下キーを使うと、次の学習カードへ進めます。
必要な情報だけを文脈へ入れ、品質・遅延・費用を整える
モデルが一回の処理で参照する指示、会話、検索結果、ツール出力、例などを目的に合わせて選び、順序付け、管理する設計です。
回答に必要な事実とルールを特定する。
でを使って関連するを選び、必要なら履歴を要約する。
指示、根拠、利用者入力、出力形式を明確に区切る。
一回ので使う入出力、、正確さを測って調整する。
全文を毎回投入する方法は簡単でも、常に最良とは限りません。長い会話は決定事項だけを要約し、社内資料は質問に関連するチャンクだけを取得します。ただし削り過ぎると前提を失うため、回答に必要な根拠が残っているかテストします。費用削減と品質維持を同じ評価で扱います。
入力・出力トークンが費用へ影響
文脈は指示以外の資料・履歴・ツール結果も含む
削減後も必要根拠が残るか評価
費用を下げながら回答の根拠を保つ改善はどれですか。
トークン量は費用・遅延・上限へ影響
コンテキストはモデルへ渡す情報全体
関連性で選び、構造化して渡す
削減後の正確さを必ず評価する
今の内容と近いトピックを並べて、学習範囲を広げやすくしています。