Theme / v1.7.0

Prompt Master

AI 提示詞工程大師

基礎觀念

Token 效率審計與提示詞優化

指導如何進行 Token 開支分析,利用 Prompt Caching 快取技術降低 90% 的重複請求費用

API 開支的隱性殺手:重複 Context

在大規模自動化開發(Autopilot)中,AI 助手在多個步驟中頻繁與 LLM 互動。

  • 在第 1 步中,你發送了 20,000 Tokens 的專案上下文與規則。
  • 在第 2 步中,你修改了一個小檔案,又發送了同樣的 20,000 Tokens 上下文。
  • 在第 3 步中,你跑了個建置,再次發送了這 20,000 Tokens。

財務負擔: 這種「每次對話都重新發送整本 codebase 上下文」的行為,會導致 API 費用呈指數級暴增。你需要一套 Token 審計與快取優化技術 來控制開支。


核心優化技術一:Prompt Caching (提示詞快取)

像 Anthropic Claude API 提供了強大的 Prompt Caching 技術。如果你的提示詞中,前 95% 的內容(如系統指令、大型規則庫、靜態代碼庫)在連續請求中保持不變,你可以為其加上快取標籤:

{
  "role": "user",
  "content": [
    {
      "type": "text",
      "text": "這裡是非常長的靜態規則文檔...",
      "cache_control": {"type": "ephemeral"}
    }
  ]
}

快取的效益:

  • 快取命中 (Cache Hit):當第二次發送相同內容時,API 伺服器會直接從記憶體中讀取快取,快取 Token 的單價僅為常規輸入 Token 的 1/10
  • 回應延遲縮短:省去了伺服器重新計算 Attention 的時間,AI 的首次響應時間能從 10 秒縮短至 2 秒以內。

核心優化技術二:提示詞精實與 Context 壓縮

除了 API 快取外,Prompt Master 的 Token OptimizerContext Compressor 技能還會在客戶端進行雙重精實:

  • 剔除虛詞與口水話:將冗長的自然語言指令壓縮為極簡的條列式 JSON/YAML 強約束。
  • 過濾失敗日誌:清除對話歷史中多餘的編譯拋錯 stack traces,僅保留「最終編譯通過的 C# 簽章」,使 Context Window 始終保持高純度,避免 AI 陷入無用資訊干擾。

通過這兩項技術的聯動,團隊能在執行超大型重構計畫時,降低 80% 以上的 API 帳單開支,同時提昇 AI 2 倍以上的響應速度。