商傳媒|何映辰/台北報導
全球知名的資訊科技研究顧問公司高德納諮詢公司(Gartner)已預期,人工智慧(AI)代理的推論(Inference)成本將在2028年前顯著增加。這意味著AI模型實際運行、產生結果時所需的費用,恐將對企業帶來不小的壓力。
這些能夠自主執行任務的人工智慧程式,其效能與成本關鍵在於它們處理資訊的「Context Window」(上下文視窗),即AI模型單次互動能接收和處理的資訊量。根據 Towards AI 的共同創辦人兼技術長路易斯-弗朗索瓦·布沙爾(Louis-François Bouchard)的解釋,當 Context Window 被過多不相關的資料填滿時,會導致AI模型效能下降,此現象稱為「Context Rot」(上下文腐蝕)。
Context Rot 不僅影響AI代理的回應品質,也會推高AI模型處理資訊的基本單位——Token(權杖)的使用量,進而顯著增加營運成本。為此,業界正積極推動「Context Engineering」(上下文工程),其核心在於精確決定AI模型在每次互動中應接收哪些資訊,以期在模型品質與成本效益間取得平衡。
Context Engineering 涵蓋多項策略,旨在優化Context Window 的管理。其中,「Compaction」(壓縮)技術透過觀察截斷、選擇性保留、摘要與提示壓縮等方式,將Context Window 的資訊量最小化,僅保留最相關的內容。而「Offloading」(卸載)則是將上下文資料移出即時 Context Window 之外,例如使用 retrieve augmented generation(RAG,檢索增強生成)和 GraphRAG 等技術。
另一關鍵策略是「Caching」(快取),透過運用預先計算好的快取來大幅降低成本和延遲。當上下文內容僅是增加而非轉換時,快取能有效節省重複運算所需資源。然而,若對上下文進行摘要等修改,則可能破壞快取機制,導致需重新計算而抵消節省的效益。
此外,「Progressive Disclosure」(漸進式揭露)則強調僅在AI代理需要時才載入必要的元件,而非一次性載入所有指令,這有助於更有效地管理AI技能。早期的實驗顯示,在未經壓縮或修改的情況下,保留「完整歷史」資訊通常能在記憶回溯方面提供最佳結果,並且由於快取的效益,成本更低、速度更快。
綜合來看,Context Engineering 是一門整合壓縮、記憶體管理和技能優化的全面性學科。透過仔細規劃AI模型所接收的資訊,開發者能顯著提升AI代理的效能,同時降低營運成本並改善使用者體驗,這對於企業應對日益攀升的AI運算費用至關重要。







