ARTICLE · 人工智能

上下文压缩技术:将 LLM 成本降低 50%

作者:SitePoint Team 来源:SitePoint 2026-08-07 06:56 12 分钟 2 阅读 2859 字
LLMAI 编程提示词工程LangChainToken 优化
一语总结

展示如何通过基于提取和选择的上下文压缩技术,使用 LangChain 和 TikToken 将 LLM 的 token 成本降低多达 50%。

AI 总结

本教程解释了为什么 token 优化对于基于 LLM 的应用至关重要,尤其是在智能体循环中,未压缩的上下文可能成为主要开支。教程涵盖使用 TikToken 统计 token 的基础知识,比较了基于提取的句子级压缩和基于选择的分块级压缩方法,并提供了两种方法的逐步 LangChain 实现。读者将学习如何测量基线 token 数量、应用压缩、计算缩减百分比,并使用简单公式将 token 节省转化为实际美元成本。文章还概述了最佳实践——例如先选择后提取、在代表性查询集上对答案质量进行基准测试——并指出了额外 LLM 调用开销和上下文丢失等常见陷阱。

核心要点
  1. 使用 TikToken 精确统计 token 是可靠成本测量的基础。

    使用正确的编码(GPT‑4/3.5 使用 cl100k_base,GPT‑4o/mini 使用 o200k_base)可以获得精确的整数 token 数量,所有后续成本计算都依赖于此。

  2. 基于提取的压缩会筛选相关句子,能够实现更高程度的 token 缩减,但每个分块都需要额外调用一次 LLM。

    LLMChainExtractor 提示模型逐字返回相关句子,最适合叙事性文档,并且必须将其自身的延迟和 token 成本纳入考量。

  3. 基于选择的压缩会筛选整个分块,保留原始措辞并提供更低的延迟,但会损失部分上下文语境。

    LLMChainFilter 决定保留哪些检索到的分块而不做修改,适合引用密集型或对措辞要求严格的文本。

  4. 当检索器返回大量分块时,先做选择、再做提取,可最大化缩减效果。

    先用代价较低的过滤器丢弃不相关的分块,再对剩余内容进行句子级提取,总体 token 节约效果最佳。

  5. 实际节省金额通过 token 到成本的公式计算,并在部署到生产环境前使用质量基准进行验证。

    将每次调用的 token 数乘以每百万 token 的价格和预期调用量;始终至少在 50 个代表性问题上验证答案质量,确保压缩不会降低性能。

上下文压缩技术:将 LLM 成本降低 50%

本教程解释了为什么 token 优化对于基于 LLM 的应用至关重要,尤其是在智能体循环中,未压缩的上下文可能成为主要开支。教程涵盖使用 TikToken 统计 token 的基础知识,比较了基于提取的句子级压缩和基于选择的分块级压缩方法,并提供了两种方法的逐步 LangChain 实现。读者将学习如何测量基线 token 数量、应用压缩、计算缩减百分比,并使用简单公式将 token 节省转化为实际美元成本。文章还概述了最佳实践——例如先选择后提取、在代表性查询集上对答案质量进行基准测试——并指出了额外 LLM 调用开销和上下文丢失等常见陷阱。

文章金句

"

上下文压缩——在不破坏准确回答所需信息的前提下,减少输入到 LLM 提示词中的 token 数量——是工程师控制这些成本最直接的手段。

"

Token 优化不再是锦上添花。

"

在智能体架构中,成本状况会迅速恶化。