01 / 12

LLM Infrastructure

从 KV Cache
到 Prompt Cache

大模型与 Agent 是怎么"省钱"的

02 / 12

核心结论

01 KV Cache — 一次回答内部不重算
02 Prompt Cache — 多次调用之间不重算
03 核心哲学:算过的不重做
03 / 12

基本原理

自回归生成

一次蹦一个字,塞回去,再蹦下一个

今天 天气 真好 ?

每次决定下一个字,都要把前面全部重新读一遍

04 / 12

Attention 机制

图书馆比喻

K 书脊标题 — 告诉别人"我是谁"
V 书中内容 — 携带的具体信息
Q 搜索关键词 — 新字发出的提问

Q 和 K 做匹配,匹配上就读取 V,综合出下一个字

05 / 12

问题

每次都从头算

O(n2)
100 第 100 字 → 重算前 99 个的 K/V
1k 第 1000 字 → 重算前 999 个的 K/V

字越多,每多一个字的代价越高

06 / 12

解法一

KV Cache

存起来,不重算

O(n2) O(n)
a. 历史 K/V 存进显存缓存
b. 新字只算自己 — 提速 5-10x
07 / 12

Agent 的问题

Prompt 滚雪球

1k 3k 6k 10k

每轮 = 上轮全部 + 新工具结果

其中 80% 内容每轮一模一样,但每轮都要重新计算 K/V

08 / 12

解法二

Prompt Cache

稳定前缀,跨调用复用

L4 用户输入 + 工具结果 每轮变
L3 Few-shot / RAG 片段 半稳定
L2 Tools Schema 工具定义 稳定
L1 System Prompt 系统提示词 不变
09 / 12

设计原理

为什么是前缀匹配

01 每个 token 的 KV 只取决于它前面的内容
02 前缀一致 → KV 一致 → 直接复用
03 设计原则:不变的放前面,变化的放后面
10 / 12

价值

三个问题被解决

-90% Agent 多轮调用成本下降
~200ms 首 Token 延迟(原 3-5 秒)
1x 长文档只算一次,后续复用
11 / 12

直觉清单

给产品同学的建议

01 评估 Agent 时问缓存命中率>80% 才能长期商业化
02 别往 System Prompt 头部塞动态变量一改头部 → 缓存全部失效 → 账单翻倍
03 工具数量要克制200 个工具全塞进去 = 灾难
12 / 12

计算一旦做出来,
就是一种资产

重做即浪费,复用即收益

秋阳 Chris

企业 AI 转型 · 智能体定制 · 知识库 · 数字员工 · 独立站代运营

qiuyang_chris
访问主站 liuqiuyang.com →