LLM Infrastructure
大模型与 Agent 是怎么"省钱"的
核心结论
基本原理
一次蹦一个字,塞回去,再蹦下一个
每次决定下一个字,都要把前面全部重新读一遍
Attention 机制
Q 和 K 做匹配,匹配上就读取 V,综合出下一个字
问题
字越多,每多一个字的代价越高
解法一
存起来,不重算
Agent 的问题
每轮 = 上轮全部 + 新工具结果
其中 80% 内容每轮一模一样,但每轮都要重新计算 K/V
解法二
稳定前缀,跨调用复用
设计原理
价值
直觉清单
计算一旦做出来,
就是一种资产
重做即浪费,复用即收益