上篇我把”上下文很贵”拆成了三笔账:账单上的 token 钱、显存里的空间、还有模型”记不住中间内容”的效果损耗。今天拆第二笔——显存到底被谁吃掉了。答案基本是同一个:KV Cache。
起因是我前阵子给朋友部署一个 Llama 3...
神棍
2周前 (08-28) 83℃ 0评论
0喜欢
上一篇我把整个 Agent 系列串成了一个生产级项目,结尾也预告了接下来的方向:上下文工程。本来想歇两天,结果项目跑起来之后,我去翻账单、盯显存监控,越看越睡不着:API 账单的大头几乎全在输入 token 上;显存监控里 KV Cache 吃掉的显存比模型权重还多;更扎心的是,...
神棍
2周前 (08-25) 92℃ 0评论
0喜欢