上下文工程这个系列写到今天,该收尾了。前几篇我一直在算账:KV Cache 那篇算显存账,提示缓存+压缩那篇算钱账,Lost in the Middle 那篇算准确率账。三本账算完,我却发现账是分开记的——缓存开关在配置里,压缩阈值在代码深处,检索条数在另一个函数里。真被问到“一...
神棍
2天前 21℃ 0评论
0喜欢
最近在写上下文工程这个系列,前两篇我把两本账算完了:KV Cache 那篇讲的是显存账——长上下文的显存到底烧在哪;提示缓存 + 上下文压缩那篇讲的是钱的账——让同一段前缀只算一次钱。今天算第三笔,也是最容易被忽略的一笔:准确率的账。
起因是有读者在后台问我:”我把公...
神棍
5天前 45℃ 0评论
0喜欢
提示缓存 + 上下文压缩:同一段前缀,怎么做到只算一次钱?
上篇我把 KV Cache 那笔账拆完了——GQA、KV 量化、PagedAttention 三层优化轮下来,显存这块心里总算有底。但账单还没看完:打开 API 消费记录,最扎眼的反而不是显存,是输入 token。同一个...
神棍
1周前 (08-31) 68℃ 0评论
0喜欢
上篇我把”上下文很贵”拆成了三笔账:账单上的 token 钱、显存里的空间、还有模型”记不住中间内容”的效果损耗。今天拆第二笔——显存到底被谁吃掉了。答案基本是同一个:KV Cache。
起因是我前阵子给朋友部署一个 Llama 3...
神棍
2周前 (08-28) 83℃ 0评论
0喜欢
上一篇我把整个 Agent 系列串成了一个生产级项目,结尾也预告了接下来的方向:上下文工程。本来想歇两天,结果项目跑起来之后,我去翻账单、盯显存监控,越看越睡不着:API 账单的大头几乎全在输入 token 上;显存监控里 KV Cache 吃掉的显存比模型权重还多;更扎心的是,...
神棍
2周前 (08-25) 92℃ 0评论
0喜欢