• 欢迎关注我的微信公众号“ Falost ” 右边扫描关注 --->>

标签:上下文工程

AI / 大模型

上下文工程收官:怎么管住一次请求的 token 花销?我做了一张“上下文预算表”

上下文工程收官:怎么管住一次请求的 token 花销?我做了一张“上下文预算表”
上下文工程这个系列写到今天,该收尾了。前几篇我一直在算账:KV Cache 那篇算显存账,提示缓存+压缩那篇算钱账,Lost in the Middle 那篇算准确率账。三本账算完,我却发现账是分开记的——缓存开关在配置里,压缩阈值在代码深处,检索条数在另一个函数里。真被问到“一...

神棍 2天前 21℃ 0评论 0喜欢

AI / 大模型

Lost in the Middle:为什么上下文越长,模型越容易“迷路”?我的三层解法(位置管理+检索精减+路由分流)

Lost in the Middle:为什么上下文越长,模型越容易“迷路”?我的三层解法(位置管理+检索精减+路由分流)
最近在写上下文工程这个系列,前两篇我把两本账算完了:KV Cache 那篇讲的是显存账——长上下文的显存到底烧在哪;提示缓存 + 上下文压缩那篇讲的是钱的账——让同一段前缀只算一次钱。今天算第三笔,也是最容易被忽略的一笔:准确率的账。 起因是有读者在后台问我:”我把公...

神棍 5天前 45℃ 0评论 0喜欢

AI / 大模型

上下文工程开篇:为什么“上下文”正在成为最贵的资源?

上下文工程开篇:为什么“上下文”正在成为最贵的资源?
上一篇我把整个 Agent 系列串成了一个生产级项目,结尾也预告了接下来的方向:上下文工程。本来想歇两天,结果项目跑起来之后,我去翻账单、盯显存监控,越看越睡不着:API 账单的大头几乎全在输入 token 上;显存监控里 KV Cache 吃掉的显存比模型权重还多;更扎心的是,...

神棍 2周前 (08-25) 92℃ 0评论 0喜欢