上篇写 Agent 可观测性的时候,我提到过一句话:调试多个 Agent 协作比单个 Agent 难了一个数量级。当时不是随便说的——我手头刚好在重构一个多 Agent 系统,三个 Agent 各管一摊:一个负责搜索、一个负责分析、一个负责生成。结果呢?A 刚处理完的数据被 B ...
2天前 15℃ 0评论
0喜欢
Agent 可观测性实战:日志、Trace、Debug,生产环境不裸奔
写在前面的实话
上篇我拆了 Agent 记忆系统的三层架构——短期记忆靠 Checkpointer、长期记忆用向量库、知识图谱上 Neo4j。写完在本地跑起来之后,我发现一个更头疼的问题:Agent 出了 b...
5天前 30℃ 0评论
0喜欢
Agent 不能只有脑子,还得有记忆
上篇聊完 Agent 编排框架选型,我在本地搭了一套 LangGraph + CrewAI 的混合 demo。跑起来之后冒出一个很现实的问题——每轮对话结束,Agent 就「失忆」了。我跟它聊了十分钟系统架构,它记住了所有技术选型,但关掉终端...
1周前 (07-14) 47℃ 0评论
0喜欢
上篇聊了 Function Calling 的进阶玩法——并行工具调用、流式输出、多层 Agent 架构。写完那篇之后,有个问题一直在我脑子里转:如果我有好几个 Agent,分别负责不同的任务,它们之间怎么配合?谁来调度?
这个问题我踩过坑。最早做多 Agent 的时候,我天真地...
2周前 (07-11) 118℃ 0评论
0喜欢
📌 回顾
上篇文章我们聊了 Function Calling 的基本用法——定义工具 schema、传给 API、解析返回的 tool_calls、执行函数并把结果喂回模型。我们写了一个能查天气、做计算、获取时间的助手,跑通了单工具调用的完整链路。
但那个版本还有个...
2周前 (07-08) 81℃ 0评论
0喜欢
之前写 RAG 系列文章的时候,我发现一个问题:纯靠向量检索加 LLM 生成的问答系统,有一个绕不过去的天花板——模型不会”做事”。你问它”今天北京的天气怎么样”,它要么说”我的知识截止到 XX 年,没法查实时信息...
2周前 (07-05) 70℃ 0评论
0喜欢
📌 回顾
上篇我们聊了Agentic RAG——从简单的”单次向量检索 + 直给答案”进化到 Multi-Hop 分解、ReAct 循环迭代。但有一个灵魂拷问始终绕不过去:你的 RAG 系统到底好不好?
做 RAG 的人很多,但能用数据说清”我...
3周前 (07-02) 102℃ 0评论
1喜欢
📌 回顾
上篇我们讲了模型部署与推理优化——如何用 vLLM 的 PagedAttention、连续批处理和 FP8 KV Cache 把微调完的模型跑起来。系列第二篇我们还搭过一个基础的 RAG 系统:向量化文档 → Chunk 存储 → 语义检索 → 拼接 Prompt → ...
4周前 (06-24) 111℃ 0评论
0喜欢
title: 模型部署与推理优化实战:微调完的模型怎么上线?
# 模型部署与推理优化实战:微调完的模型怎么上线?
上一篇文章我们聊了多轮对话微调,用 Chat Template 把一问一答的模型训练成了能记住上下文的对话助手。但微调完只是第一步——模型躺在训练机上的 .bi...
1个月前 (06-18) 131℃ 0评论
0喜欢
📌 回顾
上篇我们讲了模型评测工具箱——如何用自动化评测脚本、标准 Benchmark 和 LLM-as-Judge 来判断微调效果。但系列里所有的微调样例都是单轮问答:一个 user 消息,一个 assistant 回复。
现实中的对话不是这样的。用户会追问、补充、切换话题,模...
1个月前 (06-15) 147℃ 0评论
0喜欢