理解现代大语言模型系统-从RAG到全景 · 写给泛技术人群的概念地图:从碎片认知到系统脉络
QUICK REFERENCE

速记卡片(核心要点,适合最后快速复习)

  • 嵌入:把语义变成空间里的位置——意思越像,位置越近。索引端和查询端必须用同一个模型。
  • 检索是个"先宽后窄的漏斗":向量检索(按意思找)配关键词检索(按字面找)双路并行 → 按权限和时效过滤 → 重排精选。向量擅长语义、不擅长精确字面,所以多数场景下两路互补,配合使用效果最好。
  • ANN(近似最近邻):用一点准确度换巨大的速度。HNSW 是默认选择(图必须放进内存),数据量特别大时用 IVF 或 DiskANN。
  • 推理分两步:prefill 并行读完输入(吃算力),decode 逐字生成(吃内存带宽)。总等待时间通常由 decode 主导。
  • KV cache:用显存换掉重复计算,把平方级的计算量降到接近线性;提示缓存进一步让相同开头跨请求复用。
  • 系统流转:后端/编排层是唯一主动发起动作的一方;向量库、模型服务、重排服务等下游彼此互不通信,全靠后端居中调度。
  • 合规:机密内容被拼进 Prompt、送往云端的那一刻最敏感;日志是最容易被忽略的明文留存点。
  • Agent:Thought(想)→ Action(做)→ Observation(看结果)不断循环;模型是大脑,harness 是身体,harness 的质量与模型同等重要。
  • 代际之分:循环规则写死在代码里的是经典 RAG,把"要不要再查、怎么查"交给模型临场判断的才是代理式。变的不是组件,是指挥权。
  • 全景:RAG 只是 LLM 用法之一。缺知识补资料(量小用长上下文、量大用 RAG),缺自主性上 Agent,缺能力或行为靠微调。选哪种,看任务缺的是什么。

全文到此结束,网页版永久免费。

想把它从浏览器里拿出来:中文 30 页 / 英文 43 页,排版好的 PDF 与 EPUB、7 张原创示意图、11 条一手来源脚注——四个文件一次下载,$9 起。付款支持境外银行卡与 PayPal。

在 Gumroad 获取 PDF + EPUB →

在国内的话,可以在小红书上找到我(比白为竹间),中文版的其他获取方式我在安排。

理解现代大语言模型系统-从RAG到全景 · 写给泛技术人群的概念地图:从碎片认知到系统脉络 — 通俗扩充版 · 简体中文