- 嵌入:把语义变成空间里的位置——意思越像,位置越近。索引端和查询端必须用同一个模型。
- 检索是个"先宽后窄的漏斗":向量检索(按意思找)配关键词检索(按字面找)双路并行 → 按权限和时效过滤 → 重排精选。向量擅长语义、不擅长精确字面,所以多数场景下两路互补,配合使用效果最好。
- ANN(近似最近邻):用一点准确度换巨大的速度。HNSW 是默认选择(图必须放进内存),数据量特别大时用 IVF 或 DiskANN。
- 推理分两步:prefill 并行读完输入(吃算力),decode 逐字生成(吃内存带宽)。总等待时间通常由 decode 主导。
- KV cache:用显存换掉重复计算,把平方级的计算量降到接近线性;提示缓存进一步让相同开头跨请求复用。
- 系统流转:后端/编排层是唯一主动发起动作的一方;向量库、模型服务、重排服务等下游彼此互不通信,全靠后端居中调度。
- 合规:机密内容被拼进 Prompt、送往云端的那一刻最敏感;日志是最容易被忽略的明文留存点。
- Agent:Thought(想)→ Action(做)→ Observation(看结果)不断循环;模型是大脑,harness 是身体,harness 的质量与模型同等重要。
- 代际之分:循环规则写死在代码里的是经典 RAG,把"要不要再查、怎么查"交给模型临场判断的才是代理式。变的不是组件,是指挥权。
- 全景:RAG 只是 LLM 用法之一。缺知识补资料(量小用长上下文、量大用 RAG),缺自主性上 Agent,缺能力或行为靠微调。选哪种,看任务缺的是什么。