理解现代 LLM 系统 · 从 RAG 到全景
02
CHAPTER 02

第二章 · 模型适配:通用模型怎么变成能用的系统

AI 客服上线之后,团队收到了三类不同的抱怨。

第一类:答不上来。 客户问上周刚发布的新版本有什么变化,客服说不知道——那份发布说明还没进知识库。

第二类:答得对,但没法看。 内容其实准确,可一大段话糊在一起,不分点、不标依据哪份文档,语气还时不时飘忽。团队希望它每次都先给结论、再列步骤、末尾附上文档链接。

第三类:答得文从字顺,但驴唇不对马嘴。 一位半导体客户用一连串行业术语提问,客服回得头头是道,内容却完全不着边际——它压根不理解这些词在这一行里指什么。

三类抱怨听上去都是"AI 不好用",病因却完全不同:第一类是不知道,第二类是不会说,第三类是听不懂。任何一个通用模型拿来做具体业务,都会在这三处露出落差;把通用基座模型改造成某个场景真正可用的系统,这件事叫模型适配

干预点只有两个:输入,或者权重

三类落差有三种解法。区分它们最简单的办法,是看这个解法到底动了什么:是不碰模型、只改每次递到它面前的材料,还是直接去改模型本身。

一种是干预输入:模型本身一个参数都不动,只在每次提问时把该看的资料塞进去。第一章的 RAG 就是这一类。

另一种是干预权重:直接改动模型内部的参数。所谓参数(也叫权重),就是模型内部的一大堆数字,动辄几十亿上千亿个——模型的全部本事都存在这堆数字里:认识哪些词、习惯怎么措辞、看到上文之后判断下一个字该写什么。所谓"训练",做的就是一轮轮微调这些数字。这类改动一旦完成就固化在模型里,之后每次回答都带着它。微调继续预训练属于这一类。

三种手段各自归位

手段 治哪一类落差 干预点 更新与代价
RAG(检索增强生成) 不知道:资料模型没见过——公司文档、最新变动 输入 换一份文档立刻生效;代价在每次提问的检索与长提示词
微调 SFT(Supervised Fine-Tuning,监督式微调) 不会说:格式、语气、行为不合要求——比如要求固定的结论加步骤结构、统一的引用格式 权重 需要准备一批"问题+标准答案"样例并训练;要改就得重训
继续预训练 听不懂:领域语言本身超出模型的理解范围——重代码、专业法律语料、小语种专业文本 权重 需要海量领域文本和大量算力,通常只有大机构才做

注:什么叫"重训"? 指的是把训练流程重新跑一遍——准备好一批新的样例数据,让模型在这批数据上再学一轮,产出一个新版本的权重(或新版本的 adapter)。它不像改一行配置那样随时可做,但也没有很多人想象的那么遥不可及。

算力这一关早就不是门槛了。 得益于 LoRA 这类只训练一小部分参数的技术,2026 年做一次 7–8B 规模模型的微调,租用 GPU 的花费大约在几美元到十几美元之间,耗时两到四小时;用托管服务按量计费,一次典型任务也就几十美元的量级。

真正费力的是训练之前和之后。 业界的共识是:GPU 已经不是主要开销,数据准备和效果评估才是——把一个微调项目从头做完(整理样例、清洗标注、反复试验、建立评估集),整体投入通常落在数千到上万美元的区间,其中大部分花在人和数据上,而不是算力上。所以"要改就得重训"的负担,主要不在于跑一次训练有多贵,而在于每次改动都要重走一遍准备与验证的流程。

继续预训练则完全是另一个量级:它消耗的是海量领域语料和大规模算力,通常需要专门的团队和基础设施。

资料来源:Stratagem Systems《LoRA Fine-Tuning Cost in 2026》(2026 年 7 月核价)、io.net《LLM Fine-Tuning Budget Guide》(2026 年 6 月)、Awesome Agents 微调成本对比(2026 年 4 月)。具体价格随硬件与服务商变动,此处仅示意量级。

用错工具是常见的坑,其中最典型的一种是:想让模型掌握新知识,于是去做微调。 研究已经反复验证,模型很难通过微调学到新的事实——引入新知识的训练样例,学得明显比其他样例慢;而等这些新知识终于被学会,模型编造内容的倾向反而会随之上升。结论是:事实知识主要在预训练阶段获得,微调教会模型的是更高效地调用它已有的知识。所以,遇到模型答不上来的情况(本章开头的第一类抱怨),正确的解法是把资料查出来摆到它面前,而不是把资料固化进权重里。

反过来也一样:RAG 不会改变模型的行为、语气和输出格式。模型啰嗦,RAG 治不了;格式不对,RAG 也修不好。第二类抱怨只能靠微调解决。

现实中它们通常叠加使用

这三种手段不是三选一。生产系统里常见的组合是:用一个 adapter(一种轻量级的微调附加模块,不改动整个模型,只在旁边挂一小块新参数,代表做法是 LoRA)负责语气和引用格式,同时用 RAG 管住知识——adapter 每季度更新一次,知识库持续更新。原则可以概括成一句:语言靠训练,事实靠检索;会变的东西不要固化进权重里。

动手顺序也有讲究。成本最低的手段是调整提示词,其次才是 RAG,再往后才轮到微调。业界的通行建议是:在决定微调之前,先确认已经有一套评估集,并且"提示词 + RAG"的方案确实没能通过它——否则很可能花了训练的钱,却没解决真正的问题。

无论走哪条路,终点是同一个地方:模型的权重(基座模型,加上可能叠加的 adapter)→ 推理服务(模型实际"跑起来"生成答案的过程)→ 答案。下一章要讲的,就是这套东西具体是怎么运转的。


理解现代 LLM 系统 · 从 RAG 到全景  —  通俗扩充版 · 简体中文