BotLearn LogoBotLearn
返回洞见列表

上传文件给 AI,它就学会了吗?搞懂上下文、知识库(RAG)和微调的真正区别

2026-08-28BotLearn编辑部
添加到 GoogleAI 总结

把文件传给 AI,它当场就能准确说出文件里某一页的细节,很多人因此以为这份资料已经被它"学"进去了。真相是:它这一轮只是"看得见"你的资料,模型本身什么都没变。这背后其实是三条完全不同的路——直接放进对话、建知识库(RAG)、微调模型——搞清楚它们的差异,才知道自己该走哪条路。

AI 答得准一份 20 页手册的细节,靠的是什么?

假设你把一份 20 页的产品手册传给 AI,下一句它就准确说出了第 14 页上的某个参数。很多人会觉得,它既然答得又快又准,那这份手册肯定是"学会了"。

实际发生的事不是这样。上传文件时,产品这一端做的是把文件内容提取成文字,和你的问题拼在一起,作为这一轮对话的上下文递给模型。它答得准,是因为这份内容此刻就摆在它这一轮要读的材料里,不是因为它从此掌握了这份资料。

这里有三件事同时成立:这一轮它看得见;模型参数本身没有任何变化;换一个新对话,默认从空白开始,这份手册的内容不会自动跟着你走。原因很简单——模型出厂之后参数是冻结的,跟它聊天、给它传文件都不会改动它;它自己不记事,每次回答都要把这一轮要用的内容重新递过去一遍。上传文件并没有绕开这个规律,只是往这一轮要递的材料里多加了一份而已。

这个问题也不是中文用户独有的困惑。OpenAI 官方开发者社区里,曾有人问过几乎一样的问题:手上有一批专业的行业资料,想让 AI 答得上来,该做微调,还是该建知识库?回帖的方向出奇一致,都指向知识库,理由是微调调整的是模型怎么输出,而不是让它掌握某一批具体资料。

至于上传的文件会不会被拿去训练模型,这件事因产品、因付费档位而异,有的默认会用、有的承诺不用,属于另一个话题。

知识库是提前读完资料,还是每次现查?

如果资料只用一次,直接贴进对话就够了。但如果是一份 300 页的产品手册、售后条款和常见问题合集,反复要查,就轮到**知识库(Knowledge Base)**登场了——常驻存放资料的地方,提问时自动检索,不用每次重新上传。

设想这样一个场景:一家公司把 300 页资料全部放进知识库。有人问"买了不到七天,机器不开机,能换新吗?"这一轮被检索出来的,只有 3 段——售后条款第 3 页的退换货规则、常见问题第 41 页的办理材料要求、产品手册第 128 页的排障说明。AI 照着这 3 段给出了回答,剩下的 297 页,这一轮压根没有被读取。

这不是巧合,而是知识库固有的工作方式:每问一次,就重新检索一次,每次都只找出看起来最相关的那几段。三家主流厂商的官方文档说的是同一件事——Anthropic 的帮助中心说它不会一次把项目里的全部内容都装进去,只检索回答问题所需要的那部分;Google 的产品文档说提问会触发检索,找到的内容附在问题上作为模型作答的依据;阿里云百炼的文档说得更直接:大模型生成回答之前,会先从知识库里检索相关内容。

这套"先检索、再拼进上下文、再生成回答"的流程,就是**检索增强生成(Retrieval-Augmented Generation,缩写 RAG)**的完整定义。检索、增强、生成三个词,分别对应这三步。

知识库检索靠关键词匹配,还是靠"意思"?

一个反直觉的地方在于:检索找的不是字面,而是意思,也就是语义检索(Semantic Search)

举个例子:如果你问"我们是什么时候登上月球的",库里"阿波罗 11 号在 1969 年 7 月成功着陆"这句话和问题一个字都对不上,却最可能被检索出来;而"中秋我吃了块月饼,很好吃"只有一个"月"字和问题重合,字面看着沾边,实际上最不相关。这组对照来自 OpenAI 开发者文档中讲解检索的一节。

语义检索能做到这一点,靠的是嵌入(Embedding)——把文字变成一串可以比较远近的数字,检索时靠比较这些数字的远近来判断两句话意思接不接近。阿里云百炼在文档中也印证了同一件事:这种检索找的是意思相同或相近的内容,关键词能对上多少不是关键,一个都对不上也照样能找到。这也是为什么用知识库提问不需要你先想好关键词,用大白话问就行。

知识库能标出处,就代表回答一定准确吗?

知识库类产品最常见的卖点是能标出处,很容易让人以为只要标了页码就一定没错。但要留意官方自己的措辞:Anthropic 的术语表说 RAG 提升的是事实准确度,用的是"提升"而不是"保证"。

中间有两处容易出岔子:检索可能选错段落,段落选对了,也可能被模型用歪了意思。能标出来源,降低的是编造的概率,不代表替你完成了核对,重要的结论还是要自己回原文确认一遍。

这套机制其实很多人已经在用。Claude 项目的官方帮助中心写明,当项目资料接近或超过上下文窗口上限时会自动启用检索,最多能把装得下的内容扩到十倍,这项功能只在付费档位提供;Gemini 的 Notebook(原 NotebookLM)会在来源很多时先检索最相关信息再组织回答;国内的千问知识库(原通义千问)支持导入网页、文档或笔记,导入后换个对话也能查。

资料就十几页,值得专门建知识库吗?

不一定。Anthropic 在 2024 年的一篇工程博客里给过一条具体的分界线:资料总量不到 20 万 token,大约 500 页材料,直接整份放进提问里就行,用不着上检索。这是 2024 年的说法,当时的上下文窗口比现在小,这个数字今天只能当量级参考。

所以这不是一道非此即彼的选择题:窗口大到今天这个程度,直接贴进对话依然是正经用法;资料一多、要反复查,检索在成本和扩展性上更划算。真正要判断的从来不是哪种技术更先进,而是这份资料有多大、要用多少次——用一次的,直接贴进对话最省事;反复要用的,才值得放进知识库或项目。

想让 AI 真正懂你的行业,是不是该去训练一个专属模型?

如果贴对话和建知识库都只是让模型"看得见"资料,那真正动到模型本身的微调(Fine-tuning),是不是才是终极答案?

微调是拿自己的数据,对一个已经训练好的模型再训练一轮,改变的是模型的参数本身。贴进对话、放进知识库,参数一个都没动;微调动的是模型自己,听上去确实是更彻底的路。

但关键在于它改的是哪一部分。OpenAI 的微调文档列出的适用清单是:分类、更细腻的翻译、按指定格式产出内容、纠正模型不遵守指令的毛病。Anthropic 的官方术语表给的说法是让模型适应某个特定领域、某项任务或某种写作风格。两份清单摆在一起看,没有一项是"记住一批新事实"。

OpenAI 官方文档里有一个真实案例把这件事讲得很清楚:任务是把冰岛语句子里的语法错误改对,团队最先想到的办法是补资料、配检索,结果没解决问题——因为这根本不是缺知识,而是模型没有按规则去改的那套输出习惯,是行为问题。换成微调之后,问题解决了。更反直觉的是,微调之后再把检索叠加回去,准确率反而下降了。选错工具不只是白费力气,还可能把结果拖得更差。

OpenAI 在另一份文档里把这个判断整理成了两类,可以直接当选型标准:第一类是"补上下文"——模型缺相关知识、知识过时、或需要用到私有资料,这类问题靠上下文和知识库解决;第二类是"调模型"——输出格式不稳、语气不对、推理不按要求来,这类问题才是微调该管的事。多数人觉得"AI 不懂我的行业",往往是因为它没见过相关资料,这属于第一类,跟训练无关。

普通人真的能微调一个模型吗?

即便确认自己要的确实是微调,下一个现实问题是:去哪儿做。三家的现状摆出来就很清楚——Claude 的官方术语表写明接口目前不提供微调,有需要要联系对接人;OpenAI 的自助微调平台正在收缩,新用户已经不能使用;国内开放平台的门还开着,但阿里云百炼的官方文档建议起步要准备一千条以上的高质量问答对,从准备数据到发布模型,官方文档列出的流程有七步。

"三分钟训练你的专属 AI"这类广告,到底在卖什么?

这两年"三分钟训练数字分身""一键克隆文风"的广告很常见。多数情况下,它们做的是一个组合:把资料放进知识库,配一套写好的提示词,再加上声音合成——模型参数一个都没动。

这不是说这类产品没用,也不是说都是骗人的。真微调这条路确实存在,公开的开源项目里也有拿聊天记录做微调的做法,只是那条路需要自己导出数据、敲命令行、准备显卡,跟"三分钟"完全不是一回事。下次再看到"训练"两个字,不妨先问一句:改的是模型参数,还是换了一套提示词。

常见问题

新开一个对话再问同一份资料的细节,AI 还能答上来吗? 默认答不上来,除非重新传一次。上传只对当时那一轮对话生效,换一个新对话默认什么都不带过去。如果它意外还能答上来,多半是因为开着记忆功能,或者资料被放进了长期项目里,走的是跨对话的产品功能,而不是它"记住"了。

把 300 页资料放进知识库,相当于它通读了一遍吗? 不是。建库那一步,回答问题的模型一段都没读到,建库做的是把资料切段、转成可比较远近的数字存起来,等着被检索。真正被模型读到发生在提问那一刻,而且每次只检索最相关的那几段,其余内容这一轮不会进入上下文。

知识库回答标出了资料来源,就一定准确吗? 不一定。来源对,不代表这段内容被用对了。检索可能选错段落,段落选对了也可能被理解偏。标出处的价值在于方便核实、一点就能跳回原文,而不是替你完成了核对。

用自己的数据微调模型,改变的是什么? 改变的是模型参数,落到结果上就是输出习惯,比如分类方式、格式、语气、是否听指令。它能看见哪些资料,是上下文和知识库管的事,跟微调无关。

一份资料每周都要问一次,最省事的做法是什么? 放进知识库,问的时候现查。每周都要用正是知识库要解决的场景:放进去一次,之后每次提问自动检索相关片段,换个对话也还在。微调在这种场景下方向就错了,因为微调改的是习惯,不是用来装一份会变的资料的。

这些内容出自哪里?要付费吗?

不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 6 讲《让 AI 懂你的资料:上下文、知识库(RAG)、微调》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。

要点总结

  • 上传文件、贴进对话,只是让 AI 这一轮"看得见"资料,模型参数没有变化,换个新对话默认清零。
  • 知识库不是提前"读完"资料,而是每次提问都重新检索一次,只取回最相关的几段放进上下文,这套流程就是 RAG。
  • 知识库的检索靠语义(意思相近),不靠字面关键词匹配,这也是它不需要你精心措辞提问的原因。
  • 能标出处能提升准确度、方便核实,但不等于保证不出错,重要结论仍需自己核对原文。
  • 微调改变的是模型参数和输出习惯(格式、语气、分类等),不是让模型"记住"新知识;个人层面目前几乎没有直接入口。

出品方:BotLearn免费AI公开课 | 对应课程:第 6 讲《让 AI 懂你的资料:上下文、知识库(RAG)、微调》,免费 | 更新日期:2026-08-28