← 企业洞察
繁體中文 English 简体中文
2026-07-31 · Levi · LinkedIn

RAG 准确率取决于文件类型

企业导入 AI 问答系统前的工程现实

RAG 向量搜索 文件切割 AI 问答系统 准确率 企业AI

供应商演示时,AI 问答系统的准确率通常超过九成。这个数字本身并无问题,问题在于:它是在什么文件上测试出来的?

准确率不是单一指标。它高度依赖文件结构、切割方式,以及用户提问的形式。同一套系统,放在不同的文件环境下,表现可以相差极大。

文件类型决定了准确率的上限

清单型文件(例如:产品规格表、价目表、条款细则)

这类文件的特征是:信息密度高,每一行都有独立意义,段落之间没有叙述性连接。若按段落切割,容易将相关条目分开,导致检索时只取回部分信息。对于篇幅可控的清单型文件,较可靠的做法是整份注入上下文,而非切割后检索。

段落型文件(例如:操作手册、合规政策、产品说明书)

这类文件按章节组织,每个段落有明确主题边界。按段落切割后建立向量索引,通常能取得较好的检索准确率——前提是段落本身结构清晰,且每段主题不过于分散。

语意型文件(例如:电邮内文、会议记录、客户往来讯息)

这类文件的主题边界不依赖格式,而依赖语意转折。单纯按字数或换行切割,常常将同一个讨论事项分割到不同片段,或将无关话题合并在一个向量中。按语意边界切割的工程成本较高,但在此类文件上是必要的。

三种类型同时存在于同一个企业的知识库中,是常态,不是例外。一套针对单一文件类型优化的切割策略,套用到混合环境后,准确率通常会显著下滑。

向量搜索的一个根本限制

RAG 系统的工作原理,是将用户的提问转换成向量,在文件库中寻找语意最接近的片段,再交给语言模型生成答案。这个机制的设计前提是:用户提问的语意,与文件中的相关内容语意相近。

这个前提在很多情况下成立,但有一类情况会系统性失效:开放式问题。当用户问"这份合同有什么需要注意的地方?"时,这个问题本身没有特定语意锚点。向量搜索无法判断"需要注意的地方"对应文件中的哪些段落——因为文件从未用这个角度组织过。系统可能回传一个语意接近但实际上不相关的段落,语言模型再以此生成一个听起来合理、但信息基础错误的答案。这不是模型的失误,而是向量检索在开放式查询下的结构性限制。识别哪些类型的提问属于这个盲区,是系统设计的一部分,而非事后修补的问题。

电邮与混合文件环境:最接近真实业务的场景

许多企业的业务知识,实际上分散在以下几个地方:Gmail 收件箱中的客户往来电邮;以 PDF 传送的报价单、合同、审计报告;以附件形式接收的 Excel 报表或 Word 文件;部门之间的即时通讯记录。每一种来源的结构都不相同,处理方式也各有差异。

以电邮为例:电邮正文属于语意型文件,切割策略需要对应处理;附件若为 PDF,又涉及 PDF 解析的准确率问题(扫描版 PDF 与原生 PDF 的处理成本差距可以相差数倍)。将这些来源整合到同一个可查询系统,需要为每种文件类型制定独立的摄入流程,而非一个通用管道。供应商提案中若只有一种"AI问答系统"而未说明各文件类型的处理策略,是值得追问的缺口。

评估准确率之前,先确认测试条件

一、测试文件的类型是什么?若演示使用的是结构整齐的政策文件,而实际环境以电邮和混合 PDF 为主,两者的准确率不具可比性。

二、切割策略是否针对文件类型设计?要求供应商说明对清单型、段落型、语意型文件分别使用什么切割逻辑,以及混合环境下如何处理。

三、开放式问题的覆盖范围是什么?要求以实际业务问题测试,而非供应商预设的示范问题。

四、电邮和附件的摄入流程是否已纳入设计?若业务大量依赖电邮往来,要确认系统能处理电邮正文、PDF 附件,以及不同附件格式的混合情况。准确率九成的承诺,只有在真实文件上测出来,才算数。如需了解 RAG 与 Fine-tuning 的决策框架,可参考RAG vs Fine-tuning 企业决策指南;如需了解 Gmail PDF 自动化流程,可参考Gmail PDF 自动化:用 Google Apps Script 将市场报告送达决策者

Levi 是驻香港的独立 AI 工程师,为推进 AI 数字化转型的中小企业构建生产级 LLM 应用、RAG pipeline 及文件智能系统。

查看更多企业案例 →

微信:freedom_from_gold 或邮件:support@hksoka.com