企业知识库接上 AI 却答非所问,问题往往不在模型,而在喂给它的数据。
AI 问答只能抓取文字。图片里的字、截图里的按钮,对它来说就是一片空白。
有六类文档是“检索黑洞”:复杂合并表格、纯图纸、系统操作截图、扫描件、少字多图的 PPT,还有直接扔进去的压缩包。人一眼能看懂,机器抽出来却全是乱码。
新文档要从源头改规矩:关键信息必须用文字写清楚,别全塞在图片里;表格别合并单元格;图纸和压缩包得配一段文字说明。
老文档别推倒重来:纯文字直接提取;带图表的,用多模态大模型逐页转成规范文字。这样既省钱,命中率也高。
最后还得跑通一个四步闭环:
入库前:先做体检,不合格的拦下或自动转写。
加工中:按类型分诊处理,各走各的通道。
使用中:收集“答错了”这类反馈,反向定位烂文档。
迭代回灌:改完重新入库,越用越准。
说白了,想让 AI 干活,得先把企业的经验变成它能读懂的文字。