知识资产如何支持企业应对 AI 时代的知识管理挑战
通用的数据与算法正在快速同质化,算力和开源模型都可以通过采购获得。相对更具企业自身特征、复制难度较高的,是企业自身在经营、生产、服务中沉淀下来的企业内部沉淀的业务知识,包括业务流程里的专家判断、对客户的客户理解与业务经验,以及大量没有写下来的隐性规则。

为什么模型可被复制,知识资产难以复制
要理解护城河的来源,先看"大语言模型"是怎么来的。早期的语言处理依赖统计语言模型,用词语共现的频率去预测下一个词。后来研究者发现,把词语映射成数字向量、让意思相近的词在数值空间里彼此靠近,模型就能捕捉语义。这一思路催生了预训练范式:用海量公开文本训练通用模型,让它掌握语言规律和通用常识。由于公开语料高度重叠,不同团队训练出的通用模型能力逐步接近。
通用模型的公开性决定了它无法单独构成壁垒。不同企业接入相同开源模型时,基础能力可能较为接近。企业形成差异化的一个重要来源,在模型之外那些不对外公开的内容。一条产线的故障排查经验,往往只存在于老师傅的个人判断里。客户有什么特殊诉求,销售记在了自己的笔记中。而某类合同历史上的谈判底线,藏在往来邮件的字里行间。这些都不会出现在公开语料中,也不会随模型迭代自动获得。它们以零散文档、个人记忆、私下沟通的形式存在,构成了企业独有的知识资产。

知识资产的持续积累
员工在工作中向系统提问,系统从已沉淀的知识里检索答案。每一条被使用的知识都附带一次反馈信号,系统据此判断它是否准确、是否过时。被反复验证有效的知识会保留并强化,存疑内容被标注待修正。新产生的问答与新整理的文档又持续进入资产池。于是出现一个循环:使用触发沉淀,沉淀有助于优化知识质量,并可能改善使用体验。资产规模越大,单次的边际成本越低。

构建路径
把散落的知识变成可运营的资产,要经过四个阶段。
数字化
企业知识最初大多躺在格式各异的文件里。PDF把文字、表格、图片压进固定版面,机器很难直接读懂其中的结构。Word 用标记语言描述文档,结构清晰但版本繁多。Excel 把数据装进网格,适合计算却不利于语义检索。要让这些格式被系统处理,得先具备解析能力:识别文件类型,提取纯文本与表格,遇到扫描件还要靠光学字符识别把图像转成文字。这一步解决的是机器看得见内容的问题。

结构化
光有文本还不够。早年的文本表示用一长串 0 和 1 标记某个词是否出现,这种独热方式无法表达词义关系,近义词在向量里毫无关联。后来研究者提出分布式表示,核心想法是一个词的语义由它周围的词决定。基于这个想法训练出的词向量,让"苹果"和"水果"在数值空间里比"苹果"和"螺丝"更靠近。
文本切分技术承接了这一思路。长文档被切成有独立语义的短片段,每个片段用一个高维向量表达。衡量两个片段是否相关,不再比对字面,而是计算它们在向量空间里的距离。向量检索技术随之发展,用近似最近邻算法在大量向量中快速找到相近项,避免了逐条比对的巨大开销。这一步让机器能理解内容的相似度,而不只是匹配关键字。
检索还可以进一步融合两种方式。向量检索基于语义相似度,容错性好,但可能漏掉字面严格匹配的内容。全文检索基于关键词,精确却缺乏语义理解。把两者合并,先各自召回再统一排序,在部分场景下可改善召回稳定性,需结合评测验证。这种混合思路已经成为企业问答系统的常见做法。

图谱化
向量检索擅长找相似,却不擅长回答谁和谁有什么关系。要处理实体间的关联,得换一种数据组织方式。语义网研究早年提出用"主体 关系 客体"的三元组描述世界,比如"公司 A 总部位于 城市 B"。把海量三元组连起来,形成一张图。
图数据库专门服务这种结构。传统关系库用表存数据,查询多层关联时要反复做表连接,层数一多就变慢。图数据库直接以节点和边存储,顺着边走就能找到关联路径。实体识别技术从文档里抓出人名、机构、产品等节点,关系抽取技术判断它们如何相连,可逐步形成面向企业场景的知识图谱。借助图谱查询语言,业务人员能问出"某供应商参与了哪些项目,这些项目的负责人是谁"这类跨实体的问题,而这是关键词搜索难以做到的。在图谱上做路径推理,可辅助发现潜在关联线索,比如两家看似无关的公司通过共同供应商产生间接关联。

自动化
资产沉淀好了,下一步是让它产生行动。智能体的概念可追溯到早期对能自主完成目标的软件系统的设想。现代实现依靠工作流引擎:把任务拆成若干节点,每个节点做一件事,节点之间按条件传递数据。有引擎支持分支判断,允许任务根据中间结果选择不同路径,也支持多节点并行以缩短耗时。引擎记录每个节点的运行状态,任务中断后能从断点继续,适合耗时较长的流程。
把前面的能力接进来,可配置出覆盖多个步骤的流程。例如周报的自动生成:先下载原始文件,解析文本,提取关键数字,调用模型生成摘要,最后发出邮件。

小艾智能体的定位
前面提到的四类能力,需要一套系统来承载。小艾智能体定位于企业知识管理,面向三个方向。一是作为知识加工厂,对上传的多种格式文档做解析和切分,再转成向量,把无序信息转为可检索的结构。二是作为自动化执行单元,借助工作流引擎把将部分高频任务配置为系统辅助处理,例如帮系统自动做代码审查,生成会议纪要,或者从文档里提取数据。三是作为辅助决策的支持,基于知识图谱与检索结果,为管理侧提供跨实体的关联视图。
系统采用 Python 异步框架搭建服务,工作流由图形化引擎驱动,核心推理调用兼容多种大模型。向量检索使用开源引擎存储文本向量,关系数据交给图数据库组织,全文检索由分布式搜索引擎承担。文档经解析与语义切分,转成向量写入向量库,并构建多维索引。知识图谱模块可辅助抽取实体与关系,结果需校验,支持用专用查询语言做关联推理。反馈机制收集用户对回答的评价,将经审核的问答内容可转为候选知识条目,由专家修正后进入学习循环。

回到开头。算法会趋同,模型能采购,公开数据获取门槛相对较低。企业能长期持有的是那些在日复一日的经营中生成、又经系统沉淀的企业内部沉淀的业务知识。
立即咨询