意图识别(Intent Recognition):智能体怎么听懂你想干啥
你在跟 AI 对话的时候,是否想过,作为一个程序,它到底是怎么听懂你说的话的?答案是「意图识别」!意图识别是智能体编排流程的第一道闸门,它判断你的一句话究竟是要问一个问题、查一组数据,还是让系统执行一个动作,并据此决定后续走哪条处理链路。本文拆解意图识别的定义、运行原理、工程意义与落地误区,帮你建立从自然语言输入到工作流路由的完整认知。

运行原理
意图识别的原理是分类加路由。系统先把用户输入映射到一个预设的意图标签,比如问答、取数、执行、闲聊,然后把标签传给编排引擎,由引擎把请求送往对应的工作流节点。这里的一个重要环节是先分类、后生成,通常不宜把原始文本直接丢给大模型自由发挥。
分类可以由规则完成,也能由模型完成。规则方式依靠关键词和正则匹配,速度快、可控性强,遇到"查一下""帮我提交"这类标准化表达很稳。模型方式用文本分类器或大语言模型本身做判断,能理解"上回那事儿办得咋样了"这种省略主语、口语化的句子。工程上常把两者结合,规则兜住高频固定句式,模型处理那些口语化、不规范的输入。
意图分类的常见维度
一套实用的意图体系通常覆盖四类。
问答类指向知识检索,系统从已有文档里找答案,适合处理流程和政策细节类问题。取数类则连向数据库,把自然语言转成查询语句,回答营收、逾期这类数值问题。执行类负责触发动作,调用外部接口完成周报发送、代码审查等任务。闲聊类做情感陪伴或信息澄清,系统简短回应,或反问以补全缺失要素。
四种类别可以叠加,一句话里可能同时带着取数和执行。比如"查一下库存低于警戒线的SKU并通知采购",先取数找出清单,再执行通知。这种复合意图通常需要系统先拆分、再分别路由,不宜只取第一个动词就完事。
典型应用场景
意图识别的价值在真实业务里最直观,下面举几个常见落点。
智能客服把进线请求先判意图。咨询类转知识库问答,投诉类转工单系统,办理类调业务接口。一个对话入口可支持处理多种请求,用户通常无需在菜单里反复查找。
企业内部助手服务员工。问"报销流程怎么走"走问答,问"我这个月差旅花了多少"走取数,说"帮我提交报销单"走执行。同一句话入口背后是三条不同的处理通道。
数据分析对话区分"看趋势""做对比""找异常"三种取数意图,路由到不同的分析模板,生成的图表和口径随之变化。
自动化办公处理指令型邮件。邮件写"把附件合同归档并提醒法务",系统拆成取数(识别合同文件)加执行(归档与提醒),自动跑完流程。
意图识别的工程意义
意图识别把不确定性挡在生成环节之前。如果系统分不清意图,该办事的请求被当成闲聊,用户等来一句客套话。该查数的请求被当成问答,模型凭记忆编出一个看似合理却无依据的数字。大语言模型本身在自我约束方面存在局限,你让它自由回答,它可能就会自由回答。用意图做前置闸门,有助于给不同请求分配不同的处理通道,生成环节可专注于自己擅长的事。这种做法有助于降低答非所问和编造内容发生的可能性。
多轮对话中的意图切换
单轮判断只是起点。真实对话里,用户的意图会随着上下文变化,系统必须持续重新识别。用户先问"上季度华东区营收多少",这是取数。接着说"把结果做成PPT发给老板",意图切到执行。再问"为什么比预期低",又回到问答。通常需要对用户输入重新进行意图判断,不宜沿用上一轮的标签。
持续判断依赖对话状态的维护。系统记录已经发生的动作和已掌握的信息,结合新输入推断当前意图。缺了这层状态,可能出现“系统还在查数、用户早已要执行”的错位。
落地常见误区
第一个误区是认为关键词硬匹配就足够。固定词表能覆盖标准说法,但可能难以覆盖口语化表达。
第二个误区是认为识别一次就一劳永逸。多轮对话中意图会切换,只判一次会让后续请求沿用错误标签,越走越偏。
两个误区指向同一件事。意图识别不是上线时配好规则就结束的配置项,而是需要模型兜底、需要随对话状态动态刷新的能力。
小艾智能体里的意图识别实现
小艾智能体可将意图识别落到编排引擎的具体节点上。工作流的起点节点可用于识别输入类型并初始化流程上下文,条件分支节点可根据意图标签进行动态分流。
问数类请求可走自然语言转SQL的链路,系统可将问题转换为数据库查询语句再返回结果。问答类请求可走检索增强生成链路,先从向量库和搜索引擎取回相关片段,再交由大模型组织答案,借此减少凭空编造的情况。执行类请求可走外部接口节点,调用第三方服务完成动作。
三条链路在编排层通过条件路由可自动选择,用户通常无需手动切换模式。这种起点识别、分支分流的设计,有助于将同一句输入引导到对应的处理通道,减少含糊表达在系统里空转的情况。
立即咨询