"能聊天"和"能干活"是两回事:企业选 Agent 不能只看 demo
为什么大模型演示现场的几轮对话总是流畅得挑不出毛病,系统交到业务部门手里却可能面临实际使用中的挑战?
答案在演示环境与生产环境的差异里。对话能力可以在较短时间内打磨得较好,但要把一件事完整做完、接进现有系统、长期稳定地运行,需要持续的工程投入。判断一套 Agent 值不值得上线,建议重点关注它在工程上有没有可被验证的证据。

对话系统是怎么一步步获得动手能力的
语言模型的核心能力之一是:根据上文预测下一个词。最早的统计语言模型只能参考前面几个词,句子一长就抓不住重点。神经网络把可参考的上下文拉长,Transformer架构(Vaswani等人在2017年NeurIPS发表的《Attention Is All You Need》中提出) 引入自注意力机制,让句中每个位置都能直接关联到任意其他位置,长距离依赖问题被解决,生成质量随之跃升。
这种能力在表达层面很实用。长文档压缩成摘要、口语整理成公文、一种语言翻成另一种语言、空白页生成第一版初稿,都属于模型擅长的区间。但模型输出的是"看起来合理的延续",这段延续与事实是否相符,训练目标里并不包含这一项。这就是为什么会出现幻觉,答案流畅、语气笃定、内容无据。
一个重要突破出现在工具调用机制上。工程上的做法是把可调用的函数用一份结构化描述交给模型,描述里写明函数名、参数名和参数类型,模型据此输出一次调用请求,由程序真正执行,再把执行结果回灌给模型继续推理。查库存、改订单、发通知这类动作可通过该机制实现。
文本生成错误的影响相对有限,但写入动作出错可能影响业务数据及下游流程。权限校验、幂等设计、失败回滚、操作审计这四样东西,在演示环境中往往难以充分展示,但缺了任何一项,系统都难以进入生产环境。选型时可以直接问:工具调用的鉴权走谁的账号体系,写操作是否支持幂等键,中途失败是整体重跑还是从断点继续。
它能不能把一个动作变成一串动作
单个工具调用解决的是一步,真实业务通常要走十几步。流程自动化远早于大模型,OA 审批用流程图描述节点、分支和办理人,数据调度用有向无环图描述任务依赖与重试,两者做的是同一件事,把流程结构显式化,让每一步可被观察、可被重放。Agent 编排借鉴了这套骨架,区别是可将部分判断交由模型处理,图的结构也可支持动态调整。
评估编排能力可以从配置方式入手。业务规则变化之后,改一份配置文件就能生效的系统,与改代码重新发布的系统相比,迭代效率通常更高。条件路由让不同输入走不同路径,状态传递让后一个节点直接引用前一个节点的输出,这两项决定了一条流程能有多复杂。检查点机制可用于处理中途中断,从断点继续通常比从头重跑更高效。并行分支也值得确认,多个独立检索同时执行与串行执行的耗时差距很明显。
你可以在现场做一次压力测试。把公司里一条真实任务拆成六到八个环节,要求对方演示每一步的中间产物、耗时、失败重试记录和人工介入点,再当场中断一次,看任务能否从断点继续。只能端到端跑一遍、中间过程全黑盒的系统,编排能力还没站稳。
跑在自己公司里的 Agent,凭什么改 OA 里的数据
这一层一个关键难点在身份与权限。Agent 以谁的身份去改数据,出了问题算谁的责任,这是合规问题,技术之外还要制度配合。单点登录、操作留痕、字段级权限,缺一项都过不了审计。另起一套账号体系的做法可能增加运维复杂度。
接口形态也要分开考察。耗时几分钟的任务走同步接口必然超时,合理的方式是提交后返回任务 ID,调用方轮询状态或等回调推送。流式接口影响体验,逐字渲染比整段等待更容易被接受。
判断能否接入,直接要接口文档,重点看异步任务接口与任务 ID、结果回调机制、权限能否继承企业已有的账号体系。
接入之后的场景更具业务价值。从 OA 拉取待审批单据,Agent 核对合同要素后回写审批意见;从 ERP 查实时库存与在途量,生成补货建议并触达采购;从 CRM 读取客户档案与沟通记录,整理跟进要点并更新客户状态。
太碎,一句话被拦腰截断,语义就断了;切得太长,检索回来的噪声多。按段落和语义边界分块通常比按固定字数切分更为稳妥。嵌入模型负责把片段转成向量,BGE-M3(北京智源研究院发布) 这类模型支持多语言和较长输入,是企业场景里的常见选择之一。
小艾智能体
执行层面,小艾可选用 LangGraph 作为工作流引擎,内置多种节点,可支持条件分支、状态传递、并行执行,配合检查点机制可实现断点续跑,长任务可采用异步接口。集成层面,Agent 执行、文档上传与处理、任务状态查询、同步与流式问答、技能调用可开放接口,可作为被调用方集成至 OA、ERP、CRM。运维层面,Milvus 向量检索与 Elasticsearch 全文检索可用于混合召回,Neo4j 可承载实体关系与多跳推理,用户反馈、问答对沉淀、人工修正、质量评分与标签可共同构成持续优化的知识循环。
采购 Agent 时,把验收标准从功能清单换成业务指标。某条流程的单次处理耗时从多少降到多少,人工介入率降到多少,知识库覆盖多少条业务问题之后准确率稳定在什么水平,每次回答能否溯源到原始文档。
立即咨询