企业Agent落地的核心问题:让AI具备判断力,从分析它该知道什么开始
文/田志刚 (微信号:511956894)
企业AI落地最贵的成本,不是算力也不是模型,而是—没有人说得清,为了把一件事做对,AI到底需要知道什么。
大模型的能力在快速进化,围绕它的工程技术也在狂奔:检索增强(RAG)、上下文工程、Agent框架、微调、评测、治理。
企业AI的技术栈越来越完整,但落地却是另一回事。
MIT年发布的一项调研显示,约95%的生成式AI试点没有带来可衡量的业务影响;Gartner预测,到2027年底将有超过40%的agentic AI项目被取消,真正走到生产环境的试点只有一成左右。
值得注意的是,这些失败几乎都不归因于模型能力,报告指向的是系统整合、治理和业务价值。
一方面是各类机构AI应用做的轰轰烈烈,另一方面是投入大量资源的项目貌似没有产生真正看得见的巨大价值。
在追问原因之前,需要先搞清楚一个被普遍跳过的前提:企业让AI上场,目标并非期望做到普通水平,而是希望通过AI让核心业务达到行业领先水平。
普通水平的AI并不缺——问题答对一半、建议似是而非、遇事就转人工专家,这样的系统既不值得企业为它改造流程,也无法承担真实的业务责任。
企业投入建设Agent,要的是像优秀员工一样完成任务。换句话说,专家级表现不是锦上添花的进阶目标,而是业务敢于把任务交给它的门槛。
同时还要把两类Agent分开。
一类是简单的任务型Agent——查订单、答常见问题、生成标准文档——现有技术已经够用,因为任务边界清晰、判断有限、出错代价可控。
但企业AI的价值不在这些边角,而在第二类的复杂业务任务:产品定义和决策、营销方案优化、设备故障定位、异常处置、方案设计。
这些任务判断链条长、变量多、例外频繁、失误代价高,而且有一个共同点:它们都是知识任务:完成它们,主要依靠判断、决策和专业知识。
企业真正想交给AI的是这些,真正交不出去的也是这些。
基于以上的两个前提,企业想在复杂任务上达到专家级表现,就必须先回答一个问题:
对一项具体的知识任务,为了把它做到卓越水平,AI到底需要知道什么,才能保证最后的结果是最优?
但不幸的是,这个问题企业里从来没有人分析过,甚至那些能够把问题做到卓越水平的骨干和专家员工们,也不清楚,我们称之为“不知道自己知道”。
这个问题,是所有企业Agent失败背后共同的上游。
数据库中每个客户有几百个字段,一台设备有上千个运行参数,知识库里有几十万份材料。
这些数据都可以用,都可以获取。但能够获取,并不等于为了完成任务应该获取。
模型越强、工具越多,这个缺口不是被填上了,而是被放得更大。
举个例子说:
几个人一起去餐馆吃饭,小王问领导吃什么,领导说:”你看着点吧,随便点几个菜。”
只根据这句话,小王能把菜点好吗?
如果小王是新手,可能就开始研究“随便点几个”的问题。
而一个会点菜的人会自然的考虑到:
一共几个人、有没有老人孩子、有没有人过敏、是朋友聚餐还是请客户、预算多少、已经点了什么、荤素冷热如何搭配……
这些影响”随便点几个菜”如何被理解和执行的背景、条件、约束,就是AI里面提到的上下文。
不会点菜的人只会反复琢磨”随便”两个字——但这两个字不包含完成任务所需的信息。
企业AI今天的问题一模一样:给了它满库的资料,却没人说清,为了把这件事做对,它需要知道什么。
这不是上下文工程一个环节的短板,而是整个企业AI应用的核心问题。
先看现实:国内企业AI走到哪一步了
2026年一季度,国内大中型企业AI采纳率已超过90%,新一代AI采纳率超过80%;但约67%的企业仍停留在探索试验级,只有约9%进入体系优化级。
项目数量上,通用辅助场景(写邮件、生成文档、知识问答)占比超过八成,真正进入专业纵深业务场景的不到两成。
一句话概括:采纳率很高,但真正深入业务、持续产生可衡量价值的Agent还不多,绝大多数企业还没有系统回答”为了把任务做对,AI需要知道什么”。
那有没有效果好的Agent?经过我们的调查,也有一部分相对成熟的案例,但多数仍停留在试点或宣传层面。
通常做的好的,主要集中在场景边界清楚、知识可沉淀、结果可验证的领域:工业设备运维、工业检测与工艺、政企审批与合同等。它们的共同点不是”模型更强”,而是先把任务拆开了:这个场景要达成什么结果?专家做对时需要哪些信息?哪些判断必须显性化?哪些环节交给Agent、哪些保留人工复核?
换句话说,成功的Agent都主动被动地去做了类似”知识任务分析”的工作,只不过做的程度不一。
反过来,大部分企业只是把文档灌进知识库、接一个RAG、再加一个Agent界面,这种项目大都停在演示、问答和辅助写作层面,很难进入核心业务。
一、AI缺的不是数据,是判断
客户向电信客服说:”你们的套餐太贵了,我想换一个。”
有经验的客服不会把”贵”等同于”需要更低的费用”,而是自然的去分析原因:可能是长期用不完流量觉得浪费了,可能频繁超额花钱肉疼了,可能在比较竞品想换联通了,或者对网络质量不满、或者家庭套餐没有合理组合等问题。
优秀客服会观察用户的语言、查询账单、了解家庭和宽带情况,必要时追问,最后判断该降档、调整组合还是做什么。
这种判断差异并不只存在于客服场景,在更高风险的业务中会更加明显。消防现场是更极端的对照。
同一栋楼起火——普通人看到的是”楼着火了”:打119,等消防车来。
消防专业人员则自动展开一连串观察和判断:烟的颜色判断火源类型,风向判断灭火角度和疏散方向,建筑结构图决定从哪里进、从哪里撤,周边易燃易爆物决定警戒范围,内部人员情况决定救援顺序。
同一栋楼、同一个现场,普通人与专家接收到的上下文完全不同,行动结果也完全不同。
这种差异不是信息量的差异,是判断力的差异。
普通人不会想到看烟的颜色,因为他的认知模型里”烟”和”火源”之间没有建立关联。
所谓专家级表现,核心就是这个快速获取充分准确信息、多维度权衡的判断力。
而有经验的客服和消防专家身上有同一个事实:他们的判断并不写在操作流程文件里,而是内化在大脑中。
企业过去靠人完成任务,没必要把这些默认的常识和判断条件逐条显性化。
这样问题就来了:
假设AI只连接了用户资料、账单和套餐目录,它可以给出”价格更低”的推荐,却可能连客户说的”贵”是什么意思都没弄清。
面向人的知识库,可以把理解和判断的最后一公里交给使用者;面向直接执行任务的AI,这一公里没有人类补位,必须被重新分析出来,形成可调用、可验证的机制。
相关链接
经典培训课程
企业AI知识库搭建与运营培训课程
呼叫中心AI知识库培训课程
个人知识体系构建能力课程
书籍和资料
《卓越密码如何成为专家》
《你的知识需要管理》
免费电子书《企业知识管理实施的正确姿势》
免费电子书《这样理解知识管理》
知识库知识管理系统
企业AI知识管理知识库软件系统清单
个人知识管理软件AI知识库系统清单
二、如何让AI具备判断力
维修老师傅听到某种异响就能判断问题所在,新手会问“什么叫异响”,老师傅会觉得”这还用说吗,很自然就听出来了”。
但新人却不知道该听哪个位置、什么频率、何种负载条件。
资深专家的常识,可能正是新人和AI的知识缺口。麻烦的是,许多时候专家自己意识不到这些遗漏,因为接收和判断早已内化成直觉。
再看在具体项目中,谁来承担分析工作:
技术人员熟悉怎么读取字段,却不知道字段对哪种判断重要;流程人员能列出操作步骤,却说不清每一步用了哪些隐性知识;业务专家很会做,却未必能完整解释自己为什么注意这个信号、忽略另一个信号。
每个人手里都只有一小块拼图,没人有完整的那张图。面对这样的问题,该如何解决,推荐KMCenter的“知识任务分析(KTA)方法”。
KTA的出发点是任何一项知识任务能够做到专家级水平,一定背后有专家级的知识体系支撑。
通俗点讲,没有人是突然NB的,之所以他比我们看的深入、想的全面、能从现象自动到本质是因为他的大脑中比我们多了某些数据、信息和知识。
如果我们分析出专家的这些知识是什么,普通人也可以具备专家级的表现。这个分析方法背后有支撑专家级表现的四种知识类型(常识、关联、广度、深度),有四个知识层次等分析方法。
常识类揭示业务人员默认知道的前提;关联类揭示现象—原因—对策与信号之间的关系;广度类补齐应考虑的因素、分类和框架;深度类说明背后的机制、适用条件与例外。再结合流程性、情境性、策略性知识,检查执行时哪里可能遗漏。
具体做的时候,并不是听某位专家说就行了,而是从行业最佳任务分析、不同专家的独立判断进行碰撞、新人反复碰到的困难三个方向收集线索,交叉对照,再用历史案例和真实业务验证:新人反复问的问题,恰恰能暴露专家习以为常的知识。
最终产出不是知识点清单,而是这项任务的专家级知识体系:
哪些知识支撑哪些关键判断、需要哪些当前信息、何时追问、何时停止或转人工、依据什么评价输出。
它同时是参照系——企业和个人都可以拿它对照,看清自己离专家级表现差在哪些知识上。(关于该方法论的具体分析方法,可以联系作者交流,微信号:511956894)
三、企业AI落地的核心能力
把任务倒推成知识需求清单之后,紧接着是一个更关键的问题:这些知识从哪里来?
企业的情况一般分两种,对应两条路径。
(一)企业内有专家:知识建模,本质是重建而非提取
路径是把优秀员工的判断变成AI可调用的任务知识,但要先破除一个长期流行却站不住脚的假设:专家会做,就等于知识已经在他大脑里,直接提取出来就行。
这个假设把大脑当成了仓库,实际不是这样。专家的判断经过多年实践早已被压缩、自动化成直觉——让专家解释”你为什么这样做”,他给出的常常是事后的、合理化的版本,而不是真实的判断依据。
所以该项工作不是之前常说的经验知识萃取,而是一项知识建模的工作。具体内容可以参考这篇文章:AI时代的经验知识萃取方法论:专家经验不是萃取出来的,而是知识重新建模的过程
(二)企业内没有专家:员工共创生产知识
任务关键,但企业自己也没人能做到专家级——新业务、新模式、专家断层的领域都是这种情况。
这时知识不是萃取问题,而是生产问题:引入外部知识(行业实践、公开研究、外部专家经验),结合企业自身场景,通过研究、试点和真实业务验证,共创出原本不存在的判断规则。
这两条路径本质上是同一种工作:企业的知识生产,两种情况其实是纠缠在一起的,通常很少单独出现。
即便内部有专家,企业也希望达到行业更高水平,因此有专家的企业同样要借鉴和对标外部,没有专家的企业更以外部知识为主要输入,内外结合是常态。
四、这笔账为什么在AI时代才划得来
看到这里的读者,很多人的第一反应是:这项工作太复杂、太重了,哪有精力对每件事都这样做?这里要算两笔账。
(一)经济账:一次建模,N次复用
这项工作在AI之前之所以被长期忽视,不是因为不重要,而是因为投入产出比不高:
萃取出来的知识只能靠人工培训慢慢扩散,覆盖范围有限,边际成本居高不下,企业自然没有动力。
AI改变了这个等式:把一位专家对一个任务的判断体系沉淀下来,Agent可以7×24小时、跨渠道、并行地反复执行,一次建模可被复用N次,边际成本趋近于零。
它从”一次性重投入”变成了”可规模化摊薄的资产建设”。
所以知识任务分析KTA的必要性在AI时代不是降低了,而是被放大了:
它从”锦上添花的知识管理项目”,变成了”AI能否真正进入业务核心的前置条件”。
(二)不做会怎样:企业内部AI应用的四种结局
如果不做这项分析,企业内部AI应用大概率走向四种结局:
一是停留在”信息问答”层面,能查制度、翻文档,一到需要判断的环节就露怯,业务部门觉得”没用”;
二是靠堆人兜底,AI给初步结果、每个输出都要人工复核,省下的成本又被复核吃掉,ROI算不过来;
三是在边缘场景打转,只敢做写邮件、生成PPT这类低风险任务,核心业务始终碰不到;
四是反复试错、反复推翻,没有清晰的知识需求基线,每次调优都是盲人摸象,项目周期越拖越长,最终被取消。
当然需要注意的前提是:不是每件事都要这样做。
大量简单、低风险、已成熟的任务,现有技术加基础资料就够。真正应该做的,是最急迫、最有影响的少数关键任务:业务价值高、判断失误代价大、反复出现的那些。
先选一个,把专家级知识体系建起来,让AI在真实业务里见效,再逐步扩展。平均用力、全面铺开,才是把这件事做死的方式。
五、不只是上下文问题:任务知识分析结果是技术栈的上游
传统资源型知识库有其价值,制度、标准、文档、经验材料应当保存和复用。但如果长期停留在”有什么就管理什么”,知识量再大也未必改善关键任务。
AI时代的知识库不必推倒重来,而是增加任务知识这一层。
而它的意义远不止让上下文工程更准——企业AI技术栈的每一个环节,最终都在消费它的产出:
- 上下文工程靠它决定注入什么、检索什么、压缩什么,否则就只能是”有什么塞什么”;
- RAG和知识库建设靠它决定建什么索引、按什么问题组织内容,而不是反过来被已有文档决定结构;
- 微调和数据生产靠它决定用什么语料、合成什么案例——没有任务分析,造数据就是随机采样;
- 评测靠它生成测试用例,连”什么算做对了”都说不清,评测就无从谈起;
- 治理和行动边界靠它定义何时追问、何时停止、何时转人工,这些规则本身就是任务知识的一部分。
换句话说,任务知识不是一个新增的技术环节,而是决定所有技术环节”做什么”的那个上游。缺了它,每一层工程都在猜。
有人会问:大模型能力在不断进化,输入的内容越来越多,这些缺口会不会靠模型自己补上?部分成立。
在通用知识和公开信息领域,模型确实越来越强,许多缺口会被能力提升自动填上。
但要警惕:模型进步最容易达到的是”普通水平”,而普通水平恰恰不是企业的目标。即便只看专家级表现,企业环境也有两个绕不开的约束:
一是私有数据的天花板:模型能力建立在数据之上,而企业大部分任务并没有海量数据——一位资深客服一年处理的复杂案例不过几百个,一台设备整个生命周期的故障记录可能只有几十条。数据里不存在的判断,模型再强也推不出来,而这些判断只存在于专家头脑和分散的实践中,不主动分析、萃取,它们就不在任何模型能够到达的地方。
二是结果的可信度:即便模型碰巧答对了,企业也无法判断它是基于完整的判断链,还是基于表面相似的措辞。没有显性的专家级知识体系,就没有验证的依据;不可验证的输出难以让人信服,业务就不敢真正交给它。说不清依据的正确,和错误一样不可用。
所以,模型能力越进化,这项分析工作反而越关键:工程进步解决”怎么给”,模型进化解决”给了能不能理解”,但”该给什么”始终需要有人分析出来。
这不是一个会随技术进步而消失的过渡性问题,而是企业AI现在和未来真正影响业务的核心问题。
结语:企业AI要补的课,不在技术栈的哪一层
第一个知识任务背后的数据、信息、知识需求如何分析、知识建模怎么做,大多数企业没有相关的方法和经验,也欠缺相应的人才;知识共创怎么组织,更没有先例。
企业要想把这项工作做好,相关人才的培养是绕不过的坎,KMCenter有成熟的方法论和相关案例,感兴趣可以联系(vx:511956894)我们。
第二个:过去企业靠人完成任务,大量知识和上下文由员工自然补齐,今天希望AI直接完成任务,这些隐藏的知识依赖就绕不过去了。真正值得重视的,不是”还能给AI多少内容”,而是”为了让它把这项任务做对,必须知道什么“。
模型会更聪明,工具会更强大,但企业自己的任务知识,没有人能替你分析出来。
第三个:这个事情如何起步的建议:挑业务价值高、判断失误代价大、反复出现的少数关键任务,而不是全面铺开;做一次知识任务分析。用常识、关联、广度、深度四类知识清单,把这个任务需要什么知识、依据什么判断、何时追问、何时转人工拆解出来,产出专家级知识体系;验证并扩展。把这套知识接入Agent,用真实业务结果检验——是降了成本、缩短了周期、还是提升了转化,跑通一个,再复制到下一个任务。
多个任务积累后,还能归纳出跨任务复用的信息获取框架与判断模型,形成可持续升级的企业知识资产。(本文作者为知名知识管理专家作者田志刚。您可通过微信号:511956894 与他联系)