ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

企业 GenAI 为什么卡在试点?MIT 报告里的“学习差距“与四项工程检查

企业 GenAI 为什么卡在试点?MIT 报告里的“学习差距“与四项工程检查 很多团队都遇到过同一种场景内部 GenAI 试点演示效果很好业务方也点头了可一到接进核心流程这一步就停住了。几个月后项目还在试点名单里没人说它失败也没人再追加投入。MIT NANDA 项目发布的《2025 年商业 AI 现状》报告给这种现象提供了一组比较扎实的数据研究团队梳理了 300 多个公开 AI 项目访谈了 52 家组织并对 153 位高级管理者做了问卷。结论很刺眼——约 95% 的企业在 GenAI 上的投入没有带来可量化的回报。但对技术团队来说更有价值的不是95%这个数字而是报告对失败原因的拆解卡住企业的主要不是模型能力而是系统不会学习。本文把这个结论拆成可以落到架构和工程上的几个问题。一、先看漏斗通用工具和嵌入式工具是两条完全不同的曲线报告把企业 AI 工具分成两类分别统计调研 → 试点 → 成功部署的转化工具类型调研试点成功部署通用 LLMChatGPT、Copilot 等约 80%约 60%约 40%嵌入式 / 任务型 GenAI企业定制方案约 60%约 20%约 5%通用工具的部署率看起来不低但它们主要用于个人辅助并没有真正进入复杂的业务流程。真正要解决具体业务问题的嵌入式工具只有约 5% 走到了持续产生价值的阶段。还有一个反直觉的发现年收入超过 1 亿美元的大企业试点数量和人员投入最多但试点到规模化的转化率最低。报告提到表现好的中型企业从试点到全面实施平均约 90 天大企业则往往需要九个月甚至更久。工程上的含义如果你的项目属于嵌入式那一类默认就该假设它会卡在试点和生产之间而不是默认它会自然扩展。二、用户嫌质量差本质是嫌它记不住报告让高管和一线用户给规模化障碍打分1–10 分10 为最常遇到前五名是不愿意采用新工具约 9.0模型输出质量问题约 7.5用户体验差约 7.0缺乏高层支持约 6.5变革管理困难约 6.5第二项很值得技术团队注意。同一批人在个人生活里大量使用 ChatGPT并且评价很高到了企业工具上却抱怨质量不可靠。报告的解释是用户对企业级 AI 的期望不同——需要担责、嵌入核心流程的任务要求系统具备记忆和学习能力。进一步追问为什么不把通用 LLM 用在核心工作流上用户给出的四个原因是障碍选择比例对应的工程问题不会从我们的反馈中学习约 65%缺少反馈回路每次都要手动输入大量上下文约 62%缺少持久记忆 / 上下文注入无法按我们的工作流定制约 58%缺少流程级集成在边缘案例中出错且不会调整约 52%缺少异常处理与持续修正报告引用了一位律师的原话大意是它起草初稿很出色但记不住客户偏好也不会从之前的修改里学习会重复犯同样的错。这四条障碍报告统称为“学习差距”Learning Gap。三、把学习差距拆成四个工程问题下面这部分是把报告结论翻译成架构检查项。报告本身没有给出具体实现方案以下是按它的四条障碍整理的落地判断。1. 反馈回路用户的修改有没有被系统接住检查项用户对输出的修改、驳回、采纳是否被结构化记录下来这些记录会不会影响下一次输出例如进入检索库、偏好配置或评测集是否有人定期看这些反馈而不是只存日志如果答案都是否那么系统在第 100 次使用时和第 1 次没有区别——这正是用户说它不会学习的真实含义。2. 持久上下文谁在负责每次都要重新交代背景62% 的用户抱怨每次都要手动补充上下文。检查项客户偏好、历史决策、领域知识是存在系统里还是存在用户脑子里上下文是按任务自动装配还是靠用户复制粘贴上下文有没有作用域和过期机制避免旧信息污染新任务3. 流程级集成它是一个聊天窗口还是流程里的一个环节报告把各类 AI 工具放进一个定制化程度 × 记忆与学习能力的四象限低学习能力高学习能力低定制化Copilot、简单的 GPT 封装应用带记忆功能的 ChatGPT测试版高定制化企业内部自研的脆弱系统Agentic 工作流、垂直 SaaS值得注意的是左下角高度定制但不会学习的内部自研系统被报告明确标注为脆弱。只做定制、不做学习项目往往越做越重。4. 边缘案例出错之后系统会不会变52% 的用户提到边缘案例出错且不会调整。检查项失败案例是否被收集成回归测试修复是靠改 Prompt 临时补丁还是转成可复用的规则或数据有没有不确定时交给人的退出路径报告的判断是能补上这个差距的是具备持久记忆、能从交互中学习、能自主编排复杂流程的 Agentic 系统。它也给了一组分工数据对于写邮件、做摘要这类快速任务约 70% 的用户更愿意交给 AI对于持续数周的复杂项目约 90% 的用户更愿意交给人。分界线不是智能程度而是记忆、适应和学习能力。四、选场景先做窄而简单别一上来编排全流程报告总结了成功供应商的切入方式从非核心或相邻流程开始低配置负担、价值立即可见再逐步扩展。它用范围 × 执行复杂度划了四个区域区域特征示例快赢范围窄、执行简单支出分类、合同初审早期试点范围窄、执行复杂谈判机器人部分试点范围广、执行简单供应商风险监控最易失败范围广、执行复杂完整的采购流程编排样本中跑通的类别包括语音 AI通话摘要与路由、文档自动化、面向重复性工程任务的代码生成举步维艰的通常涉及复杂内部逻辑、不透明的决策支持或基于专有经验规则的优化。五、自研还是采购数据站在合作这一边这一点对技术团队可能有些逆耳。报告观察到尝试自研的公司远多于选择外部合作的公司但通过战略合作构建的试点最终成功部署的概率约是内部自研的两倍员工使用率也接近两倍。报告自己也注明这组比例来自 52 家组织的访谈样本不一定代表整个市场。报告总结的成功买方有四个共同做法其中两条对技术选型最有参考价值按运营结果评估而不是按模型基准评估。关心的是线索审核速度提升 40%“文档处理成本降低 30%”而不是某个榜单分数。从一线超级用户发起项目而不是从中央实验室推下去。那些早已在个人工作中用过 ChatGPT、Claude 的员工最清楚能力边界在哪里。高管选择供应商时最看重的六项里“清晰的数据边界”约 65%和随时间改进的能力约 58%都在列——前者是安全要求后者正是学习差距的另一种说法。六、回报在哪里后台往往比前台更容易算清报告提到约一半的 GenAI 预算流向销售和营销但最有说服力的成本节约案例大多来自后台自动化客户服务与文档处理中替代 BPO每年节省 200 万至 1000 万美元创意和内容方面的外部代理支出减少约 30%金融服务中外包风控检查每年节省约 100 万美元。这些收益主要来自减少外部支出而不是内部大规模裁员。如果你在选第一个落地场景这是一个值得认真考虑的方向外部支出有合同和账单基线清楚回报也更容易举证。七、一张上线前自查表把上面的内容压缩成一张表适合在试点评审时逐项过维度检查问题红灯信号反馈回路用户修改是否进入下一轮输出反馈只存日志无人使用持久上下文背景信息是否由系统装配用户每次都要复制粘贴背景流程集成是否嵌入现有工具与审批流独立聊天窗口需要切换系统边缘案例失败是否转成回归用例靠临时改 Prompt 救火场景范围是否从窄而简单切入第一期就做端到端全流程编排评估口径用业务指标还是模型分数验收标准是基准测试成绩发起方是否有一线超级用户牵头只有中央团队在推这篇文章的数据和结论来自 MIT 报告及其中文解读如果想看更完整的图表和各章节原始论述可以参考 MIT 报告对企业 GenAI 学习差距的完整拆解。最后回到开头的问题试点跑得好、上线跑不动往往不是模型不够强而是系统在第 100 次使用时仍然和第 1 次一样。先把会不会学习做进架构再谈规模化。
返回列表