
能扛住采购的 AI Agent 试点
能扛住采购的试点在任何构建开始前书面约定五件事:一个有边界工作流、带具名衡量负责人的单一成功指标、无需争论即可停止项目的终止阈值、你的安全团队已读过的数据处理答案,以及固定价格。付费跑 30 到 90 天,用真实数据。试点不死在演示里。它们死在安全审阅,以及没人能说成功本该长什么样的会议里。
Gartner 预期到 2027 年底超过 40% 的 agentic AI 项目会被取消,并点名三个原因:成本上升、商业价值不清,以及风险控制不足。每一个都在第一行代码之前、在试点如何结构化时就被决定。这里是避开全部三个的结构。

要点
- 付费,30 到 90 天,一个有边界工作流,真实数据。免费概念验证由谁有空谁来,对照什么也不衡量。
- 构建前写好成功指标与终止阈值。终止阈值是让财务安心的部分,也是供应商抗拒的部分。
- 在第零周回答安全问题,不是第六周。安全审阅是试点真正死亡之处。
- 每边点名一名人类负责人。Deloitte 发现只有 21% 的组织有成熟的 agentic AI 治理,决策边界是最大缺口。
- 以决策结束试点:扩大、延长一次,或停止。开始前写明你预期哪一个,因为演示永远不会替你定案。
构建前必须约定的五件事
1. 一个有边界工作流
一份工作,不是一个部门或平台,有清晰触发、清晰终态,以及可计数的工作单元。发票例外被分流。入站线索被资格判定并预约。支持工单被分流并打标签。外联潜在客户被购买信号标记并起草给人批准,形状见如何构建真正管用的 AI 线索生成系统。若你无法用带名词与动词的一句话描述工作流,它还没有边界,试点会扩张到失败。
测试:你能否说出这个工作流上个月跑了多少次?若数字不存在,试点前拿到它,因为它也是你的基线。
2. 带具名衡量者的书面成功指标
一个主指标、一个数字、一个读它的人。每周归还小时、无人触碰处理的项目百分比、周期时间、错误率,或每笔交易成本。选那个单靠自己就能证明花费合理的。
比你选的指标更重要的两条规则。第一,衡量者应在你这边,不是供应商;供应商批改自己的作业不是证据。第二,在 agent 上线前捕获基线。事后补的基线总是讨好且从不被相信。
3. 书面约定的终止阈值
低于它试点结束、无人再翻案的数字。若指标是「60% 的工单无人纠正即完成分流」,终止阈值可能是 35%。第 60 天未达标,合作停止,你的总敞口从始至终是有界金额。
这是把 AI 实验变成正常采购决策的条款,也是区分供应商的那条。抗拒终止阈值的供应商在告诉你他们对自己胜算的信念。
4. 预先回答数据处理
试点死在这里。演示没问题。定价没问题。然后第五周来一份安全问卷,花六周答得很糟。
启动前拿到这些答案:agent 读写什么数据、在何处处理、哪些子处理方触碰它、模型是否在你的输入与输出上训练(答案必须是否,且必须可追溯到供应商与模型提供商的条款)、访问如何授予与撤销,以及是否已有覆盖你的数据处理方式的数据处理协议(DPA)。要供应商信任文档的链接,不是承诺。若他们必须为你写,你已找到时间线风险。
我们的公开在信任与安全:安全态势、数据处理、子处理方、与美国国家标准与技术研究院(NIST)AI 风险管理框架四项功能对齐的治理摘要,以及可应要求提供的 DPA。我们没有 System and Organization Controls(SOC)2 报告(标准独立安全审计),该页明文写明,因为采购团队无论如何都会发现。
5. 固定价格,以及第二个工作流花多少
有边界工作一个数字。我们已发布的 AI agent 成本区间把小店简单单工作流自动化放在 $3,000 到 $8,000;这里描述的这类试点,带真实数据上的影子模式、有监督上线与书面终止阈值,范围更大,我们自己的公开为定价页上固定 $25,000 到 $60,000。现在也固定工作流二与三的价格,在第一个管用、你的议价地位消失之前。
30、60、90 天形状
第 0 到 7 天,构建前。 安全问卷与 DPA 在途。基线已捕获。成功指标、终止阈值与两边具名负责人已签字。访问以最小权限授予,在你自己的系统中,可由你撤销。
第 7 到 30 天,构建与影子。 agent 对真实数据运行但不采取不可逆行动。每个输出由人审阅,分歧是训练信号。你在衡量准确性,尚未节省时间。
第 30 到 60 天,有监督上线。 agent 行动,人对任何不可逆事项批准,批准率成为值得看的第二指标。若批准近乎普遍,扩大自主。若纠正频繁,你已找到工作流边界,即使它杀死试点也是有用结果。
第 60 到 90 天,决定。 三种结果,事先写好:扩大到下一工作流、用特定修复与新日期延长一次,或停止。「继续看看」不在其中,而这正是那 40% 成为 40% 的方式。
你的安全与法务团队会问什么
第一次通话前组装这些,你就能从周期里去掉数周:
- 模型问题。 哪些模型、来自哪些提供商、在什么条款下,以及它们是否在我们的数据上训练。
- 数据流。 什么离开我们的环境、落在何处、保留多久、如何删除。
- 子处理方名单。 名字,不是类别。
- 访问与撤销。 你授予并可自行收回的平台原生角色,对供应商持有的凭证。前者容易批准得多。
- 审计轨迹。 agent 做了什么、何时、在谁的授权下,你无需问供应商即可读。
- 人工批准边界。 哪些行动需要人,书面写明。Deloitte 对 3,235 名 IT 与业务领导者的 2026 调查发现只有 21% 有成熟的 agentic AI 治理模型,决策边界、实时监控与审计轨迹被点名为缺失件。你的审阅者知道这一点。
- 监管态势。 若你在欧盟运营,注意 Digital Omnibus 协议将 AI Act 下多数高风险义务推迟到 2027 年 12 月与 2028 年 8 月,但 Article 50 透明度义务自 2026 年 8 月 2 日起仍然有效,包括当人与 AI 系统互动时的披露。问供应商 agent 如何自我披露。
我们见得最多的试点设计错误
自动化有趣的工作流,而昂贵的那个仍用手跑。 有趣的演示好看。昂贵的资助接下来三个。
没有基线。 没有之前数字,每个之后数字都是争论。
成功定义为「它管用」。 演示里它总管用。定义数字。
不能失败的试点。 若没有停止它的阈值,你买的不是试点,是第一次分期。
在同一工作流上同时跑两个供应商。 感觉严谨却不是:谁都拿不到干净数据,两边互相甩锅,你花两倍学得更少。
我们在自己运营内做什么
我们在自己身上跑这套结构。我们的内部 agent 舰队每周跨团队夺回50 小时或更多,一次构建一个有边界工作流,每周审阅,人对任何不可逆事项批准。我们还在 mcp.strataigize.com 运营公共 Model Context Protocol(MCP)服务器,即让 AI agent 调用外部系统的标准,以便 agent 直接查询我们的业务。我们还没找到另一家机构在跑一个。它存在是因为我们自己先需要它。
这就是我们能一本正经为第一个工作流定价的原因:我们在自己的运营上跑过这个的第九个月版本,而不只是幻灯片上。

常见问题
AI agent 试点应跑多久?
三十到九十天。短于 30,你在衡量新鲜感。长于 90 没有决策,试点就变成了项目,这正是 Gartner 取消数据描述的失败模式。
AI agent 试点应付费吗?
是。免费试点两边都用闲置产能、对照什么也不衡量,所以以演示结束且决策从不定案。按单工作流价格付费、有边界的试点,得到真人和真实成功指标。
合理的终止阈值是什么?
大约目标指标的一半到三分之二,设得够高以至于未达标清楚意味着工作流未就绪,又够低以扛住一个慢周。精确数字不如写下来、并有人被点名去调用它重要。
内部谁应拥有试点?
今天拥有该工作流的一个人,不是委员会,也不是 AI 爱好者。他们知道例外,能判断输出是否正确,并对小时是否真正回来会诚实。
开始前我们应问供应商什么问题?
完整列表在问 AI agent 供应商的 24 个问题。若你仍在决定是否用供应商,从构建还是购买开始。
与我们一起跑一个
我们正是这样界定试点:一个工作流、固定价格、书面成功指标、约定终止阈值、安全预先回答。预约增长审计,我们会点名你最高价值的工作流,或阅读这里的 AI agent 开发如何运作。
联系我们