← 博客

何时较小的 AI 模型就够用

前沿模型按开放式对话定价,但多数生产级 AI 工作是同一有界任务重复成千上万次。在这种工作形态上,小模型常常够用,有时更好。NVIDIA 研究人员指出,服务 70 亿参数模型在延迟、能耗与算力上比服务 700 亿至 1750 亿参数模型便宜 10 至 30 倍。决定因素是你的任务是否窄到足以界定与度量。

在 Google 中将我们设为首选来源

这项免费的 Google 设置可让您在自己的搜索体验中看到更多与查询相关的 Strataigize 文章。您可以随时更改。

2026 年构建 AI 功能的默认做法是调用最大可用模型然后继续。它能用、出货快,对真正开放式助手也是正确选择。对更常见的情况(每天几千次阅读入站线索或从发票提取六个字段的系统),它在默默为任务从不使用的能力多付钱。

智能体工作是重复的,重复工作是狭窄的

生产中的智能体很少在进行宽泛对话。它分类、提取、路由、用结构化参数调用工具,或在少数下一步之间做决定。同一提示词形态一遍遍运行,只是倒入不同内容。

NVIDIA 的一个团队在 Small Language Models are the Future of Agentic AI 中正式提出这一论点,初稿于 2025 年 6 月发布,同年 9 月修订。他们对「小」的工作定义是:能装进常见消费设备、回答够快以有用的模型;按 2025 年标准,大致指 100 亿参数以下的任何模型。

其经济主张是具体的。服务 70 亿参数模型比服务 700 亿至 1750 亿参数模型便宜 10 至 30 倍,按延迟、能耗与浮点运算度量。对每月只调用几百次的工作流,差异是四舍五入误差。对持续调用的系统,它是能自负盈亏与不能之间的差别。

在能力上,他们指向如 Phi-2(27 亿参数)在常识推理与代码生成上达到同代 300 亿参数模型可比分数。更小并不自动意味着在给定工作上更弱。

针对任务微调会彻底改变比较

更尖锐的结果是:当小模型专门为你需要的狭窄事项训练时会发生什么。

研究人员在 ToolBench 数据集上微调 facebook/opt-350m(3.5 亿参数模型)用于智能体工具调用,并报告 77.55% 通过率,对比约 1750 亿参数的 ChatGPT 使用思维链提示时的 26.00%。那是小 500 倍的模型,在为其训练的任务上得分大约高三倍。

现在把前一篇关于评估中的纪律用到这个数字上,因为它值得与任何供应商图表一样的审视。

微调模型在 ToolBench 上训练,也在 ToolBench 上度量。它见过该分布。前沿基线是被提示的,不是在该分布上训练的。这对「小型专用模型能否在专用任务上击败大型通用模型」这一问题,已接近现有的最公平比较。它也是一条狭窄主张,应按狭窄主张来读。3.5 亿参数模型并不在总体上胜过前沿模型,论文也没有这么说。

该结果支持的是运营要点。当你能把任务界定得足够紧,从而为其构建训练数据时,在该数据上训练的小模型可以与「被礼貌请求」的大模型竞争,并常常取胜。条件是做完界定工作。

决策规则

问题不是哪个模型最好。而是你的任务是否可规格化。

在以下情况选择小模型: 任务有有界输入与可检查输出,你能凑出几百个标注样例,量足够大以至于单位成本重要,延迟被用户或队列感知,或数据不能离开你的基础设施。文档提取、按书面规则评分线索、工单路由、结构化工具调用与分类都落在这里。

在以下情况选择前沿模型: 输入真正开放,工作需要你无法枚举的知识,量低到每次调用成本可忽略,或你仍在发现任务是什么。早期探索是前沿模型的工作,人将当散文阅读的任何事也是。

在工作干净地拆分时两者都用。 NVIDIA 立场论文因此主张异构系统:把重复的多数路由到小模型,把真正新颖的案例升级到大模型。我们运行的多数生产系统呈这种形态,因为多数负载大多是常规,带一条不是常规的尾巴。

先做大,再凭证据缩小

先选小模型是错误的,因为你无法规格化你还没看任何人执行过的任务。有效的顺序:

  1. 用前沿模型构建。 先把工作流做对,并放到真实输入前。先不要优化任何东西。
  2. 记录每一次调用。 输入、输出与人工修正。这会成为训练集与评估集,若第一天就开始,收集成本为零。
  3. 等到任务停止变化。 仍在修订中的工作流还不适合专用化。微调移动目标会浪费两遍工作。
  4. 构建留出评估。 手工标注真实案例,包括团队有争议的那些,并保留一部分未见。
  5. 在该集合上测试小模型。 若它跨过门槛,成本曲线会按数量级变化。若没有,你只损失几天,却得到了反正需要的评估。

第 5 步失败不是白费。标注集正是告诉你系统在任何模型上是否真的在工作的东西。

小模型不去哪里

有些事值得直说,因为成本论证很诱人。

较小模型通常更难应对与训练内容不同的输入,而生产可靠地会产生那些输入。当提示词规格不足时,它可回退的世界知识更少。在上季度分布上微调的模型会随分布移动而退化,这意味着有人要负责再训练,有人要负责察觉。

节省仍然真实,也仍然有条件。条件与往常一样:你在自己的数据上度量,并持续度量。没人看管的系统,在任何模型规模上都不便宜。

我们如何应用

模型选择放在构建内部,在理解工作流之后。我们 AI 系统目录 中的每个系统都划定为一条有界工作流,并在开发前书面约定成功指标,这正是小模型需要的规格。我们的生产服务费存在是因为度量不止于上线:输出每月对照基线核验,这正是发现专用模型偏离移动任务的方式。

若工作流仍在被发现,我们在前沿模型上构建,并直说。节省以后凭证据可得。

来源

  • Small Language Models are the Future of Agentic AI, Belcak, Heinrich, Diao, Fu, Dong, Muralidharan, Lin and Molchanov: arxiv.org/abs/2506.02153
  • Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning, Jhandi, Kazi, Subramanian and Sendas: arxiv.org/html/2512.15943v2

联系我们

与将要执行这项工作的团队沟通

告诉我们该从哪里看起,我们会在 24 小时内回复,说明我们会从哪里入手。在您看到价值之前不会推销。后续沟通主要使用英语。

Teegan 会通过电子邮件跟进您的咨询。您可随时退订。隐私政策

想先聊一聊?预约 30 分钟通话(英语)。

在 Google 中将我们设为首选来源

这项免费的 Google 设置可让您在自己的搜索体验中看到更多与查询相关的 Strataigize 文章。您可以随时更改。

想让 AI 为您的增长做这件事?

我们为北美运营方搭建 AI 驱动的获客、内容与自动化系统。30 分钟看清杠杆。

预约增长咨询 → 评分 5.0 分,来自 Clutch

了解 AI 自动化服务 →