Canonical: https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/
Description: 多数智能体工作是同一狭窄任务的重复。在这种工作形态上，小型微调模型往往胜过前沿模型，且成本只是零头。
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← 博客](https://www.strataigize.com/zh-Hans/insights/)

![](https://www.strataigize.com/blog/real/cover-when-a-smaller-ai-model-will-do.webp)

# 何时较小的 AI 模型就够用

作者 [**Eric Hedlin**](https://www.strataigize.com/zh-Hans/about/team/eric/), 首席 AI 科学家 · 发布于 2026年9月13日 · 1 分钟阅读

前沿模型按开放式对话定价，但多数生产级 AI 工作是同一有界任务重复成千上万次。在这种工作形态上，小模型常常够用，有时更好。NVIDIA 研究人员指出，服务 70 亿参数模型在延迟、能耗与算力上比服务 700 亿至 1750 亿参数模型便宜 10 至 30 倍。决定因素是你的任务是否窄到足以界定与度量。

本文目录

1.  [智能体工作是重复的，重复工作是狭窄的](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E6%99%BA%E8%83%BD%E4%BD%93%E5%B7%A5%E4%BD%9C%E6%98%AF%E9%87%8D%E5%A4%8D%E7%9A%84%E9%87%8D%E5%A4%8D%E5%B7%A5%E4%BD%9C%E6%98%AF%E7%8B%AD%E7%AA%84%E7%9A%84)
2.  [针对任务微调会彻底改变比较](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E9%92%88%E5%AF%B9%E4%BB%BB%E5%8A%A1%E5%BE%AE%E8%B0%83%E4%BC%9A%E5%BD%BB%E5%BA%95%E6%94%B9%E5%8F%98%E6%AF%94%E8%BE%83)
3.  [决策规则](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E5%86%B3%E7%AD%96%E8%A7%84%E5%88%99)
4.  [先做大，再凭证据缩小](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E5%85%88%E5%81%9A%E5%A4%A7%E5%86%8D%E5%87%AD%E8%AF%81%E6%8D%AE%E7%BC%A9%E5%B0%8F)
5.  [小模型不去哪里](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E5%B0%8F%E6%A8%A1%E5%9E%8B%E4%B8%8D%E5%8E%BB%E5%93%AA%E9%87%8C)
6.  [我们如何应用](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E6%88%91%E4%BB%AC%E5%A6%82%E4%BD%95%E5%BA%94%E7%94%A8)
7.  [来源](https://www.strataigize.com/zh-Hans/insights/when-a-smaller-ai-model-will-do/#%E6%9D%A5%E6%BA%90)

[在 Google 中将我们设为首选来源](https://www.google.com/preferences/source?q=strataigize.com)

这项免费的 Google 设置可让您在自己的搜索体验中看到更多与查询相关的 Strataigize 文章。您可以随时更改。

2026 年构建 AI 功能的默认做法是调用最大可用模型然后继续。它能用、出货快，对真正开放式助手也是正确选择。对更常见的情况（每天几千次阅读入站线索或从发票提取六个字段的系统），它在默默为任务从不使用的能力多付钱。

## 智能体工作是重复的，重复工作是狭窄的

生产中的智能体很少在进行宽泛对话。它分类、提取、路由、用结构化参数调用工具，或在少数下一步之间做决定。同一提示词形态一遍遍运行，只是倒入不同内容。

NVIDIA 的一个团队在 [Small Language Models are the Future of Agentic AI](https://arxiv.org/abs/2506.02153) 中正式提出这一论点，初稿于 2025 年 6 月发布，同年 9 月修订。他们对「小」的工作定义是：能装进常见消费设备、回答够快以有用的模型；按 2025 年标准，大致指 100 亿参数以下的任何模型。

其经济主张是具体的。服务 70 亿参数模型比服务 700 亿至 1750 亿参数模型便宜 **10 至 30 倍**，按延迟、能耗与浮点运算度量。对每月只调用几百次的工作流，差异是四舍五入误差。对持续调用的系统，它是能自负盈亏与不能之间的差别。

在能力上，他们指向如 Phi-2（27 亿参数）在常识推理与代码生成上达到同代 300 亿参数模型可比分数。更小并不自动意味着在给定工作上更弱。

## 针对任务微调会彻底改变比较

更尖锐的结果是：当小模型专门为你需要的狭窄事项训练时会发生什么。

研究人员在 ToolBench 数据集上微调 **facebook/opt-350m**（3.5 亿参数模型）用于智能体工具调用，并[报告 77.55% 通过率](https://arxiv.org/html/2512.15943v2)，对比约 1750 亿参数的 ChatGPT 使用思维链提示时的 26.00%。那是小 500 倍的模型，在为其训练的任务上得分大约高三倍。

现在把[前一篇关于评估](https://www.strataigize.com/zh-Hans/insights/what-an-ai-evaluation-actually-measures/)中的纪律用到这个数字上，因为它值得与任何供应商图表一样的审视。

微调模型在 ToolBench 上训练，也在 ToolBench 上度量。它见过该分布。前沿基线是被提示的，不是在该分布上训练的。这对「小型专用模型能否在专用任务上击败大型通用模型」这一问题，已接近现有的最公平比较。它也是一条狭窄主张，应按狭窄主张来读。3.5 亿参数模型并不在总体上胜过前沿模型，论文也没有这么说。

该结果支持的是运营要点。当你能把任务界定得足够紧，从而为其构建训练数据时，在该数据上训练的小模型可以与「被礼貌请求」的大模型竞争，并常常取胜。条件是做完界定工作。

## 决策规则

问题不是哪个模型最好。而是你的任务是否可规格化。

**在以下情况选择小模型：** 任务有有界输入与可检查输出，你能凑出几百个标注样例，量足够大以至于单位成本重要，延迟被用户或队列感知，或数据不能离开你的基础设施。文档提取、按书面规则评分线索、工单路由、结构化工具调用与分类都落在这里。

**在以下情况选择前沿模型：** 输入真正开放，工作需要你无法枚举的知识，量低到每次调用成本可忽略，或你仍在发现任务是什么。早期探索是前沿模型的工作，人将当散文阅读的任何事也是。

**在工作干净地拆分时两者都用。** NVIDIA 立场论文因此主张异构系统：把重复的多数路由到小模型，把真正新颖的案例升级到大模型。我们运行的多数生产系统呈这种形态，因为多数负载大多是常规，带一条不是常规的尾巴。

## 先做大，再凭证据缩小

先选小模型是错误的，因为你无法规格化你还没看任何人执行过的任务。有效的顺序：

1.  **用前沿模型构建。** 先把工作流做对，并放到真实输入前。先不要优化任何东西。
2.  **记录每一次调用。** 输入、输出与人工修正。这会成为训练集与评估集，若第一天就开始，收集成本为零。
3.  **等到任务停止变化。** 仍在修订中的工作流还不适合专用化。微调移动目标会浪费两遍工作。
4.  **构建留出评估。** 手工标注真实案例，包括团队有争议的那些，并保留一部分未见。
5.  **在该集合上测试小模型。** 若它跨过门槛，成本曲线会按数量级变化。若没有，你只损失几天，却得到了反正需要的评估。

第 5 步失败不是白费。标注集正是告诉你系统在任何模型上是否真的在工作的东西。

## 小模型不去哪里

有些事值得直说，因为成本论证很诱人。

较小模型通常更难应对与训练内容不同的输入，而生产可靠地会产生那些输入。当提示词规格不足时，它可回退的世界知识更少。在上季度分布上微调的模型会随分布移动而退化，这意味着有人要负责再训练，有人要负责察觉。

节省仍然真实，也仍然有条件。条件与往常一样：你在自己的数据上度量，并持续度量。没人看管的系统，在任何模型规模上都不便宜。

## 我们如何应用

模型选择放在构建内部，在理解工作流之后。我们 [AI 系统目录](https://www.strataigize.com/zh-Hans/services/ai-systems/) 中的每个系统都划定为一条有界工作流，并在开发前书面约定成功指标，这正是小模型需要的规格。我们的[生产服务费](https://www.strataigize.com/zh-Hans/offers/production-retainer/)存在是因为度量不止于上线：输出每月对照基线核验，这正是发现专用模型偏离移动任务的方式。

若工作流仍在被发现，我们在前沿模型上构建，并直说。节省以后凭证据可得。

## 来源

-   Small Language Models are the Future of Agentic AI, Belcak, Heinrich, Diao, Fu, Dong, Muralidharan, Lin and Molchanov: [arxiv.org/abs/2506.02153](https://arxiv.org/abs/2506.02153)
-   Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning, Jhandi, Kazi, Subramanian and Sendas: [arxiv.org/html/2512.15943v2](https://arxiv.org/html/2512.15943v2)

作者

**Eric Hedlin**

下一步

六个问题，一个瓶颈。增长诊断对照漏斗每一阶段，给出最先回本的修复。

[运行诊断 →](https://www.strataigize.com/zh-Hans/tools/growth-diagnostic/)

联系我们

### 与将要执行这项工作的团队沟通

告诉我们该从哪里看起，我们会在 24 小时内回复，说明我们会从哪里入手。在您看到价值之前不会推销。后续沟通主要使用英语。

[在 Google 中将我们设为首选来源](https://www.google.com/preferences/source?q=strataigize.com)

这项免费的 Google 设置可让您在自己的搜索体验中看到更多与查询相关的 Strataigize 文章。您可以随时更改。

## 相关阅读

[全部AI 与自动化文章 →](https://www.strataigize.com/zh-Hans/insights/topics/ai-automation/)

[AI 助手现在能向你的业务购买吗？AI 助手今天能调研你。它还不能诚实地结账一个 $25,000 的试点。在重建结账之前，先发布价格、范围和日历。](https://www.strataigize.com/zh-Hans/insights/can-an-ai-assistant-buy-from-you/)[能扛住采购的 AI Agent 试点如何构建能通过安全审阅的 AI agent 试点：有边界工作流、书面成功指标、约定终止阈值，以及数据处理。](https://www.strataigize.com/zh-Hans/insights/ai-agent-pilot-that-survives-procurement/)[构建还是购买 AI Agents：2026 决策规则2026 年构建还是购买 AI agents：决策规则、真实成本结构，以及为什么外部构建的成功率约为内部的两倍。](https://www.strataigize.com/zh-Hans/insights/build-vs-buy-ai-agents/)

## 想让 AI 为您的增长做这件事？

我们为北美运营方搭建 AI 驱动的获客、内容与自动化系统。30 分钟看清杠杆。

[预约增长咨询 →](https://www.strataigize.com/zh-Hans/audit/) [评分 **5.0** 分，来自 Clutch](https://clutch.co/profile/strataigize-marketing)

[了解 AI 自动化服务 →](https://www.strataigize.com/zh-Hans/services/ai-automation-services/)
