Canonical: https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/
Description: 에이전트 작업 대부분은 좁은 작업 하나의 반복입니다. 이런 작업에서는 파인튜닝한 소형 모델이 프런티어 모델을 훨씬 낮은 비용으로 이기는 경우가 많습니다.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← 블로그](https://www.strataigize.com/ko/insights/)

![](https://www.strataigize.com/blog/real/cover-when-a-smaller-ai-model-will-do.webp)

# 더 작은 AI 모델로 충분할 때

저자 [**Eric Hedlin**](https://www.strataigize.com/ko/about/team/eric/), 최고 AI 과학자 · 게시 2026년 9월 13일 · 4 분 읽기

프런티어 모델은 열린 대화를 기준으로 가격이 매겨지지만, 운영 환경의 AI 작업 대부분은 범위가 정해진 작업 하나를 수천 번 반복하는 일입니다. 이런 작업에는 소형 모델로 충분한 경우가 많고, 때로는 더 낫습니다. NVIDIA 연구진은 70억 파라미터 모델을 서비스하는 비용이 700억~1,750억 파라미터 모델보다 지연 시간, 에너지, 연산량 면에서 10~30배 저렴하다고 봅니다. 결정 요인은 작업이 명세하고 측정할 수 있을 만큼 좁은가입니다.

이 글의 내용

1.  [에이전트 작업은 반복적이고, 반복 작업은 좁습니다](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%EC%97%90%EC%9D%B4%EC%A0%84%ED%8A%B8-%EC%9E%91%EC%97%85%EC%9D%80-%EB%B0%98%EB%B3%B5%EC%A0%81%EC%9D%B4%EA%B3%A0-%EB%B0%98%EB%B3%B5-%EC%9E%91%EC%97%85%EC%9D%80-%EC%A2%81%EC%8A%B5%EB%8B%88%EB%8B%A4)
2.  [작업에 맞춘 파인튜닝은 비교를 완전히 바꿉니다](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%EC%9E%91%EC%97%85%EC%97%90-%EB%A7%9E%EC%B6%98-%ED%8C%8C%EC%9D%B8%ED%8A%9C%EB%8B%9D%EC%9D%80-%EB%B9%84%EA%B5%90%EB%A5%BC-%EC%99%84%EC%A0%84%ED%9E%88-%EB%B0%94%EA%BF%89%EB%8B%88%EB%8B%A4)
3.  [판단 기준](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%ED%8C%90%EB%8B%A8-%EA%B8%B0%EC%A4%80)
4.  [크게 시작하고, 증거에 따라 줄이기](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%ED%81%AC%EA%B2%8C-%EC%8B%9C%EC%9E%91%ED%95%98%EA%B3%A0-%EC%A6%9D%EA%B1%B0%EC%97%90-%EB%94%B0%EB%9D%BC-%EC%A4%84%EC%9D%B4%EA%B8%B0)
5.  [소형 모델이 가지 말아야 할 곳](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%EC%86%8C%ED%98%95-%EB%AA%A8%EB%8D%B8%EC%9D%B4-%EA%B0%80%EC%A7%80-%EB%A7%90%EC%95%84%EC%95%BC-%ED%95%A0-%EA%B3%B3)
6.  [저희가 적용하는 방식](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%EC%A0%80%ED%9D%AC%EA%B0%80-%EC%A0%81%EC%9A%A9%ED%95%98%EB%8A%94-%EB%B0%A9%EC%8B%9D)
7.  [출처](https://www.strataigize.com/ko/insights/when-a-smaller-ai-model-will-do/#%EC%B6%9C%EC%B2%98)

[Google에서 선호 소스로 추가](https://www.google.com/preferences/source?q=strataigize.com)

관련 Strataigize 기사를 검색 경험에 더 많이 보이게 하는 무료 Google 설정입니다. 언제든 변경할 수 있습니다.

2026년에 AI 기능을 만드는 기본 방식은 쓸 수 있는 가장 큰 모델을 호출하고 넘어가는 것입니다. 잘 작동하고, 빨리 출시할 수 있으며, 정말로 열린 형태의 어시스턴트라면 올바른 선택입니다. 하지만 훨씬 흔한 경우, 즉 유입된 리드를 읽거나 청구서에서 항목 여섯 개를 뽑아내는 일을 하루에 수천 번 하는 시스템이라면, 작업이 한 번도 쓰지 않는 능력에 조용히 과한 돈을 내고 있습니다.

## 에이전트 작업은 반복적이고, 반복 작업은 좁습니다

운영 중인 에이전트가 폭넓은 대화를 나누는 일은 드뭅니다. 분류하고, 추출하고, 라우팅하고, 구조화된 인수로 도구를 호출하거나, 몇 가지 다음 단계 중 하나를 고릅니다. 같은 형태의 프롬프트가 내용만 바뀐 채 계속 반복해서 실행됩니다.

NVIDIA의 한 팀은 이 주장을 [Small Language Models are the Future of Agentic AI](https://arxiv.org/abs/2506.02153)에서 공식적으로 제시했습니다. 2025년 6월에 처음 게시되었고 같은 해 9월에 개정되었습니다. 이들이 실무적으로 정의하는 소형이란 일반 소비자 기기에 들어가고 쓸모 있을 만큼 빠르게 응답하는 모델로, 2025년 기준으로는 대략 100억 파라미터 미만의 모든 모델을 뜻합니다.

구체적인 것은 경제성 주장입니다. 70억 파라미터 모델을 서비스하는 비용은 700억1,750억 파라미터 모델보다 지연 시간, 에너지 소비, 부동소수점 연산으로 측정했을 때 \*\*1030배 저렴\*\*합니다. 한 달에 수백 번 호출되는 워크플로라면 이 차이는 반올림 오차에 불과합니다. 끊임없이 호출되는 워크플로라면 본전을 뽑는 시스템과 그렇지 못한 시스템의 차이가 됩니다.

능력 면에서는 27억 파라미터의 Phi-2 같은 모델이 같은 세대의 300억 파라미터 모델에 견줄 만한 상식 추론과 코드 생성 점수를 낸다는 점을 들었습니다. 특정 작업에서 작다는 것이 자동으로 약하다는 뜻은 아닙니다.

## 작업에 맞춘 파인튜닝은 비교를 완전히 바꿉니다

더 선명한 결과는 필요한 좁은 작업에 맞춰 소형 모델을 특별히 훈련했을 때 나타납니다.

연구진은 3억 5,000만 파라미터 모델인 **facebook/opt-350m**을 에이전트 도구 호출용 ToolBench 데이터셋으로 파인튜닝해 [77.55%의 통과율을 보고했습니다](https://arxiv.org/html/2512.15943v2). 약 1,750억 파라미터에 사고의 사슬(chain-of-thought) 프롬프팅을 쓴 ChatGPT는 26.00%였습니다. 500배 작은 모델이 자신이 훈련된 작업에서 약 세 배 높은 점수를 낸 것입니다.

이제 [평가에 관한 이전 글](https://www.strataigize.com/ko/insights/what-an-ai-evaluation-actually-measures/)의 원칙을 이 숫자에 적용해 보세요. 어떤 업체의 차트와도 똑같은 검증을 받을 만하기 때문입니다.

파인튜닝한 모델은 ToolBench로 훈련되고 ToolBench로 측정되었습니다. 이미 분포를 본 것입니다. 비교 대상인 프런티어 모델들은 그 분포에서 프롬프트만 받았을 뿐 훈련되지 않았습니다. 이는 “특화된 소형 모델이 특화된 작업에서 대형 범용 모델을 이길 수 있는가”라는 질문에 대해 얻을 수 있는 가장 공정한 비교에 가깝습니다. 동시에 좁은 주장이기도 하므로 그렇게 읽어야 합니다. 3억 5,000만 파라미터 모델이 프런티어 모델을 전반적으로 능가하는 것은 아니며, 논문 어디에도 그렇게 쓰여 있지 않습니다.

이 결과가 뒷받침하는 것은 운영상의 요점입니다. 훈련 데이터를 만들 수 있을 만큼 작업을 엄밀하게 정의할 수 있다면, 그 데이터로 훈련한 소형 모델은 정중하게 부탁받은 대형 모델과 경쟁하고, 자주 이깁니다. 조건은 정의 작업을 해내는 것입니다.

## 판단 기준

질문은 어떤 모델이 가장 좋은가가 아닙니다. 작업을 명세할 수 있는가입니다.

**소형 모델을 고를 때는** 작업의 입력이 제한되고 출력을 검증할 수 있을 때, 라벨이 붙은 예시를 수백 개 모을 수 있을 때, 단위 비용이 중요할 만큼 물량이 많을 때, 사용자나 대기열이 지연 시간을 체감할 때, 또는 데이터가 자사 인프라 밖으로 나갈 수 없을 때입니다. 문서 추출, 문서화된 규칙에 따른 리드 점수화, 티켓 라우팅, 구조화된 도구 호출, 분류가 모두 여기에 속합니다.

**프런티어 모델을 고를 때는** 입력이 정말로 열려 있을 때, 작업에 열거할 수 없는 지식이 필요할 때, 호출당 비용이 잡음일 만큼 물량이 적을 때, 또는 작업이 무엇인지 아직 알아가는 중일 때입니다. 초기 탐색은 프런티어 모델의 일이고, 사람이 글로 읽을 모든 것도 마찬가지입니다.

**둘 다 쓸 때는** 작업이 깔끔하게 나뉠 때입니다. NVIDIA의 입장 논문은 바로 이 이유로 이종 시스템을 주장합니다. 반복적인 대다수는 소형 모델로 보내고, 정말 새로운 경우만 대형 모델로 올리는 것입니다. 저희가 운영하는 운영 시스템 대부분이 이런 형태인데, 대부분의 워크로드는 거의 일상적인 작업이고 그렇지 않은 꼬리가 조금 있기 때문입니다.

## 크게 시작하고, 증거에 따라 줄이기

처음부터 소형 모델을 고르는 것은 실수입니다. 누군가 수행하는 모습을 본 적 없는 작업은 명세할 수 없기 때문입니다. 효과가 있는 순서는 이렇습니다.

1.  **프런티어 모델로 구축하세요.** 워크플로를 올바르게 만들고 실제 입력 앞에 두세요. 아직 아무것도 최적화하지 마세요.
2.  **모든 호출을 기록하세요.** 입력, 출력, 사람의 수정 사항입니다. 이것이 훈련 세트와 평가 세트가 되며, 첫날부터 시작하면 수집 비용이 들지 않습니다.
3.  **작업이 더 이상 바뀌지 않을 때까지 기다리세요.** 아직 수정 중인 워크플로는 특화할 준비가 되지 않았습니다. 움직이는 목표에 맞춰 파인튜닝하면 작업을 두 번 낭비합니다.
4.  **따로 떼어 둔 평가 세트를 만드세요.** 팀 안에서 의견이 갈리는 사례까지 포함해 실제 사례에 직접 라벨을 붙이고, 일부는 보지 않은 채 남겨 두세요.
5.  **그 세트로 소형 모델을 테스트하세요.** 기준을 넘으면 비용 곡선이 한 자릿수 단위로 바뀝니다. 넘지 못하면 며칠을 잃는 대신 어차피 필요했던 평가 세트를 얻습니다.

5단계에서 실패해도 헛수고가 아닙니다. 라벨이 붙은 세트야말로 어떤 모델이든 시스템이 제대로 작동하는지 알려 주는 것입니다.

## 소형 모델이 가지 말아야 할 곳

비용 논리가 매력적이기 때문에 몇 가지는 분명히 말해 둘 가치가 있습니다.

소형 모델은 대개 훈련된 것과 전혀 다른 입력을 잘 다루지 못하고, 운영 환경은 그런 입력을 어김없이 만들어 냅니다. 프롬프트가 불충분하게 명세되었을 때 기댈 세계 지식도 적습니다. 그리고 지난 분기의 분포로 파인튜닝한 모델은 분포가 옮겨 가면서 성능이 떨어집니다. 즉, 재훈련을 맡는 사람과 그것을 알아차리는 사람이 있어야 합니다.

절감 효과는 여전히 실재하고, 여전히 조건부입니다. 조건은 언제나 같습니다. 자사 데이터로 측정하고 계속 측정하는 것입니다. 아무도 지켜보지 않는 시스템은 어떤 모델 크기에서도 저렴하지 않습니다.

## 저희가 적용하는 방식

모델 선택은 워크플로를 이해한 뒤 구축 과정 안에서 이뤄집니다. 저희 [AI 시스템 카탈로그](https://www.strataigize.com/ko/services/ai-systems/)의 모든 시스템은 개발 전에 합의한 서면 성공 지표를 갖춘, 범위가 한정된 워크플로 하나로 설계되며, 이것이 바로 소형 모델에 필요한 명세입니다. [운영 리테이너](https://www.strataigize.com/ko/offers/production-retainer/)가 있는 이유는 측정이 출시에서 멈추지 않기 때문입니다. 출력은 매달 기준값과 대조해 검증되며, 그것이 움직이는 작업에서 멀어지는 특화 모델을 잡아냅니다.

워크플로를 아직 찾아가는 중이라면 프런티어 모델로 구축하고 그렇다고 밝힙니다. 절감은 나중에, 증거를 바탕으로 얻을 수 있습니다.

## 출처

-   Small Language Models are the Future of Agentic AI, Belcak, Heinrich, Diao, Fu, Dong, Muralidharan, Lin, Molchanov: [arxiv.org/abs/2506.02153](https://arxiv.org/abs/2506.02153)
-   Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning, Jhandi, Kazi, Subramanian, Sendas: [arxiv.org/html/2512.15943v2](https://arxiv.org/html/2512.15943v2)

저자

**Eric Hedlin**

다음 단계

성장이 어디서 새고 있습니까? Growth Diagnostic가 6가지 질문으로 퍼널을 진단합니다.

[진단 실행 →](https://www.strataigize.com/tools/growth-diagnostic/)

문의하기

### 실제로 운영할 팀과 이야기하기

어디를 봐야 할지 알려주시면 24시간 안에 출발점을 답합니다. 가치를 보기 전에는 영업 제안이 없습니다.

[Google에서 선호 소스로 추가](https://www.google.com/preferences/source?q=strataigize.com)

관련 Strataigize 기사를 검색 경험에 더 많이 보이게 하는 무료 Google 설정입니다. 언제든 변경할 수 있습니다.

## 관련 글

[AI 및 자동화 전체 글 →](https://www.strataigize.com/ko/insights/topics/ai-automation/)

[서비스 기업을 위한 AI 자동화: 어디서 시작할까기존 도구를 바꾸지 않고 문의 접수, 후속 연락, 보고를 자동화하세요. 첫 워크플로를 고르는 방법과 그 효과를 측정하는 방법을 알려 드립니다.](https://www.strataigize.com/ko/insights/ai-automation-for-service-businesses/)[Gemini 이미지 프롬프트: 사진 스타일, 편집, 화면비사진 스타일의 Gemini 이미지 프롬프트 예시와 화면비, 편집, 일관성 기법을 Google 공식 문서로 확인해 정리했습니다.](https://www.strataigize.com/ko/insights/gemini-image-prompts/)[복사해서 바로 쓰는 멋진 이미지용 ChatGPT 프롬프트멋진 이미지를 만드는 복사용 ChatGPT 프롬프트: 3D 로고, 영화 같은 인물 사진, 그라데이션, 제품 목업까지, 2026년 GPT Image에 맞춰 업데이트했습니다.](https://www.strataigize.com/ko/insights/chatgpt-prompts-for-stunning-visuals/)

## 저희가 대신 해드릴까요?

무료 30분 상담을 예약하세요.

[성장 상담 예약 →](https://www.strataigize.com/ko/audit/) [평가 **5.0** (Clutch)](https://clutch.co/profile/strataigize-marketing)
