Canonical: https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/
Description: Il lavoro degli agenti è quasi sempre un compito ristretto ripetuto. Lì un piccolo modello su misura batte spesso uno di frontiera, a un costo minimo.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← Blog](https://www.strataigize.com/it/insights/)

![](https://www.strataigize.com/blog/real/cover-when-a-smaller-ai-model-will-do.webp)

# Quando basta un modello di IA più piccolo

Di [**Eric Hedlin**](https://www.strataigize.com/it/about/team/eric/), Capo scienziato IA · Pubblicato 13 settembre 2026 · 6 min di lettura

I modelli di frontiera hanno un prezzo pensato per le conversazioni aperte, ma gran parte del lavoro di IA in produzione è un compito circoscritto ripetuto migliaia di volte. Per questo tipo di lavoro un modello piccolo spesso basta, e a volte è migliore. I ricercatori di NVIDIA stimano che servire un modello da 7 miliardi di parametri costi da 10 a 30 volte meno di uno da 70-175 miliardi, in latenza, energia e calcolo. A decidere è se il vostro compito è abbastanza ristretto da poter essere specificato e misurato.

In questo articolo

1.  [Il lavoro degli agenti è ripetitivo, e il lavoro ripetitivo è ristretto](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#il-lavoro-degli-agenti-%C3%A8-ripetitivo-e-il-lavoro-ripetitivo-%C3%A8-ristretto)
2.  [L’addestramento sul compito cambia del tutto il confronto](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#laddestramento-sul-compito-cambia-del-tutto-il-confronto)
3.  [La regola decisionale](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#la-regola-decisionale)
4.  [Partite grandi, poi riducete sulla base delle prove](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#partite-grandi-poi-riducete-sulla-base-delle-prove)
5.  [Dove il modello piccolo non va](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#dove-il-modello-piccolo-non-va)
6.  [Come lo applichiamo](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#come-lo-applichiamo)
7.  [Fonti](https://www.strataigize.com/it/insights/when-a-smaller-ai-model-will-do/#fonti)

[Aggiungerci come fonte preferita su Google](https://www.google.com/preferences/source?q=strataigize.com)

Un'impostazione gratuita di Google per vedere più dei nostri articoli rilevanti nelle sue ricerche. Può modificarla in qualsiasi momento.

Il modo predefinito di costruire una funzione di IA nel 2026 è chiamare il modello più grande disponibile e andare avanti. Funziona, si rilascia in fretta e, per un assistente davvero aperto, è la scelta giusta. Per il caso molto più comune, un sistema che legge un contatto in arrivo o estrae sei campi da una fattura diverse migliaia di volte al giorno, paga in silenzio troppo per capacità che il compito non usa mai.

## Il lavoro degli agenti è ripetitivo, e il lavoro ripetitivo è ristretto

Un agente in produzione raramente sostiene una conversazione ad ampio raggio. Classifica, estrae, instrada, chiama uno strumento con argomenti strutturati o sceglie tra una manciata di passi successivi. La stessa forma di prompt gira più e più volte, con contenuti diversi versati dentro.

Un team di NVIDIA ha formalizzato questo argomento in [Small Language Models are the Future of Agentic AI](https://arxiv.org/abs/2506.02153), pubblicato per la prima volta a giugno 2025 e rivisto a settembre. La loro definizione operativa di piccolo è un modello che sta su un comune dispositivo di consumo e risponde abbastanza in fretta da essere utile, il che nel 2025 significa più o meno qualsiasi cosa sotto i 10 miliardi di parametri.

La loro tesi economica è quella concreta. Servire un modello da 7 miliardi di parametri costa **da 10 a 30 volte meno** che servirne uno da 70-175 miliardi, misurato in latenza, consumo energetico e operazioni in virgola mobile. Per un flusso richiamato qualche centinaio di volte al mese la differenza è un errore di arrotondamento. Per uno richiamato di continuo è la differenza tra un sistema che si ripaga e uno che non lo fa.

Sulle capacità, citano modelli come Phi-2, da 2,7 miliardi di parametri, che raggiunge punteggi di ragionamento di senso comune e generazione di codice paragonabili a quelli dei modelli da 30 miliardi di parametri della sua generazione. Più piccolo non significa automaticamente più debole in un compito specifico.

## L’addestramento sul compito cambia del tutto il confronto

Il risultato più netto è ciò che succede quando un modello piccolo viene addestrato specificamente sulla cosa ristretta che vi serve.

Alcuni ricercatori hanno addestrato **facebook/opt-350m**, un modello da 350 milioni di parametri, sul dataset ToolBench per le chiamate a strumenti da parte di agenti e [hanno riportato un tasso di superamento del 77,55%](https://arxiv.org/html/2512.15943v2), contro il 26,00% di ChatGPT con prompting a catena di ragionamento, con circa 175 miliardi di parametri. È un modello 500 volte più piccolo che ottiene un punteggio circa tre volte più alto sul compito per cui è stato addestrato.

Applicate ora a quel numero la disciplina dell’[articolo precedente sulla valutazione](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/), perché merita lo stesso scrutinio di qualsiasi grafico di un fornitore.

Il modello addestrato è stato allenato su ToolBench e misurato su ToolBench. Conosce la distribuzione. I modelli di frontiera di riferimento sono stati istruiti con prompt, non addestrati, su quella distribuzione. È vicino al confronto più equo disponibile per la domanda “un modello piccolo specializzato può battere uno grande e generico in un compito specializzato”. È anche un’affermazione ristretta, e va letta come tale. Un modello da 350 milioni di parametri non supera in generale un modello di frontiera, e nulla nell’articolo lo afferma.

Ciò che il risultato sostiene è il punto operativo. Quando riuscite a definire il compito in modo abbastanza preciso da costruire dati di addestramento, un modello piccolo addestrato su quei dati compete con un modello grande a cui si chiede con cortesia, e spesso lo batte. La condizione è fare il lavoro di definizione.

## La regola decisionale

La domanda non è quale modello sia il migliore. È se il vostro compito sia specificabile.

**Scegliete un modello piccolo quando** il compito ha un input circoscritto e un output verificabile, potete mettere insieme qualche centinaio di esempi etichettati, il volume è abbastanza alto da rendere rilevante il costo unitario, la latenza è percepita da un utente o da una coda, o i dati non possono uscire dalla vostra infrastruttura. Estrazione di documenti, punteggio dei contatti secondo regole scritte, instradamento dei ticket, chiamate a strumenti strutturate e classificazione stanno tutti qui.

**Scegliete un modello di frontiera quando** l’input è davvero aperto, il lavoro richiede conoscenze che non potete elencare, il volume è così basso che il costo per chiamata è rumore, o state ancora scoprendo quale sia il compito. L’esplorazione iniziale è un lavoro da modello di frontiera, come tutto ciò che una persona leggerà come prosa.

**Usateli entrambi quando** il lavoro si divide in modo netto. Il documento di posizione di NVIDIA sostiene i sistemi eterogenei proprio per questo: instradare la maggioranza ripetitiva verso un modello piccolo e passare i casi davvero nuovi a uno grande. La maggior parte dei sistemi in produzione che gestiamo ha questa forma, perché la maggior parte dei carichi di lavoro è per lo più routine, con una coda che non lo è.

## Partite grandi, poi riducete sulla base delle prove

Scegliere prima il modello piccolo è un errore, perché non potete specificare un compito che non avete mai visto svolgere. La sequenza che funziona:

1.  **Costruitelo con un modello di frontiera.** Rendete corretto il flusso e mettetelo davanti a input reali. Non ottimizzate ancora nulla.
2.  **Registrate ogni chiamata.** Input, output e correzioni umane. Diventeranno il set di addestramento e quello di valutazione, e raccoglierli non costa nulla se iniziate dal primo giorno.
3.  **Aspettate che il compito smetta di cambiare.** Un flusso ancora in revisione non è pronto per essere specializzato. Addestrare su un bersaglio in movimento spreca il lavoro due volte.
4.  **Costruite la valutazione tenuta da parte.** Etichettate a mano casi reali, compresi quelli su cui il vostro team discute, e tenetene una parte mai vista.
5.  **Testate un modello piccolo su quel set.** Se supera la soglia, la curva dei costi cambia di un ordine di grandezza. Se non la supera, avete perso qualche giorno e guadagnato una valutazione che vi serviva comunque.

Il fallimento del passo 5 non è un esercizio sprecato. Il set etichettato è ciò che vi dice se il sistema funziona, con qualsiasi modello.

## Dove il modello piccolo non va

Vale la pena dire alcune cose con chiarezza, perché l’argomento dei costi è seducente.

Un modello più piccolo in genere gestisce peggio input diversi da tutto ciò su cui è stato addestrato, e la produzione genera questi input con regolarità. Ha meno conoscenza del mondo a cui ricorrere quando il prompt è poco specificato. E un modello addestrato sulla distribuzione dello scorso trimestre peggiora man mano che la distribuzione si sposta, il che significa che qualcuno è responsabile del riaddestramento e qualcuno di accorgersene.

I risparmi restano reali, e restano condizionati. La condizione è la stessa di sempre: li misurate sui vostri dati e continuate a misurarli. Un sistema che nessuno osserva non è economico con nessuna dimensione di modello.

## Come lo applichiamo

La scelta del modello avviene all’interno dello sviluppo, dopo aver compreso il flusso. Ogni sistema del nostro [catalogo di sistemi IA](https://www.strataigize.com/it/services/ai-systems/) è definito come un unico flusso circoscritto con una metrica di successo scritta e concordata prima dello sviluppo, che è esattamente la specifica di cui un modello piccolo ha bisogno. Il nostro [contratto di produzione](https://www.strataigize.com/it/offers/production-retainer/) esiste perché la misurazione non si ferma al lancio: gli output vengono verificati ogni mese rispetto a valori di riferimento, ed è ciò che individua un modello specializzato che si allontana da un compito in movimento.

Se il flusso è ancora in fase di scoperta, lo costruiamo su un modello di frontiera e lo diciamo. I risparmi arrivano dopo, sulla base delle prove.

## Fonti

-   Small Language Models are the Future of Agentic AI, Belcak, Heinrich, Diao, Fu, Dong, Muralidharan, Lin e Molchanov: [arxiv.org/abs/2506.02153](https://arxiv.org/abs/2506.02153)
-   Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning, Jhandi, Kazi, Subramanian e Sendas: [arxiv.org/html/2512.15943v2](https://arxiv.org/html/2512.15943v2)

Autore

**Eric Hedlin**

Prossimo passo

Dove perde il tuo funnel? Il Growth Diagnostic lo confronta in sei domande.

[Esegui il diagnostic →](https://www.strataigize.com/tools/growth-diagnostic/)

Parla con noi

### Parli con il team che lo gestirebbe

Ci dica dove guardare e rispondiamo entro 24 ore con il punto di partenza. Nessuna proposta finché non vede il valore.

[Aggiungerci come fonte preferita su Google](https://www.google.com/preferences/source?q=strataigize.com)

Un'impostazione gratuita di Google per vedere più dei nostri articoli rilevanti nelle sue ricerche. Può modificarla in qualsiasi momento.

## Letture correlate

[Tutti gli articoli su IA e automazione →](https://www.strataigize.com/it/insights/topics/ai-automation/)

[Un assistente IA può già comprare dalla vostra azienda?Un assistente IA oggi può informarsi su di voi, ma non chiudere onestamente un pilota da 25 000 USD. Pubblicate prezzo, perimetro e calendario prima.](https://www.strataigize.com/it/insights/can-an-ai-assistant-buy-from-you/)[Il pilota di agenti IA che supera il procurementCome strutturare un pilota di agenti IA che superi la revisione di sicurezza: workflow delimitato, metrica scritta, soglia di stop, gestione dei dati.](https://www.strataigize.com/it/insights/ai-agent-pilot-that-survives-procurement/)[Sviluppare o comprare agenti IA: una regola per il 2026Sviluppare o comprare agenti IA nel 2026: la regola decisionale, la vera struttura dei costi e perché i progetti esterni riescono il doppio degli interni.](https://www.strataigize.com/it/insights/build-vs-buy-ai-agents/)

## Vuoi che lo facciamo per te?

Prenota una consulenza gratuita di 30 minuti. Nessun pitch finche non vedi il valore.

[Prenota una consulenza di crescita →](https://www.strataigize.com/it/audit/) [Valutazione **5,0** su Clutch](https://clutch.co/profile/strataigize-marketing)
