
Quando basta un modello di IA più piccolo
I modelli di frontiera hanno un prezzo pensato per le conversazioni aperte, ma gran parte del lavoro di IA in produzione è un compito circoscritto ripetuto migliaia di volte. Per questo tipo di lavoro un modello piccolo spesso basta, e a volte è migliore. I ricercatori di NVIDIA stimano che servire un modello da 7 miliardi di parametri costi da 10 a 30 volte meno di uno da 70-175 miliardi, in latenza, energia e calcolo. A decidere è se il vostro compito è abbastanza ristretto da poter essere specificato e misurato.
Il modo predefinito di costruire una funzione di IA nel 2026 è chiamare il modello più grande disponibile e andare avanti. Funziona, si rilascia in fretta e, per un assistente davvero aperto, è la scelta giusta. Per il caso molto più comune, un sistema che legge un contatto in arrivo o estrae sei campi da una fattura diverse migliaia di volte al giorno, paga in silenzio troppo per capacità che il compito non usa mai.
Il lavoro degli agenti è ripetitivo, e il lavoro ripetitivo è ristretto
Un agente in produzione raramente sostiene una conversazione ad ampio raggio. Classifica, estrae, instrada, chiama uno strumento con argomenti strutturati o sceglie tra una manciata di passi successivi. La stessa forma di prompt gira più e più volte, con contenuti diversi versati dentro.
Un team di NVIDIA ha formalizzato questo argomento in Small Language Models are the Future of Agentic AI, pubblicato per la prima volta a giugno 2025 e rivisto a settembre. La loro definizione operativa di piccolo è un modello che sta su un comune dispositivo di consumo e risponde abbastanza in fretta da essere utile, il che nel 2025 significa più o meno qualsiasi cosa sotto i 10 miliardi di parametri.
La loro tesi economica è quella concreta. Servire un modello da 7 miliardi di parametri costa da 10 a 30 volte meno che servirne uno da 70-175 miliardi, misurato in latenza, consumo energetico e operazioni in virgola mobile. Per un flusso richiamato qualche centinaio di volte al mese la differenza è un errore di arrotondamento. Per uno richiamato di continuo è la differenza tra un sistema che si ripaga e uno che non lo fa.
Sulle capacità, citano modelli come Phi-2, da 2,7 miliardi di parametri, che raggiunge punteggi di ragionamento di senso comune e generazione di codice paragonabili a quelli dei modelli da 30 miliardi di parametri della sua generazione. Più piccolo non significa automaticamente più debole in un compito specifico.
L’addestramento sul compito cambia del tutto il confronto
Il risultato più netto è ciò che succede quando un modello piccolo viene addestrato specificamente sulla cosa ristretta che vi serve.
Alcuni ricercatori hanno addestrato facebook/opt-350m, un modello da 350 milioni di parametri, sul dataset ToolBench per le chiamate a strumenti da parte di agenti e hanno riportato un tasso di superamento del 77,55%, contro il 26,00% di ChatGPT con prompting a catena di ragionamento, con circa 175 miliardi di parametri. È un modello 500 volte più piccolo che ottiene un punteggio circa tre volte più alto sul compito per cui è stato addestrato.
Applicate ora a quel numero la disciplina dell’articolo precedente sulla valutazione, perché merita lo stesso scrutinio di qualsiasi grafico di un fornitore.
Il modello addestrato è stato allenato su ToolBench e misurato su ToolBench. Conosce la distribuzione. I modelli di frontiera di riferimento sono stati istruiti con prompt, non addestrati, su quella distribuzione. È vicino al confronto più equo disponibile per la domanda “un modello piccolo specializzato può battere uno grande e generico in un compito specializzato”. È anche un’affermazione ristretta, e va letta come tale. Un modello da 350 milioni di parametri non supera in generale un modello di frontiera, e nulla nell’articolo lo afferma.
Ciò che il risultato sostiene è il punto operativo. Quando riuscite a definire il compito in modo abbastanza preciso da costruire dati di addestramento, un modello piccolo addestrato su quei dati compete con un modello grande a cui si chiede con cortesia, e spesso lo batte. La condizione è fare il lavoro di definizione.
La regola decisionale
La domanda non è quale modello sia il migliore. È se il vostro compito sia specificabile.
Scegliete un modello piccolo quando il compito ha un input circoscritto e un output verificabile, potete mettere insieme qualche centinaio di esempi etichettati, il volume è abbastanza alto da rendere rilevante il costo unitario, la latenza è percepita da un utente o da una coda, o i dati non possono uscire dalla vostra infrastruttura. Estrazione di documenti, punteggio dei contatti secondo regole scritte, instradamento dei ticket, chiamate a strumenti strutturate e classificazione stanno tutti qui.
Scegliete un modello di frontiera quando l’input è davvero aperto, il lavoro richiede conoscenze che non potete elencare, il volume è così basso che il costo per chiamata è rumore, o state ancora scoprendo quale sia il compito. L’esplorazione iniziale è un lavoro da modello di frontiera, come tutto ciò che una persona leggerà come prosa.
Usateli entrambi quando il lavoro si divide in modo netto. Il documento di posizione di NVIDIA sostiene i sistemi eterogenei proprio per questo: instradare la maggioranza ripetitiva verso un modello piccolo e passare i casi davvero nuovi a uno grande. La maggior parte dei sistemi in produzione che gestiamo ha questa forma, perché la maggior parte dei carichi di lavoro è per lo più routine, con una coda che non lo è.
Partite grandi, poi riducete sulla base delle prove
Scegliere prima il modello piccolo è un errore, perché non potete specificare un compito che non avete mai visto svolgere. La sequenza che funziona:
- Costruitelo con un modello di frontiera. Rendete corretto il flusso e mettetelo davanti a input reali. Non ottimizzate ancora nulla.
- Registrate ogni chiamata. Input, output e correzioni umane. Diventeranno il set di addestramento e quello di valutazione, e raccoglierli non costa nulla se iniziate dal primo giorno.
- Aspettate che il compito smetta di cambiare. Un flusso ancora in revisione non è pronto per essere specializzato. Addestrare su un bersaglio in movimento spreca il lavoro due volte.
- Costruite la valutazione tenuta da parte. Etichettate a mano casi reali, compresi quelli su cui il vostro team discute, e tenetene una parte mai vista.
- Testate un modello piccolo su quel set. Se supera la soglia, la curva dei costi cambia di un ordine di grandezza. Se non la supera, avete perso qualche giorno e guadagnato una valutazione che vi serviva comunque.
Il fallimento del passo 5 non è un esercizio sprecato. Il set etichettato è ciò che vi dice se il sistema funziona, con qualsiasi modello.
Dove il modello piccolo non va
Vale la pena dire alcune cose con chiarezza, perché l’argomento dei costi è seducente.
Un modello più piccolo in genere gestisce peggio input diversi da tutto ciò su cui è stato addestrato, e la produzione genera questi input con regolarità. Ha meno conoscenza del mondo a cui ricorrere quando il prompt è poco specificato. E un modello addestrato sulla distribuzione dello scorso trimestre peggiora man mano che la distribuzione si sposta, il che significa che qualcuno è responsabile del riaddestramento e qualcuno di accorgersene.
I risparmi restano reali, e restano condizionati. La condizione è la stessa di sempre: li misurate sui vostri dati e continuate a misurarli. Un sistema che nessuno osserva non è economico con nessuna dimensione di modello.
Come lo applichiamo
La scelta del modello avviene all’interno dello sviluppo, dopo aver compreso il flusso. Ogni sistema del nostro catalogo di sistemi IA è definito come un unico flusso circoscritto con una metrica di successo scritta e concordata prima dello sviluppo, che è esattamente la specifica di cui un modello piccolo ha bisogno. Il nostro contratto di produzione esiste perché la misurazione non si ferma al lancio: gli output vengono verificati ogni mese rispetto a valori di riferimento, ed è ciò che individua un modello specializzato che si allontana da un compito in movimento.
Se il flusso è ancora in fase di scoperta, lo costruiamo su un modello di frontiera e lo diciamo. I risparmi arrivano dopo, sulla base delle prove.
Fonti
- Small Language Models are the Future of Agentic AI, Belcak, Heinrich, Diao, Fu, Dong, Muralidharan, Lin e Molchanov: arxiv.org/abs/2506.02153
- Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning, Jhandi, Kazi, Subramanian e Sendas: arxiv.org/html/2512.15943v2
Parla con noi