LLM locali in azienda, quando hanno senso e quando no
Modelli linguistici sul proprio server: riservatezza e costi prevedibili, ma non sempre. Criteri per decidere, dimensionare e misurare la qualità.
Fino a pochi anni fa usare un modello linguistico significava, quasi sempre, inviare i propri dati a un servizio esterno. Oggi esistono modelli open weight (i cui parametri si possono scaricare ed eseguire liberamente) abbastanza capaci da svolgere compiti aziendali reali su un server di proprietà, senza che un solo documento esca dall’azienda.
È una possibilità concreta, non solo da laboratorio. Ma la domanda giusta non è “si può fare?”. È “conviene, per questo processo specifico?”. Questo articolo prova a rispondere con criteri pratici.
Prima di tutto: cosa vuoi fargli fare?
La scelta tra modello locale e servizio esterno dipende quasi interamente dal compito. Nelle aziende i casi d’uso si dividono, grosso modo, in due famiglie.
Compiti circoscritti e ripetitivi. Estrarre campi da fatture o documenti di trasporto, classificare email e richieste di assistenza, riassumere verbali, normalizzare anagrafiche, rispondere a domande sulla documentazione interna. Hanno input simili, output prevedibili e si ripetono migliaia di volte.
Compiti aperti e complessi. Scrivere testi lunghi e articolati, ragionare su problemi in più passaggi, analizzare documenti molto diversi tra loro, generare codice, fare da assistente generalista.
Per la prima famiglia, un modello di dimensioni medie eseguito in locale è spesso sufficiente, a volte persino migliore se adattato bene al compito. Per la seconda, i modelli più grandi disponibili via API fanno ancora una differenza di qualità evidente.
Quando un modello locale ha senso
I dati non devono uscire
Contratti, dati sanitari, informazioni sui dipendenti, segreti industriali, dati di clienti soggetti a vincoli contrattuali. Usare un servizio esterno è possibile anche in questi casi, con le dovute garanzie contrattuali e di trattamento, ma richiede valutazioni legali, accordi con il fornitore e attenzione a dove vengono elaborati i dati. Un modello eseguito sulla propria infrastruttura elimina il problema alla radice: i dati restano dove sono già.
I volumi sono alti e prevedibili
I servizi via API si pagano a consumo, in proporzione al testo elaborato. Per un uso saltuario è la formula più conveniente. Ma se ogni mese si classificano decine di migliaia di documenti, la spesa ricorrente può superare in fretta il costo di un server dedicato, che invece è fisso e si ammortizza.
Serve controllo sul comportamento
Un modello locale non cambia senza preavviso. Con un servizio esterno il fornitore può aggiornare o ritirare un modello, e un processo che funzionava bene può iniziare a comportarsi in modo diverso. In locale si decide quando aggiornare, dopo averlo testato.
La latenza o la connettività contano
Per elaborazioni dentro un impianto, un magazzino o una rete isolata, non dipendere da una connessione esterna può essere un requisito, non una preferenza.
Quando è meglio un servizio esterno
- Compiti complessi dove la qualità del modello più grande disponibile fa la differenza.
- Uso saltuario o sperimentale, che non giustifica hardware dedicato.
- Assenza di competenze per gestire un servizio in più: aggiornamenti, monitoraggio, sicurezza, backup.
- Picchi imprevedibili di carico, che un servizio esterno assorbe e un singolo server no.
Spesso la risposta migliore è ibrida: un modello locale per i compiti ripetitivi e sensibili, un servizio esterno per i casi difficili e per i dati che possono uscire. L’importante è che la scelta sia fatta caso per caso, con una regola chiara su quali dati vanno dove.
Cosa serve per eseguirlo
La memoria della scheda grafica
Il fattore che pesa di più è la memoria della GPU (VRAM). Il modello deve starci per intero, insieme allo spazio per il testo che sta elaborando. Due concetti aiutano a orientarsi:
- Dimensione del modello, espressa in miliardi di parametri (7B, 14B, 70B…). Più è grande, più è capace, ma più memoria richiede.
- Quantizzazione, cioè la compressione dei parametri a meno bit. Con una quantizzazione a 4 bit, la memoria necessaria si riduce di circa quattro volte rispetto alla precisione piena, con una perdita di qualità spesso contenuta.
Come ordine di grandezza, un modello da 7-8 miliardi di parametri quantizzato a 4 bit sta in una scheda con 8-12 GB di memoria; un modello da 70 miliardi richiede decine di GB, quindi schede professionali o più schede insieme. Sono indicazioni di massima: la memoria necessaria dipende anche dalla lunghezza dei testi e dal numero di richieste contemporanee.
Il software di esecuzione
Esistono motori collaudati per servire i modelli: alcuni più semplici da installare e adatti a un uso interno con pochi utenti, altri ottimizzati per gestire molte richieste in parallelo. Quasi tutti espongono un’interfaccia compatibile con quelle dei servizi commerciali, così le applicazioni possono passare da un modello esterno a uno locale con modifiche minime.
Il resto dell’infrastruttura
Un modello in produzione è un servizio come gli altri. Ha bisogno di accessi controllati, di log, di monitoraggio (tempi di risposta, errori, uso della memoria), di backup della configurazione e di una procedura per aggiornare il modello. Trattarlo come un esperimento sulla scrivania di qualcuno è il modo più rapido per farlo fallire.
Come confrontare i costi
Anche qui il confronto va fatto sui numeri reali, non sulle impressioni.
Servizio esterno: stima del volume mensile (documenti × lunghezza media) × prezzo per unità di testo del modello scelto. Va aggiunto un margine per le richieste ripetute, i test e la crescita.
Modello locale:
- hardware (server e GPU) ammortizzato sul periodo di utilizzo, di solito tre anni;
- energia elettrica, che con le GPU non è trascurabile;
- tempo di gestione: installazione, aggiornamenti, monitoraggio;
- costo di sviluppo e messa a punto, che però si sostiene anche con un servizio esterno.
Il punto di pareggio dipende dal volume. Sotto una certa soglia vince il servizio esterno; sopra, il server dedicato diventa più conveniente ogni mese che passa. Calcolare quella soglia per il proprio caso richiede un’ora con un foglio di calcolo, ed evita decisioni prese sull’onda dell’entusiasmo.
Il punto che si dimentica: misurare la qualità
Qualunque sia il modello, prima di metterlo in produzione serve rispondere a una domanda: quanto spesso sbaglia, e cosa succede quando sbaglia?
Il metodo che consiglio è semplice e funziona:
- Raccogli un campione reale. Cento-duecento casi veri del processo: email, documenti, richieste, inclusi quelli difficili e anomali.
- Definisci la risposta giusta per ciascuno, con chi conosce il processo.
- Misura. Fai elaborare il campione al modello e conta le risposte corrette, quelle parzialmente corrette e gli errori.
- Confronta. Ripeti con modelli diversi, locali ed esterni, e con istruzioni diverse. Spesso un modello piccolo con istruzioni curate batte un modello grande usato male.
- Decidi le soglie. Quale percentuale di errore è accettabile? Quali casi devono sempre passare da una persona?
Questo campione diventa anche lo strumento per gli aggiornamenti futuri: prima di cambiare modello, si rifà la misura sugli stessi casi.
Progettare il processo, non solo il modello
Il valore di un’automazione con l’AI non sta nel modello: sta nel processo costruito attorno. Alcuni principi che considero irrinunciabili:
- Output strutturati. Al modello si chiedono dati in un formato preciso, che il software può controllare, non testo libero da interpretare.
- Validazione a valle. Una partita IVA ha un formato verificabile, una data deve essere plausibile, un totale deve tornare con le righe. I controlli automatici intercettano molti errori prima che facciano danni.
- Persona nel ciclo, dove serve. I casi incerti o ad alto impatto passano da una persona, che approva o corregge. Le correzioni diventano nuovi esempi per migliorare il sistema.
- Tracciabilità. Per ogni elaborazione resta traccia di input, output, modello usato ed eventuale revisione umana.
Una griglia per decidere
| Domanda | Locale | Esterno |
|---|---|---|
| I dati sono riservati o vincolati? | ✔ | con garanzie contrattuali |
| Il compito è circoscritto e ripetitivo? | ✔ | ✔ |
| Il compito è complesso e aperto? | possibile, con limiti | ✔ |
| I volumi sono alti e costanti? | ✔ | costo crescente |
| L’uso è saltuario o sperimentale? | sovradimensionato | ✔ |
| Ci sono competenze per gestire un servizio in più? | necessarie | non necessarie |
Un modello locale non è una scelta ideologica, né una moda da inseguire. È uno strumento che, per alcuni processi, offre insieme riservatezza, costi prevedibili e controllo. Per altri no. Saperli distinguere, con un campione di prova e un foglio di calcolo, vale più di qualsiasi demo.
storia di questo articolo
- Stesura completa, con dimensionamento, confronto dei costi e metodo di valutazione.

