Probabilmente non ti serve il fine-tuning
Il fine-tuning è spesso il primo rimedio proposto quando una funzione AI rende poco. Quasi sempre al modello manca contesto, non capacità, e senza un set di eval non sai nemmeno se il tuning ha aiutato.

Quando una funzione AI rende poco, il fine-tuning è spesso il primo rimedio sul tavolo. Sembra ingegneria seria: un dataset, un addestramento, un modello "nostro". Nella pratica è spesso il modo più costoso per non guardare perché la funzione rende poco.
Al modello raramente manca capacità
Nei casi che vedo, il modello di base è di solito in grado di fare il lavoro. Quello che gli manca è contesto. Il retrieval restituisce i documenti sbagliati, o quelli giusti nell'ordine sbagliato. Le istruzioni si sono accumulate per mesi e ora si contraddicono. L'input arriva letto a metà: un PDF estratto male, una tabella appiattita in un paragrafo, un campo mancante. Al modello si chiede di rispondere a una domanda che non vede bene.
Niente di questo si sistema cambiando i pesi. Un modello addestrato che riceve lo stesso contesto rotto produce le stesse risposte sbagliate, solo con più sicurezza e una fattura più alta.
Il fine-tuning congela una fotografia
Un modello addestrato impara il processo com'era quando è stato costruito il dataset. Il processo invece si muove: cambia il listino, cambia una norma, il cliente aggiunge un'eccezione. Il modello addestrato non segue. Ogni modifica significativa è un nuovo dataset, un nuovo addestramento, una nuova validazione.
Ti lega anche a una versione specifica del modello base. I fornitori rilasciano versioni nuove con regolarità; un tuning costruito sulla precedente va rifatto o abbandonato, mentre i miglioramenti fatti a livello di prompt si portano dietro gratis.
Per una software house .NET che lavora a prezzo fisso è un costo ricorrente che nel preventivo non c'era. E con l'AI Act modificare un modello porta domande di documentazione che una modifica al prompt non porta.
Senza eval set, niente fine-tuning
L'argomento decisivo è più semplice. Senza un set di eval — una raccolta fissa di casi reali con l'esito atteso, eseguita a ogni modifica — non puoi sapere se il tuning ha aiutato. Avrai un'impressione, qualche demo riuscita e un costo.
Se non hai un set di eval, non sei pronto per il fine-tuning. Se ce l'hai, provalo prima contro prompt migliori e retrieval migliore. Spesso chiude gran parte del divario, e saprai esattamente quanto ne resta.
Quando ha senso
Il fine-tuning si guadagna il posto su compiti stretti, stabili e ad alto volume: un formato di output fisso, una classificazione che non cambia ogni mese, un lavoro da spostare su un modello più piccolo ed economico dopo che quello grande ha mostrato com'è il risultato buono. In quei casi te lo dicono le eval, con numeri misurati da te.
L'ordine conta: prompt, retrieval, set di eval, poi — forse — i pesi.
Qual è l'ultimo problema che avete provato a risolvere col fine-tuning, e cosa dicevano le eval?