Vjerojatno ti ne treba fine-tuning
Fine-tuning je često prvi prijedlog kad AI funkcionalnost ne radi dobro. Modelu najčešće nedostaje kontekst, ne sposobnost, a bez eval seta ne znaš ni je li tuning pomogao.

Kad AI funkcionalnost ne radi dobro, fine-tuning je često prvi lijek na stolu. Zvuči kao ozbiljan inženjering: dataset, training run, model koji je "naš". U praksi je često najskuplji način da se ne pogleda zašto funkcionalnost ne radi.
Modelu rijetko nedostaje sposobnost
U slučajevima koje viđam, base model je obično sposoban za zadatak. Ono što mu nedostaje je kontekst. Retrieval vraća krive dokumente, ili prave u krivom redoslijedu. Instrukcije su se skupljale mjesecima i sada si proturječe. Input stiže napola parsiran: loše pročitan PDF, tablica spljoštena u paragraf, polje koje nedostaje. Od modela se traži odgovor na pitanje koje ne vidi dobro.
Ništa od toga se ne rješava promjenom weightsa. Istrenirani model koji dobije isti pokvareni kontekst daje iste krive odgovore, samo s više samopouzdanja i većim računom.
Fine-tuning zamrzava snimku
Fine-tunirani model nauči proces kakav je bio kad je dataset nastao. Proces se mijenja: cjenik, propis, klijent doda iznimku. Istrenirani model ne prati. Svaka značajna promjena znači novi dataset, novi training run i novu validaciju.
Veže te i za određenu verziju base modela. Provideri redovito izdaju nove verzije; tuning napravljen na prethodnoj treba ponoviti ili napustiti, dok poboljšanja na razini prompta prelaze besplatno.
Za tvrtke u regiji koje rade za strane klijente, često po fiksnoj cijeni, to je trošak koji se ponavlja, a u ponudi ga nije bilo.
Bez eval seta nema fine-tuninga
Odlučujući argument je jednostavniji. Bez eval seta — fiksne zbirke stvarnih slučajeva s očekivanim ishodom, koja se pokreće na svaku promjenu — ne možeš znati je li tuning pomogao. Imat ćeš dojam, nekoliko uspješnih demo verzija i trošak.
Ako nemaš eval set, nisi spreman za fine-tuning. Ako ga imaš, prvo ga pokreni protiv boljeg prompta i boljeg retrievala. Često to zatvori većinu razlike, i znat ćeš točno koliko je ostalo.
Kad ima smisla
Fine-tuning zaslužuje mjesto na uskim, stabilnim zadacima s velikim volumenom: fiksni output format, klasifikacija koja se ne mijenja svaki mjesec, posao koji želiš prebaciti na manji i jeftiniji model nakon što je veliki pokazao kako izgleda dobar rezultat. U tim slučajevima to ti kažu evali, brojkama koje si sam izmjerio, a ne dojam iz jednog sastanka ili jedne uspješne demonstracije pred klijentom.
Redoslijed je bitan: prompt, retrieval, eval set, onda — možda — weights.
Koji ste zadnji problem pokušali riješiti fine-tuningom, i što su rekli evali?