Nové jazykové modely vycházejí každých pár měsíců a každý je prezentován jako nejlepší. Pro produktový tým je užitečná jiná otázka: který model spolehlivě vyřeší náš úkol za cenu a rychlost, které si můžeme dovolit, aniž by porušil naše pravidla ochrany dat?
Začněte úkolem, ne žebříčkem
Veřejné žebříčky měří obecné schopnosti. Váš produkt potřebuje něco užšího: třídit požadavky, vytahovat pole z dokumentů, odpovídat určitým tónem, psát kód nebo uvažovat nad dlouhými texty. Sesbírejte padesát až sto skutečných příkladů s očekávanými odpověďmi a otestujte na nich několik modelů. Rozdíly na vašich datech se často výrazně liší od veřejných testů.
Spočítejte cenu jednoho dotazu
Cena závisí na objemu odeslaného a přijatého textu. Model o něco lepší, ale pětkrát dražší, se může vyplatit jen pro malou část složitých dotazů. Častým vzorem je směrování: rychlý a levný model obslouží jednoduché případy a jen ty složité jdou silnějšímu modelu.
Ověřte rychlost a limity
U chatu nebo rozhraní, kde uživatel čeká, je doba odpovědi stejně důležitá jako kvalita. U zpracování na pozadí jsou důležitější propustnost a limity dotazů. Otestujte obojí pod realistickou zátěží, než se rozhodnete.
Rozhodněte, kam smějí data
Některá data nesmějí opustit vaši infrastrukturu ani určitý region: osobní údaje, smlouvy, zdravotní či finanční informace. Pak zvažte poskytovatele s vhodnými podmínkami zpracování dat nebo otevřené modely spustitelné na vlastních serverech. Rozhodněte se brzy - často to zúží výběr víc než jakýkoli test.
Vyhněte se závislosti
Modely se rychle mění. Udržujte v kódu tenkou vrstvu mezi produktem a poskytovatelem, ukládejte prompty a testovací sady zvlášť a budete moci modely vyměnit nebo kombinovat, až se objeví lepší možnost.
Ve zkratce
Vybírejte model tak, že ho otestujete na vlastních příkladech, spočítáte skutečnou cenu dotazu, ověříte rychlost pod zátěží a dodržíte pravidla pro práci s daty. Navrhněte systém tak, aby šel model vyměnit.