Na školeních AI padá stále častěji otázka: „Nemůžeme si AI provozovat u sebe, aby nám data neodcházela?" Odpověď je: můžete, dělám to sám a je to dnes jednodušší, než si lidé myslí. Ale zároveň to pro většinu firem není náhrada za ChatGPT, Claude nebo Gemini, aspoň zatím ne. V tomhle článku vysvětlím bez technického žargonu, co lokální modely jsou, jak číst jejich parametry, co potřebujete za hardware, kde dnes reálně pomáhají a kde byste se spálili.
Otevřený model je AI model, jehož „váhy" (naučené parametry) si můžete stáhnout a spustit na vlastním hardwaru, typicky přes nástroje jako Ollama nebo LM Studio. Běží lokálně znamená, že dotazy ani dokumenty neopouštějí váš počítač nebo server, což je silný argument u citlivých dat a GDPR. Otevřené modely kolem 30 miliard parametrů (například Qwen3-30B-A3B) jsou dobré na sumarizace, interní asistenty nad firemními dokumenty a klasifikaci. Pro většinu firem ale zatím nejsou náhradou cloudových modelů: u složitých úloh zaostávají v kvalitě, potřebují hardware, údržbu a bezpečné nasazení. Dávají smysl u citlivých dat, offline provozu a velkých objemů jednoduchých úloh; jinde je rozumnější firemní tarif cloudové služby.
Co je otevřený model a čím se liší od ChatGPT
Když píšete do ChatGPT, Claude nebo Gemini, váš text jde na servery provozovatele, tam ho zpracuje model, o kterém víte jen to, co vám provozovatel řekne, a vrátí se odpověď. Model je uzavřený, nemůžete si ho stáhnout, prohlédnout ani provozovat jinde.
Otevřený model (přesněji „model s otevřenými váhami") je jiný v jedné zásadní věci: jeho naučené parametry jsou zveřejněné ke stažení, obvykle na platformě Hugging Face, pod licencí, která říká, co s ním smíte dělat. Některé mají licenci Apache 2.0, která umožňuje i komerční použití prakticky bez omezení (například řada Qwen3 od Alibaby); jiné, jako Llama od Meta, mají vlastní licenci s podmínkami, které si musíte přečíst. Otevřené modely vydávají i Mistral, Google (Gemma), DeepSeek a další; nabídka se mění každý měsíc.
Důležité: „otevřený" neznamená „horší". Znamená, že model můžete provozovat sami, se vším, co z toho plyne.
Co znamená „běží lokálně"
Model si stáhnete (jde o soubory o velikosti jednotek až desítek gigabajtů) a spustíte na vlastním hardwaru: notebooku, pracovní stanici nebo firemním serveru. Od té chvíle:
- žádná data neodcházejí, dotazy, dokumenty ani odpovědi neopouštějí váš stroj,
- neplatíte za tokeny, platíte za hardware a elektřinu,
- funguje bez internetu,
- vy jste odpovědní za provoz, aktualizace, zabezpečení i za to, že model neodpovídá nesmysly.
Nejobvyklejší cesta pro jednotlivce a malé týmy jsou nástroje Ollama (příkazová řádka plus lokální rozhraní, běží na macOS, Windows i Linuxu) a LM Studio (grafická aplikace s katalogem modelů). Oba stáhnou model, spustí ho a nabídnou rozhraní, ke kterému se připojí chat nebo vaše aplikace. Pro firemní nasazení s víc uživateli pak existují serverové nástroje, ale to už je práce pro někoho, kdo servery spravuje.
Jak číst velikost modelu: parametry a kvantizace
Parametry jsou naučená čísla uvnitř modelu; jejich počet se udává v miliardách (7B, 30B, 70B). Zjednodušeně: víc parametrů, chytřejší model, ale větší nároky na paměť a pomalejší odpovědi.
Kvantizace je komprese: parametry se uloží s menší přesností (například na 4 bity místo 16), model se tím zmenší několikanásobně a mírně ztratí na kvalitě. Právě díky kvantizaci se model o desítkách miliard parametrů vejde do běžného počítače.
Hrubá pomůcka na výpočet paměti: při běžné 4bitové kvantizaci počítejte zhruba s půl až šesti desetinami gigabajtu paměti na každou miliardu parametrů, plus rezervu na kontext (délku textu, se kterým model pracuje). Model kolem 30 miliard parametrů tedy chce zhruba 18-20 GB volné paměti grafické karty nebo sjednocené paměti; 7-8B model se vejde do 5-6 GB. Přesné nároky se liší podle modelu a nastavení, vždy je ověřte v popisu konkrétního modelu.
Ještě jedna zkratka, kterou uvidíte: MoE („mixture of experts") a označení jako „30B-A3B". Model má celkem 30 miliard parametrů, ale na každý krok jich použije jen asi 3 miliardy. Do paměti se musí vejít celý, ale počítá jen s částí, takže je na běžném hardwaru výrazně rychlejší než stejně velký „hustý" model. Přesně tak je postavený například Qwen3-30B-A3B (30,5 mld. parametrů celkem, 3,3 mld. aktivních, licence Apache 2.0), který umí přepínat mezi „přemýšlecím" režimem pro složitější úlohy a rychlým režimem pro běžný dialog.
Jaký hardware potřebujete
Řádově, pro orientaci:
- Malé modely (do ~8B): dnešní notebook s 16 GB paměti. Hodí se na klasifikaci, jednoduché sumarizace, doplňování textu.
- Střední modely (~14-32B): grafická karta s 16-24 GB paměti, nebo Mac se sjednocenou pamětí 32 GB a víc. Tady začíná užitečná kvalita pro interní asistenty a delší dokumenty.
- Velké modely (70B a víc): víc grafických karet nebo server, investice v řádu vyšších desítek až stovek tisíc korun a někdo, kdo se o to stará.
Praktická rada: začněte tím, co máte. Stáhněte Ollama nebo LM Studio, zkuste malý model, pak střední, a zjistíte, jestli vám kvalita pro daný úkol stačí, dřív než utratíte korunu za hardware.
Kde lokální modely dnes reálně pomáhají
Otevřené modely kolem 30 miliard parametrů (například Qwen3-30B-A3B a srovnatelné modely od dalších vydavatelů) jsou z mé zkušenosti dobré na:
- Sumarizace a extrakce, shrnout dokument, vytáhnout údaje ze smlouvy, sestavit zápis z přepisu.
- Interní asistent nad firemními dokumenty, odpovídat na otázky z interních směrnic, manuálů, historie zakázek, aniž by dokumenty opustily firmu.
- Klasifikace a třídění, rozřazovat poptávky, tikety, recenze; označovat sentiment; předzpracovat data pro další systém.
- Anonymizace, před odesláním do cloudového modelu odstranit osobní údaje lokálně.
- Objemové jednoduché úlohy, tisíce krátkých operací denně, kde by cloudový účet rostl a kvalita malého modelu stačí.
Kde byste se spálili, a proč zatím nejsou náhradou cloudu
Tohle je část, kterou lidé neradi slyší, ale musíte ji vědět dřív, než nakoupíte servery:
- Kvalita u složitých úloh. Dlouhé uvažování, náročná analýza, kvalitní psaní, složitý kód: špičkové cloudové modely jsou stále znatelně dál. Lokální model, který v demu vypadá skvěle na shrnutí odstavce, začne u složitějšího zadání dělat chyby, které nepoznáte, dokud je nezkontrolujete.
- Údržba. Modely, nástroje i knihovny se mění každý měsíc. Někdo musí aktualizovat, testovat, hlídat, že po aktualizaci model odpovídá stejně dobře.
- Hardware a náklady. Grafické karty stárnou, elektřina se platí, server musí někde běžet. Cloudový firemní tarif za pár desítek uživatelů často vyjde levněji než jeden slušný server plus lidská práce.
- Bezpečnost nasazení. „Data neodcházejí" platí jen tehdy, když je server dobře zabezpečený. Špatně nasazený lokální model přístupný z internetu je horší než dobrý cloudový poskytovatel se smlouvou o zpracování dat.
- Chování modelu. Otevřené modely mají různá bezpečnostní nastavení a různé sklony k halucinacím; nikdo za vás nehlídá, co model uživatelům říká.
Proto moje doporučení pro většinu firem zní: cloudový model s firemním tarifem a smluvně ošetřeným zpracováním dat jako základ, lokální model jako doplněk pro citlivé úlohy, offline scénáře a objemové jednoduché operace. Kdo začíná od lokálního modelu, protože „je to zadarmo a bezpečné", většinou skončí s drahým serverem a průměrnou kvalitou.
GDPR úhel
Lokální provoz má z pohledu GDPR jednu velkou výhodu: osobní údaje neopouštějí firmu, takže nepotřebujete zpracovatelskou smlouvu s poskytovatelem modelu a odpadá otázka přenosu dat mimo EU. Zůstává ale všechno ostatní: musíte mít právní titul ke zpracování, informovat subjekty údajů, zabezpečit server, řídit přístupy a řešit výmaz. Lokální model neřeší GDPR, řeší jednu jeho část. Pokud AI nasazujete na osobní údaje, doporučuji přečíst si i článek o AI Actu pro české firmy, kde jsou povinnosti kolem AI systémů v praxi.
Jak zjistit, jestli je vaše firma potřebuje
Odpovězte si na čtyři otázky:
- Pracujeme s daty, která nesmějí opustit firmu, zdravotní, právní, finanční, obchodní tajemství, a nestačí nám smluvní záruky cloudového poskytovatele?
- Potřebujeme AI tam, kde není spolehlivý internet (výroba, terén, uzavřené sítě)?
- Máme velký objem jednoduchých úloh, kde by cloudový účet rostl do desetitisíců měsíčně a kvalita menšího modelu stačí?
- Máme, kdo se o to postará, interně nebo externě?
Dvě a víc „ano" znamená, že má smysl lokální model vyzkoušet, nejdřív na notebooku, na jednom konkrétním úkolu, s porovnáním kvality proti cloudovému modelu. Jedno nebo žádné „ano" znamená, že jste na tom líp s cloudem a dobře nastavenými pravidly použití.
Přesně tohle porovnání, kdy cloud, kdy lokální, jak vyzkoušet a jak nastavit pravidla pro tým, dělám na firemním školení AI. A kdo si to chce nejdřív osahat sám, začne na otevřeném kurzu, kde si lokální model spustíte naživo.
Shrnutí
- Otevřený model = stažitelné váhy pod licencí; lokální provoz = data neopouštějí váš hardware, platíte hardwarem a vlastní odpovědností.
- Velikost čtěte přes parametry a kvantizaci: 4bitový model potřebuje zhruba půl až šest desetin GB paměti na miliardu parametrů; MoE modely (např. 30B-A3B) jsou rychlejší na běžném hardwaru.
- Ollama a LM Studio jsou obvyklá cesta pro jednotlivce a malé týmy; začněte na tom, co máte.
- Modely kolem 30B jsou dnes dobré na sumarizace, interní asistenty, klasifikaci, anonymizaci a objemové jednoduché úlohy.
- Pro většinu firem zatím nejsou náhradou cloudových modelů kvůli kvalitě u složitých úloh, údržbě, hardwaru a bezpečnosti nasazení, jsou doplňkem pro citlivá data, offline provoz a objem.
- Lokální provoz řeší část GDPR (data neodcházejí), ne celé GDPR.
Nejčastější otázky
Je lokální model zadarmo?
Licence bývá zdarma i pro komerční použití (u Apache 2.0 ano, u jiných licencí si přečtěte podmínky). Platíte ale hardwarem, elektřinou a hlavně časem někoho, kdo model nasadí, aktualizuje a hlídá. Pro malý tým vyjde cloudový firemní tarif často levněji.
Jaký nejmenší počítač stačí na vyzkoušení?
Běžný notebook s 16 GB paměti zvládne malé modely (do zhruba 8 miliard parametrů). Na modely kolem 30 miliard parametrů chcete grafickou kartu s 16-24 GB paměti nebo počítač se sjednocenou pamětí 32 GB a víc. Přesné nároky ověřte u konkrétního modelu.
Můžu lokální model napojit na firemní dokumenty?
Ano, to je jeden z nejužitečnějších scénářů: interní asistent, který odpovídá z vašich směrnic, manuálů a historie zakázek, aniž by dokumenty opustily firmu. Vyžaduje to ale správné nastavení vyhledávání v dokumentech a kontrolu kvality odpovědí, není to jen „nahrát a hotovo".
Nahradí lokální modely ChatGPT a Claude?
Zatím ne. U složitých úloh jsou špičkové cloudové modely znatelně dál a lokální nasazení vyžaduje údržbu a hardware. Rozumné je kombinovat: cloud s firemním tarifem jako základ, lokální model pro citlivá data, offline provoz a objemové jednoduché úlohy.
Zdroje a odkazy
- Qwen3-30B-A3B na Hugging Face, 30,5 mld. parametrů celkem, 3,3 mld. aktivních, Apache 2.0, přemýšlecí a rychlý režim
- Ollama, lokální spouštění otevřených modelů na macOS, Windows a Linuxu
- LM Studio, grafická aplikace pro stažení a spuštění lokálních modelů
- Nařízení GDPR (EU) 2016/679, zpracování osobních údajů
