Na školeních AI padá stále častěji otázka: „Nemůžeme si AI provozovat u sebe, aby nám data neodcházela?" Odpověď je: můžete, dělám to sám a je to dnes jednodušší, než si lidé myslí. Ale zároveň to pro většinu firem není náhrada za ChatGPT, Claude nebo Gemini – aspoň zatím ne. V tomhle článku vysvětlím bez technického žargonu, co lokální modely jsou, jak číst jejich parametry, co potřebujete za hardware, kde dnes reálně pomáhají a kde byste se spálili.
Otevřený model je AI model, jehož „váhy" (naučené parametry) si můžete stáhnout a spustit na vlastním hardwaru – typicky přes nástroje jako Ollama nebo LM Studio. Běží lokálně znamená, že dotazy ani dokumenty neopouštějí váš počítač nebo server, což je silný argument u citlivých dat a GDPR. Aktuální otevřené modely kolem 30 miliard parametrů (například řada Qwen3) jsou dobré na sumarizace, interní asistenty nad firemními dokumenty a klasifikaci. Pro většinu firem ale zatím nejsou náhradou cloudových modelů: u složitých úloh zaostávají v kvalitě, potřebují hardware, údržbu a bezpečné nasazení. Dávají smysl u citlivých dat, offline provozu a velkých objemů jednoduchých úloh; jinde je rozumnější firemní tarif cloudové služby.
Co je otevřený model a čím se liší od ChatGPT
Když píšete do ChatGPT, Claude nebo Gemini, váš text jde na servery provozovatele, tam ho zpracuje model, o kterém víte jen to, co vám provozovatel řekne, a vrátí se odpověď. Model je uzavřený – nemůžete si ho stáhnout, prohlédnout ani provozovat jinde.
Otevřený model (přesněji „model s otevřenými váhami") je jiný v jedné zásadní věci: jeho naučené parametry jsou zveřejněné ke stažení, obvykle na platformě Hugging Face, pod licencí, která říká, co s ním smíte dělat. Některé mají licenci Apache 2.0, která umožňuje i komerční použití prakticky bez omezení (například řada Qwen3 od Alibaby); jiné, jako Llama od Meta, mají vlastní licenci s podmínkami, které si musíte přečíst. Otevřené modely vydávají i Mistral, Google (Gemma), DeepSeek a další; nabídka se mění každý měsíc.
Důležité: „otevřený" neznamená „horší". Znamená, že model můžete provozovat sami – se vším, co z toho plyne.
Co znamená „běží lokálně"
Model si stáhnete (jde o soubory o velikosti jednotek až desítek gigabajtů) a spustíte na vlastním hardwaru: notebooku, pracovní stanici nebo firemním serveru. Od té chvíle:
- žádná data neodcházejí – dotazy, dokumenty ani odpovědi neopouštějí váš stroj,
- neplatíte za tokeny – platíte za hardware a elektřinu,
- funguje bez internetu,
- vy jste odpovědní za provoz, aktualizace, zabezpečení i za to, že model neodpovídá nesmysly.
Nejobvyklejší cesta pro jednotlivce a malé týmy jsou nástroje Ollama (příkazová řádka plus lokální rozhraní, běží na macOS, Windows i Linuxu) a LM Studio (grafická aplikace s katalogem modelů). Oba stáhnou model, spustí ho a nabídnou rozhraní, ke kterému se připojí chat nebo vaše aplikace. Pro firemní nasazení s víc uživateli pak existují serverové nástroje, ale to už je práce pro někoho, kdo servery spravuje.
Jak číst velikost modelu: parametry a kvantizace
Parametry jsou naučená čísla uvnitř modelu; jejich počet se udává v miliardách (7B, 30B, 70B). Zjednodušeně: víc parametrů, chytřejší model, ale větší nároky na paměť a pomalejší odpovědi.
Kvantizace je komprese: parametry se uloží s menší přesností (například na 4 bity místo 16), model se tím zmenší několikanásobně a mírně ztratí na kvalitě. Právě díky kvantizaci se model o desítkách miliard parametrů vejde do běžného počítače.
Hrubá pomůcka na výpočet paměti: při běžné 4bitové kvantizaci počítejte zhruba s půl až šesti desetinami gigabajtu paměti na každou miliardu parametrů, plus rezervu na kontext (délku textu, se kterým model pracuje). Model kolem 30 miliard parametrů tedy chce zhruba 18–20 GB volné paměti grafické karty nebo sjednocené paměti; 7–8B model se vejde do 5–6 GB. Přesné nároky se liší podle modelu a nastavení – vždy je ověřte v popisu konkrétního modelu.
Ještě jedna zkratka, kterou uvidíte: MoE („mixture of experts") a označení jako „30B-A3B". Model má celkem 30 miliard parametrů, ale na každý krok jich použije jen asi 3 miliardy. Do paměti se musí vejít celý, ale počítá jen s částí – takže je na běžném hardwaru výrazně rychlejší než stejně velký „hustý" model. Přesně tak je postavený například Qwen3-30B-A3B (30,5 mld. parametrů celkem, 3,3 mld. aktivních, licence Apache 2.0), který umí přepínat mezi „přemýšlecím" režimem pro složitější úlohy a rychlým režimem pro běžný dialog.
Jaký hardware potřebujete
Řádově, pro orientaci:
- Malé modely (do ~8B): dnešní notebook s 16 GB paměti. Hodí se na klasifikaci, jednoduché sumarizace, doplňování textu.
- Střední modely (~14–32B): grafická karta s 16–24 GB paměti, nebo Mac se sjednocenou pamětí 32 GB a víc. Tady začíná užitečná kvalita pro interní asistenty a delší dokumenty.
- Velké modely (70B a víc): víc grafických karet nebo server – investice v řádu vyšších desítek až stovek tisíc korun a někdo, kdo se o to stará.
Praktická rada: začněte tím, co máte. Stáhněte Ollama nebo LM Studio, zkuste malý model, pak střední, a zjistíte, jestli vám kvalita pro daný úkol stačí, dřív než utratíte korunu za hardware.
Kde lokální modely dnes reálně pomáhají
Aktuální otevřené modely kolem 30 miliard parametrů (řada Qwen3 a novější generace, srovnatelné modely od dalších vydavatelů) jsou z mé zkušenosti dobré na:
- Sumarizace a extrakce – shrnout dokument, vytáhnout údaje ze smlouvy, sestavit zápis z přepisu.
- Interní asistent nad firemními dokumenty – odpovídat na otázky z interních směrnic, manuálů, historie zakázek, aniž by dokumenty opustily firmu.
- Klasifikace a třídění – rozřazovat poptávky, tikety, recenze; označovat sentiment; předzpracovat data pro další systém.
- Anonymizace – před odesláním do cloudového modelu odstranit osobní údaje lokálně.
- Objemové jednoduché úlohy – tisíce krátkých operací denně, kde by cloudový účet rostl a kvalita malého modelu stačí.
Kde byste se spálili – a proč zatím nejsou náhradou cloudu
Tohle je část, kterou lidé neradi slyší, ale musíte ji vědět dřív, než nakoupíte servery:
- Kvalita u složitých úloh. Dlouhé uvažování, náročná analýza, kvalitní psaní, složitý kód: špičkové cloudové modely jsou stále znatelně dál. Lokální model, který v demu vypadá skvěle na shrnutí odstavce, začne u složitějšího zadání dělat chyby, které nepoznáte, dokud je nezkontrolujete.
- Údržba. Modely, nástroje i knihovny se mění každý měsíc. Někdo musí aktualizovat, testovat, hlídat, že po aktualizaci model odpovídá stejně dobře.
- Hardware a náklady. Grafické karty stárnou, elektřina se platí, server musí někde běžet. Cloudový firemní tarif za pár desítek uživatelů často vyjde levněji než jeden slušný server plus lidská práce.
- Bezpečnost nasazení. „Data neodcházejí" platí jen tehdy, když je server dobře zabezpečený. Špatně nasazený lokální model přístupný z internetu je horší než dobrý cloudový poskytovatel se smlouvou o zpracování dat.
- Chování modelu. Otevřené modely mají různá bezpečnostní nastavení a různé sklony k halucinacím; nikdo za vás nehlídá, co model uživatelům říká.
Proto moje doporučení pro většinu firem zní: cloudový model s firemním tarifem a smluvně ošetřeným zpracováním dat jako základ, lokální model jako doplněk pro citlivé úlohy, offline scénáře a objemové jednoduché operace. Kdo začíná od lokálního modelu, protože „je to zadarmo a bezpečné", většinou skončí s drahým serverem a průměrnou kvalitou.
GDPR úhel
Lokální provoz má z pohledu GDPR jednu velkou výhodu: osobní údaje neopouštějí firmu, takže nepotřebujete zpracovatelskou smlouvu s poskytovatelem modelu a odpadá otázka přenosu dat mimo EU. Zůstává ale všechno ostatní: musíte mít právní titul ke zpracování, informovat subjekty údajů, zabezpečit server, řídit přístupy a řešit výmaz. Lokální model neřeší GDPR – řeší jednu jeho část. Pokud AI nasazujete na osobní údaje, doporučuji přečíst si i článek o AI Actu pro české firmy, kde jsou povinnosti kolem AI systémů v praxi.
Jak zjistit, jestli je vaše firma potřebuje
Odpovězte si na čtyři otázky:
- Pracujeme s daty, která nesmějí opustit firmu – zdravotní, právní, finanční, obchodní tajemství – a nestačí nám smluvní záruky cloudového poskytovatele?
- Potřebujeme AI tam, kde není spolehlivý internet (výroba, terén, uzavřené sítě)?
- Máme velký objem jednoduchých úloh, kde by cloudový účet rostl do desetitisíců měsíčně a kvalita menšího modelu stačí?
- Máme, kdo se o to postará – interně nebo externě?
Dvě a víc „ano" znamená, že má smysl lokální model vyzkoušet – nejdřív na notebooku, na jednom konkrétním úkolu, s porovnáním kvality proti cloudovému modelu. Jedno nebo žádné „ano" znamená, že jste na tom líp s cloudem a dobře nastavenými pravidly použití.
Přesně tohle porovnání – kdy cloud, kdy lokální, jak vyzkoušet a jak nastavit pravidla pro tým – dělám na firemním školení AI. A kdo si to chce nejdřív osahat sám, začne na otevřeném kurzu, kde si lokální model spustíme naživo.
Shrnutí
- Otevřený model = stažitelné váhy pod licencí; lokální provoz = data neopouštějí váš hardware, platíte hardwarem a vlastní odpovědností.
- Velikost čtěte přes parametry a kvantizaci: 4bitový model potřebuje zhruba půl až šest desetin GB paměti na miliardu parametrů; MoE modely (např. 30B-A3B) jsou rychlejší na běžném hardwaru.
- Ollama a LM Studio jsou obvyklá cesta pro jednotlivce a malé týmy; začněte na tom, co máte.
- Modely kolem 30B jsou dnes dobré na sumarizace, interní asistenty, klasifikaci, anonymizaci a objemové jednoduché úlohy.
- Pro většinu firem zatím nejsou náhradou cloudových modelů kvůli kvalitě u složitých úloh, údržbě, hardwaru a bezpečnosti nasazení – jsou doplňkem pro citlivá data, offline provoz a objem.
- Lokální provoz řeší část GDPR (data neodcházejí), ne celé GDPR.
Nejčastější otázky
Je lokální model zadarmo?
Licence bývá zdarma i pro komerční použití (u Apache 2.0 ano, u jiných licencí si přečtěte podmínky). Platíte ale hardwarem, elektřinou a hlavně časem někoho, kdo model nasadí, aktualizuje a hlídá. Pro malý tým vyjde cloudový firemní tarif často levněji.
Jaký nejmenší počítač stačí na vyzkoušení?
Běžný notebook s 16 GB paměti zvládne malé modely (do zhruba 8 miliard parametrů). Na modely kolem 30 miliard parametrů chcete grafickou kartu s 16–24 GB paměti nebo počítač se sjednocenou pamětí 32 GB a víc. Přesné nároky ověřte u konkrétního modelu.
Můžu lokální model napojit na firemní dokumenty?
Ano, to je jeden z nejužitečnějších scénářů: interní asistent, který odpovídá z vašich směrnic, manuálů a historie zakázek, aniž by dokumenty opustily firmu. Vyžaduje to ale správné nastavení vyhledávání v dokumentech a kontrolu kvality odpovědí – není to jen „nahrát a hotovo".
Nahradí lokální modely ChatGPT a Claude?
Zatím ne. U složitých úloh jsou špičkové cloudové modely znatelně dál a lokální nasazení vyžaduje údržbu a hardware. Rozumné je kombinovat: cloud s firemním tarifem jako základ, lokální model pro citlivá data, offline provoz a objemové jednoduché úlohy.
Zdroje a odkazy
- Qwen3-30B-A3B na Hugging Face – 30,5 mld. parametrů celkem, 3,3 mld. aktivních, Apache 2.0, přemýšlecí a rychlý režim
- Ollama – lokální spouštění otevřených modelů na macOS, Windows a Linuxu
- LM Studio – grafická aplikace pro stažení a spuštění lokálních modelů
- Nařízení GDPR (EU) 2016/679 – zpracování osobních údajů
