Instalace Ollama v systému Windows, macOS a Linux

Stažení instalátoru z oficiálních stránek Ollama trvá pár vteřin a nevyžaduje registraci. Ve Windows spustíte stažený .exe soubor, v macOS přesunete aplikaci do složky Aplikace a v Linuxu zadáte do terminálu příkaz curl -fsSL https://ollama.com/install.sh | sh. Po dokončení se služba spustí na pozadí a naslouchá na portu 11434. Otestujete funkčnost zadáním ollama --version v příkazovém řádku. V auditech CIAD se ukazuje, že uživatelé často zapoměnou restartovat terminál po instalaci, aby se cesty k binárkám načetly správně.

Výběr a stažení modelu podle účelu

Příkaz ollama pull nazev-modelu stáhne vybraný model do lokální složky ~/.ollama/models. Pro běžnou konverzaci v češtině stačí model llama3 nebo mistral, které zabírají 4 až 5 GB. Pro programování se hodí codellama nebo deepseek-coder, pro analytické úlohy phi3 s velikostí 2 až 3 GB. Velikost modelu přímo ovlivňuje rychlost odezvy a paměťové nároky. Pokud máte 16 GB RAM, můžete pustit llama3:70b kvantizovaný na 4 bity, který zabere cca 40 GB disku a poběží pomaleji, ale s vyšší kvalitou. Pro rychlé testování na notebooku s 8 GB RAM volte phi3:mini.

Práce s modelem v terminálu a přes lokální rozhraní

Po stažení spustíte interaktivní chat příkazem ollama run nazev-modelu. Vstup potvrdíte klávesou Enter, pro ukončení stisknete Ctrl+D. Parametry jako teplota (--temperature 0.7) nebo velikost kontextu (--num-ctx 4096) nastavíte přímo při spuštění. Pro pohodlnější práci existují třetistranové rozhraní jako Open WebUI, které nainstalujete přes Docker příkazem docker run -d -p 3000:8080 -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main. Pak otevřete prohlížeč na adrese localhost:3000 a máte grafické rozhraní s historií chatů, exportem a nastavením systémových promptů. Typický příklad z českého prostředí: analytik v Praze spustí phi3 na letadle bez Wi-Fi a generuje shrnutí smluv uložených lokálně v PDF.

Kdy se lokální provoz vyplatí a kdy raději cloud

Lokální model vyplatí se, když řešíte citlivá data, pracujete offline, potřebujete nulové náklady na tokeny nebo chcete plnou kontrolu nad verzí modelu. Cloudové API (OpenAI, Anthropic) nabízí vyšší inteligenci u složitých úkolů, delší kontext a nulovou režii na hardware. Pokud vaše zadání obsahuje firemní tajemství, zdravotní data nebo právní dokumenty, lokální cesta je jediná bezpečná. Naopak pro kreativní psaní, překlady cizojazyčných textů nebo rychlé prototypování promptů je cloud rychlejší a přesnější. Hranice se posouvá: novější modely jako llama3.1 nebo nemotron dosahují u konkrétních úkolů kvality GPT-4 Turbo z minulého roku.

Co to znamená: Ollama zprovozníte za pět minut, model si vyberete podle paměti RAM a úkolu, a máte funkční AI bez internetu a bez odesílání dat ven. Pro každodenní práci s textem a kódem na průměrném notebooku stačí 8 GB RAM a model phi3 nebo llama3.

Časté dotazy

Jaký model Ollama nejlépe umí česky?

Modely `llama3` a `mistral` dobře rozumí češtině a generují plynulý text. Menší `phi3` česky umí, ale chybovává více.

Potřebuji k Ollama grafickou kartu?

Ne, Ollama běží i na procesoru. GPU (NVIDIA s CUDA, Apple Silicon) výrazně zrychlí generování, ale není povinná.

Kde se ukládají stažené modely?

Ve Windows v `C:\Users\uzivatel\.ollama\models`, v macOS a Linuxu v `~/.ollama/models`. Lze změnit proměnnou `OLLAMA_MODELS`.

Jde v Ollama spustit více modelů zároveň?

Ano, každý běží jako samostatný proces. Paměť RAM se ale sčítá, takže dva 7B modely potřebují společně přes 16 GB RAM.

Jak aktualizuji model na novější verzi?

Příkaz `ollama pull nazev-modelu` stáhne nejnovější verzi a přepíše starou. Staré verze nejsou archivovány.