Az Ollama az egyik legnépszerűbb nyílt forráskódú eszköz, amely lehetővé teszi a felhasználók számára, hogy nagy nyelvi modelleket (LLM -eket) futtassanak helyben (locally), saját számítógépükön vagy szerverükön. Röviden áttekintjük, miért vált az Ollama az AI-közösségek egyik alapvető eszközévé, hogyan működik, és milyen előnyökkel jár a használata.
A legtöbb ismert mesterséges intelligencia modell (például a ChatGPT vagy a Claude) felhőalapú szolgáltatásként érhető el. Ez azt jelenti, hogy a felhasználó adatlapjai és kérései egy külső szerverre futnak be, majd azokat ott feldolgozzák.
Az Ollama ezt a koncepciót megfordítja: lehetővé teszi, hogy egy teljes nyelvi modellt letöltsünk a saját gépre, és felhős infrastruktúra vagy internetkapcsolat nélkül használjuk azt.
Adatvédelem és biztonság: A bizalmas adatok, céges dokumentumok vagy személyes információk soha nem hagyják el a gépet.
Költséghatékonyság: Nincsenek havi előfizetési díjak vagy API-kéréseken alapuló költségek.
Offline működés: Internetkapcsolat nélkül is teljes értékűen használható.
Testreszabható: Teljes kontrollt kapunk a felhasznált modellek, paraméterek és rendszerszintű utasítások felett.
Az Ollama a híres llama.cpp projektre épül, de megszünteti a bonyolult fordítási és beállítási lépéseket. Egy letisztult, parancssoros (CLI) felületet biztosít, ami nagymértékben hasonlít a szoftverfejlesztésben népszerű Docker működésére.
Modellkönyvtár (Model Library): Egyetlen paranccsal tölthetők le a legújabb nyílt forráskódú modellek (pl. Meta Llama 3, Mistral, Gemma, Phi-3, DeepSeek, Qwen).
Kvantálás (Quantization): A modelleket úgy optimalizálja, hogy azok kevesebb memóriát (RAM / VRAM) fogyasszanak, így átlagos fogyasztói laptopokon vagy asztali gépeken is gyorsan futnak.
Beépített API: Az Ollama automatikusan elindít egy helyi REST API-t (alapértelmezetten a localhost:11434 porton), így könnyen integrálható saját alkalmazásokba, vagy külső felhasználói felületekhez (pl. Open WebUI).
Multimodális támogatás: Nemcsak szöveges, hanem képfeldolgozásra képes modelleket is támogat (pl. LLaVA).
Az Ollama elérhető macOS, Linux és Windows rendszerekre egyaránt.
Parancs Leírás
ollama run <modellnév> Letölti (ha még nincs meg) és elindítja a modellt interaktív módban.
ollama pull <modellnév> Letölti a modellt az Ollama könyvtárából futtatás nélkül.
ollama list Kilistázza a helyileg már letöltött modelleket.
ollama rm <modellnév> Törli a megadott modellt a helyi tárhelyről.
ollama ps Megmutatja a jelenleg memóriában futó modelleket.
Példa: A Llama 3 modell futtatásához mindössze a következő parancsot kell beírni a terminálba: ollama run llama3
Az Ollama egyik legnagyobb ereje a konfigurálhatóságban rejlik. A Docker-ben használt Dockerfile-hoz hasonlóan itt is használhatunk Modelfile-t, amellyel saját viselkedést, előhangolást vagy paramétereket adhatunk a meglévő modelleknek.
# Példa egy egyedi Modelfile-ra
FROM llama3
# Hőmérséklet beállítása (kreativitás foka)
PARAMETER temperature 0.7
# Rendszerutasítás (System prompt)
SYSTEM """
Te egy tapasztalt Python fejlesztő és tanár vagy.
Válaszolj tömören, és mindig mellékelj tiszta kódpéldákat!
"""
Ezt követően a ollama create egyedi-python-bot -f ./Modelfile paranccsal saját modellt lehet építeni, ami bármikor előhívható.
Az Ollama rendkívül optimalizált, de a helyi AI-futtatás számításigényes feladat. A futtatáshoz ajánlott hardver a modell méretétől (paraméterszámától) erősen függ:
7B-8B paraméteres modellek (pl. Llama 3 8B, Mistral 7B):
Minimum: 8 GB RAM / VRAM
Ajánlott: 16 GB RAM vagy dedikált Nvidia GPU (6-8 GB VRAM), ill. Apple Silicon (M1/M2/M3/M4) Mac.
13B-14B paraméteres modellek:
Ajánlott: 16-32 GB RAM / VRAM.
70B paraméteres modellek:
Ajánlott: 64 GB+ RAM, vagy több profi GPU (pl. Nvidia RTX 3090/4090).
Az Ollama nem egy elszigetelt eszköz; az egyik legnagyobb előnye, hogy körülötte kiépült egy jelentős fejlesztői ökoszisztéma.
GUI felületek: Ha nem akarunk terminál üzemmódot használni, akkor olyan grafikus felületek köthetők hozzá, mint az Open WebUI (ChatGPT-hez hasonló felület), Jan, vagy a LM Studio.
Fejlesztői eszközök: Közvetlenül integrálható a VS Code vagy Cursor kód-szerkesztőkbe (pl. Continue.dev bővítménnyel), így saját, privát Copilot-alternatívát hozhatunk létre.
Keretrendszerek: A LangChain, LlamaIndex és AutoGEN könyvtárak natívan támogatják az Ollama-t, így komplex RAG (Retrieval-Augmented Generation) rendszerek és AI-ágensek építhetők vele.
A laptopomra telepített nyelvi modellek (LLM):
NAME SIZE
mistral-small:22b 12 .0 GB
qwen2.5:14b 9.0 GB
deepseek-coder-v2:16b 8.9 GB
llama3.1:latest 4.9 GB
gemma4: 26b 17.0 GB
gemma4: 12b 7.6 GB
phi4: latest 9.1 GB