llama photo

AI i computer vision

Lokalny model językowy w firmie: jaki sprzęt do jakiego modelu

Lokalny LLM do dokumentów firmy: dlaczego liczy się VRAM karty graficznej, jakie modele wybrać, kiedy wystarczy VPS i czego wymaga trening.

Autor: BeGiga 7 min czytania

Firmy, które uporządkowały dokumenty w archiwum takim jak Paperless-ngx, szybko dochodzą do kolejnego pytania: czy model językowy, który ma te dokumenty czytać, może działać na własnym sprzęcie. Może, a to, jaki sprzęt kupić, zależy od tego, jaki model jest potrzebny i do czego.

Lokalny LLM nie musi dorównywać największym modelom w chmurze. Do opisywania dokumentów, wyciągania dat i kontrahentów czy odpowiadania na pytania o treść archiwum często wystarcza model średniej wielkości, a dane nie opuszczają firmy.

Najważniejsza jest pamięć karty graficznej

O tym, jaki model da się uruchomić, decyduje przede wszystkim pamięć karty graficznej, czyli VRAM. Model działa sprawnie tylko wtedy, gdy jego wagi mieszczą się w tej pamięci w całości. Jeśli się nie mieszczą, część trafia do zwykłej pamięci RAM i odpowiedzi wielokrotnie zwalniają. Moc obliczeniowa karty też ma znaczenie, ale to brak pamięci najczęściej wyklucza dany model.

Monitor nvtop pokazujący zajętość pamięci VRAM i obciążenie karty graficznej
nvtop pokazuje zajętość pamięci VRAM i obciążenie karty przez uruchomione procesy. Tak najprościej sprawdzić, czy model mieści się w pamięci karty, czy część trafia już do RAM. Źródło: nvtop, GPL-3.0.

Ilość potrzebnej pamięci zmniejsza kwantyzacja, czyli zapis wag z mniejszą precyzją. Na oko model w kwantyzacji 4-bitowej zajmuje nieco ponad pół gigabajta na każdy miliard parametrów, więc model 8B potrzebuje około 5 GB, a model 32B około 20 GB. Trzeba do tego doliczyć pamięć na kontekst, czyli tekst, który model ma jednocześnie przed sobą, oraz na równoległe zapytania kilku użytkowników. Długie dokumenty i kilka osób pytających naraz potrafią zająć tyle pamięci, co sam model.

Jakie modele uruchamia się lokalnie

Modele z otwartymi wagami wydaje dziś kilku dużych producentów. Najczęściej spotyka się rodziny Llama od Meta, Qwen od Alibaby, Mistral, Gemma od Google, gpt-oss od OpenAI i DeepSeek. Przy dokumentach po polsku warto przetestować też modele rozwijane w Polsce, takie jak Bielik czy PLLuM, trenowane z większym udziałem polskich tekstów. Każda rodzina ma kilka rozmiarów, a licencje różnią się warunkami użycia komercyjnego, więc przed wdrożeniem trzeba je sprawdzić.

W praktyce rozmiary dzielą się na trzy grupy. Małe modele, do kilku miliardów parametrów, dobrze radzą sobie z klasyfikacją, tagowaniem i wyciąganiem pojedynczych pól z dokumentów. Modele średnie, od kilkunastu do kilkudziesięciu miliardów parametrów, odpowiadają na pytania o treść dokumentów i przygotowują zestawienia na poziomie, który w większości firmowych zastosowań wystarcza. Największe modele zbliżają się jakością do usług chmurowych, ale wymagają kilku kart graficznych albo serwera z bardzo dużą pamięcią.

System pracy z dokumentami potrzebuje zwykle więcej niż jednego modelu. Model embeddingowy zamienia fragmenty dokumentów na wektory do wyszukiwania i jest na tyle mały, że działa obok głównego modelu bez osobnego sprzętu. Przy skanach słabej jakości, tabelach i piśmie odręcznym dochodzą modele wizyjne, które czytają dokument jako obraz i często radzą sobie lepiej niż klasyczne OCR.

Od komputera biurowego do serwera z kartami graficznymi

Sprzęt dobiera się do modelu i liczby użytkowników, nie odwrotnie. Komputer albo mały serwer z jedną kartą konsumencką o 8–16 GB VRAM wystarcza dla małych modeli i pojedynczych użytkowników, na przykład do automatycznego opisywania dokumentów w Paperless-ngx. Stacja robocza z kartą 24–32 GB albo dwiema kartami obsłuży modele średnie i niewielki zespół. Większe modele, wielu użytkowników naraz i długie dokumenty wymagają serwera z kartami przeznaczonymi do centrów danych.

Inną drogą są komputery Apple z procesorami serii M, w których procesor i układ graficzny korzystają ze wspólnej pamięci. Ta pamięć może sięgać nawet kilkuset gigabajtów, więc mieszczą się w niej duże modele, ale odpowiedzi generują się wolniej niż na najmocniejszych kartach, a wielu użytkowników naraz obciąża je wyraźniej. Przy wyborze liczy się też RAM i dysk: pojedynczy model zajmuje od kilku do kilkuset gigabajtów, a w firmie zwykle trzyma się ich kilka, żeby porównywać wyniki.

Czy lokalny model może działać na VPS

Tak. Dostawcy chmury i hostingu oferują serwery wirtualne z kartami graficznymi, także w centrach danych w Unii Europejskiej. Model działa wtedy na infrastrukturze wynajmowanej przez firmę, a nie u dostawcy AI, a dostęp można ograniczyć do sieci prywatnej albo VPN, tak samo jak przy archiwum dokumentów. To wygodny sposób na start i na testy, zanim firma zdecyduje się na własny sprzęt. Zwykły VPS bez karty graficznej uruchomi tylko mały model i obsłuży pojedyncze zapytania, więc nadaje się raczej do zadań w tle niż do rozmowy z archiwum.

Dostęp do lokalnego serwera spoza biura

Serwer z modelem zwykle stoi w biurze albo w serwerowni, a pracownicy chcą z niego korzystać także z domu czy w podróży. Bezpieczny dostęp spoza biura daje się zbudować na dwa sposoby: przez prywatną sieć VPN albo przez tunel do zaufanego pośrednika. W obu przypadkach serwer nie musi być widoczny z internetu.

Pierwszy sposób to sieć prywatna typu VPN, w której serwer i urządzenia pracowników łączą się szyfrowanym tunelem. Można ją zbudować na WireGuard, na przykład na niewielkim serwerze VPS, albo skorzystać z gotowej usługi opartej na tym protokole, takiej jak Tailscale. Gdy model działa na serwerach w chmurze, na przykład w Hetznerze, serwery łączy się siecią prywatną dostawcy, a do internetu wystawia się tylko bramę VPN. Drugi sposób to tunel, w którym serwer sam nawiązuje połączenie wychodzące do pośrednika, więc nie trzeba otwierać żadnych portów. Tak działa Cloudflare Tunnel, zwykle w parze z Cloudflare Access, które przed wpuszczeniem do aplikacji wymaga logowania firmowym kontem.

Wybór zależy od tego, jak wrażliwe są dane. W tunelu Cloudflare ruch jest odszyfrowywany na serwerach pośrednika, zanim trafi do firmy. Przy dokumentach, które nie powinny opuszczać firmy nawet na chwilę, lepiej sprawdza się VPN, w którym szyfrowanie obejmuje całą drogę od urządzenia pracownika do serwera. Otwarcie portu na routerze i wystawienie serwera pod publicznym adresem IP to w większości przypadków kiepski pomysł. API Ollamy domyślnie nie wymaga logowania, więc każdy, kto znajdzie taki adres, może korzystać z modelu, obciążać serwer, a przy podłączonym archiwum także próbować dostać się do dokumentów. O bezpieczeństwie decyduje konfiguracja: kto ma dostęp, jak odbiera się go osobom odchodzącym z firmy i czy serwer jest regularnie aktualizowany. To element, który BeGiga przygotowuje razem z samym serwerem i modelem w ramach usługi wdrożeń AI i analizy dokumentów.

Trening, dostrajanie i ewaluacja to różne wymagania

Uruchamianie modelu, czyli inferencja, to najlżejsze z tych zadań. Ewaluacja opiera się na tym samym: model odpowiada na przygotowany zestaw pytań, a odpowiedzi porównuje się z oczekiwanymi. Wystarcza do niej sprzęt, na którym model ma pracować na co dzień, choć przy dużych zestawach testowych przydaje się karta obsługująca wiele zapytań równolegle.

Trenowanie i dostrajanie wymagają znacznie więcej. Oprócz wag w pamięci muszą się zmieścić gradienty i stany optymalizatora, przez co pełne dostrajanie potrzebuje kilka razy więcej pamięci niż inferencja tego samego modelu. Metody takie jak LoRA i QLoRA zmniejszają ten narzut na tyle, że mniejszy model da się dostroić na jednej mocnej karcie, ale modele średnie i duże nadal wymagają serwerów z kilkoma kartami. Rozsądnym podejściem bywa wynajęcie mocniejszej maszyny wyłącznie na potrzeby treningu i uruchamianie gotowego modelu na własnym, skromniejszym sprzęcie. W projektach z dokumentami trening często w ogóle nie jest potrzebny, bo gotowy model połączony z archiwum przez RAG daje wystarczające wyniki.

Rozmowa z wgranym dokumentem w AnythingLLM z lokalnym modelem
Rozmowa z wgranym dokumentem w AnythingLLM, z modelem uruchomionym lokalnie przez vLLM. Tak wygląda RAG w praktyce: model odpowiada na podstawie dokumentu, bez żadnego trenowania. Źródło: dokumentacja vLLM, Apache-2.0.

Oprogramowanie do uruchamiania modeli

Ollama najprościej uruchamia modele na jednym serwerze i ma gotowe połączenia z wieloma narzędziami, między innymi z Paperless-AI, rozszerzeniem, które dodaje do Paperless-ngx opisywanie dokumentów i rozmowę z archiwum przez model językowy. llama.cpp działa także na samym procesorze i obsługuje modele skwantyzowane w formacie GGUF. vLLM sprawdza się tam, gdzie z modelu korzysta jednocześnie wiele osób albo aplikacji, bo lepiej wykorzystuje kartę przy równoległych zapytaniach. Większość tych narzędzi udostępnia interfejs zgodny z API OpenAI, więc aplikację można przełączyć z modelu w chmurze na lokalny bez przepisywania.

Interfejs czatu Open WebUI dla lokalnych modeli językowych
Open WebUI, interfejs czatu dla modeli uruchamianych lokalnie, na przykład przez Ollamę. Pracownicy korzystają z niego jak z czatu w chmurze, a dane zostają na serwerze firmy. Źródło: Open WebUI, licencja BSD-3.

Od czego zacząć wdrożenie lokalnego LLM

Zanim firma kupi sprzęt, dobrze określić zadania: czy model ma tylko opisywać dokumenty w tle, odpowiadać pracownikom na pytania, czy przygotowywać nowe dokumenty. Potem warto sprawdzić kilka modeli na własnych dokumentach, najlepiej na wynajętym serwerze, i porównać jakość odpowiedzi na zestawie typowych pytań. Dopiero wtedy wiadomo, który rozmiar modelu wystarcza i jaki sprzęt go udźwignie. BeGiga projektuje takie serwery, dobiera karty graficzne i lokalne modele oraz łączy je z archiwum dokumentów w ramach usługi wdrożeń AI i analizy dokumentów.

Często zadawane pytania: Lokalny LLM

Czy lokalny model językowy zadziała bez karty graficznej?

Mały model da się uruchomić na samym procesorze i pamięci RAM, na przykład przez llama.cpp albo Ollamę. Odpowiedzi pojawiają się jednak wyraźnie wolniej niż na karcie graficznej, a przy kilku użytkownikach naraz serwer szybko przestaje nadążać. Do opisywania dokumentów w tle to bywa wystarczające, do rozmowy z archiwum zwykle już nie.

Ile pamięci VRAM potrzeba do lokalnego LLM?

Na oko model w kwantyzacji 4-bitowej zajmuje nieco ponad pół gigabajta na każdy miliard parametrów, a do tego dochodzi pamięć na kontekst i równoległe zapytania. Model kilkumiliardowy zmieści się na karcie z 8–12 GB, modele średnie potrzebują 24 GB lub więcej, a największe kilku kart albo serwera z bardzo dużą pamięcią.

Czy do pracy z dokumentami firmy trzeba trenować własny model?

Najczęściej nie. W większości projektów wystarcza gotowy model połączony z uporządkowanym archiwum przez RAG, czyli wyszukiwanie fragmentów dokumentów i podawanie ich modelowi razem z pytaniem. Dostrajanie ma sens przy bardzo specyficznym języku albo formacie odpowiedzi i wymaga mocniejszego sprzętu niż samo uruchamianie modelu.

  • Lokalny LLM
  • VRAM
  • Ollama
  • Paperless-AI
  • RAG