Laboratorium LLM & Vision

Systemy LLM, MLOps, CV a szyte na miarę wdrożenia analizy dokumentów z lokalnym AI

Przedsięwzięcia oraz współpraca badawczo-rozwojowa obejmująca wizję komputerową, systemy RAG i agentic AI, MLOps, a także inżynierię danych. Oprócz tego rozwiązania dopasowane do potrzeb: stos służący do archiwizacji i analizy dokumentów, który działa w oparciu o lokalne modele AI, więc dane firmy nie są wysyłane do chmury zewnętrznej.

Zakres usługi: Wdrożenia AI, LLM i wizji komputerowej

  • Inżynieria zbiorów danych
  • Computer Vision
  • MLflow
  • Przetwarzanie obrazu i wideo
  • Pipeline'y LLM
  • Agentic AI
  • RAG
  • Trening dedykowanych modeli AI
  • Inferencja mobilna i edge

BeGiga prowadzi projekty z zakresu sztucznej inteligencji dla firm, organizacji i działów badawczo-rozwojowych: począwszy od wizji komputerowej, poprzez systemy oparte na dużych modelach językowych, aż po infrastrukturę, dzięki której modele, potoki danych lub inne rozwiązania AI mogą działać na produkcji. Projekt można zrealizować od początku do końca albo zespół BeGiga dołącza do istniejącego zespołu i przejmuje wybrany etap prac. Ocena wykonalności i potencjalnego obszaru współpracy stanowi element usługi projektowania systemów i doboru technologii.

Computer vision i analiza obrazu

BeGiga realizuje projekty i uczestniczy we współpracy przy pracach badawczo-rozwojowych z zakresu wizji komputerowej. Praca rozpoczyna się od inżynierii zbiorów danych: zaplanowania, jakie zdjęcia i nagrania należy zebrać, opracowania wytycznych do etykietowania, kontroli jakości adnotacji oraz augmentacji, która uodparnia model na warunki rzadko spotykane w danych treningowych. Na tej podstawie tworzone są dedykowane modele do detekcji, segmentacji, klasyfikacji i śledzenia obiektów na zdjęciach i w wideo, a także rozwiązania przetwarzające dane 3D.

Modele projektuje się z myślą o rzeczywistych danych, z którymi zetkną się po wdrożeniu: słabym oświetleniu, rozmyciu ruchu, nietypowych kątach kamery i zakłóceniach, których w laboratorium nie widać. Pipeline'y przetwarzania obrazu i wideo wiążą model z pozostałymi etapami, takimi jak przygotowanie klatek, filtrowanie wyników i przekazanie ich do systemów klienta. Jeśli model ma działać na telefonie albo urządzeniu wbudowanym, poddaje się go kwantyzacji i optymalizacji pod docelowy sprzęt, aby inferencja na urządzeniu brzegowym mieściła się w limitach pamięci, czasu odpowiedzi i zużycia energii.

Systemy LLM, RAG i agentic AI

BeGiga projektuje i wdraża systemy oparte na dużych modelach językowych, w których o jakości rozstrzyga przede wszystkim przygotowanie danych. Prace obejmują ekstrakcję treści z dokumentów nieustrukturyzowanych, takich jak pliki PDF, dokumenty Word, prezentacje i skany, do ustrukturyzowanych zbiorów, ich czyszczenie, dzielenie na fragmenty (chunking) i wzbogacanie o metadane. Fragmenty zamienia się następnie na embeddingi i indeksuje w bazach wektorowych, na przykład Qdrant, Milvus, pgvector czy FAISS, dobieranych do skali projektu i miejsca, w którym system ma działać.

Na takim indeksie opiera się wyszukiwanie semantyczne, wyszukiwanie po słowach kluczowych i wyszukiwanie hybrydowe łączące oba podejścia, uzupełnione o filtrowanie po metadanych i ponowne szeregowanie wyników (reranking). Systemy RAG odpowiadają w oparciu o dokumenty firmy i podają źródła każdej odpowiedzi, co ogranicza halucynacje i pozwala zweryfikować, skąd pochodzi informacja. Modele mogą być wykorzystywane przez API komercyjnych dostawców albo uruchamiane lokalnie w wersjach open source, a gdy zadanie tego wymaga, dostrajane na danych klienta.

Pipeline'y agentowe idą o krok dalej: planują kolejne kroki zadania, wywołują narzędzia i funkcje innych systemów, odpytują bazy danych i łączą wyniki z kilku modeli. Integracje mogą przebiegać przez protokół MCP, który udostępnia modelom dane i funkcje systemów firmy w kontrolowany sposób. Każdy taki system otrzymuje zabezpieczenia (guardrails) przed prompt injection i niepożądanymi odpowiedziami, limity działań i kosztów, logowanie oraz punkty, w których decyzję zatwierdza człowiek. Jakość mierzy się na zestawach testowych przygotowanych pod konkretne zastosowanie, osobno dla trafności wyszukiwania i dla odpowiedzi, a po wdrożeniu monitoruje się spadki jakości i koszty wywołań.

Prostszy, publicznie dostępny wariant takiego rozwiązania, czyli chatbot oparty na treściach strony, sprawdź w artykule o chatbotach na stronie internetowej. Przykładem AI wbudowanego w oprogramowanie, z którego firma już korzysta, jest asystent i serwer MCP w PrestaShop, omówione w artykule czy warto aktualizować PrestaShop do wersji 9.2.

MLOps i inżynieria danych

BeGiga wdraża praktyki MLOps, dzięki którym model można przenieść z prototypu na produkcję i utrzymać go tam bez ręcznego powtarzania tych samych kroków. Obejmuje to śledzenie eksperymentów i rejestr modeli w MLflow, wersjonowanie danych i modeli, konteneryzację, automatyczne testy i wdrożenia przez CI/CD, serwowanie modeli oraz monitorowanie ich skuteczności i dryfu danych. Gdy dane zmienią się na tyle, że model zaczyna działać gorzej, pipeline ponownego treningu odbudowuje go i porównuje z poprzednią wersją przed podmianą.

Modele potrzebują stałego dopływu danych, za który odpowiadają pipeline'y ETL i ELT. W podejściu ETL dane są pobierane z systemów źródłowych, przekształcane i dopiero wtedy ładowane do hurtowni danych. W podejściu ELT surowe dane trafiają najpierw do miejsca docelowego, na przykład do tak zwanego lakehouse'u, i są przekształcane już na miejscu, co ułatwia pracę z dużymi i często zmieniającymi się zbiorami. Za harmonogram i kolejność zadań odpowiada orkiestracja w Apache Airflow, która uruchamia kroki w ustalonej kolejności i powtarza je po błędzie.

Przy dużych wolumenach danych BeGiga pracuje z Apache Spark, silnikiem do rozproszonego przetwarzania danych w trybie wsadowym i strumieniowym, oraz z platformą Databricks, w tym z katalogiem danych Unity Catalog, MLflow, serwowaniem modeli i wyszukiwaniem wektorowym. Dane, modele i ich historia znajdują się wtedy w jednym miejscu, z kontrolą dostępu i możliwością odtworzenia każdego kroku. W mniejszych projektach te same zasady realizuje się lżejszymi narzędziami, dobranymi do skali danych i budżetu.

Spersonalizowany stos do analizy dokumentów z lokalnym AI

Oferujemy też przygotowanie i wdrożenie stosu do archiwizacji i analizy dokumentów, dopasowanego do konkretnej firmy i przygotowującego dokumenty do dalszego przetwarzania przez AI. Zamiast jednego pudełkowego systemu powstaje zestaw sprawdzonych narzędzi open source i dodatków, skonfigurowanych pod rodzaje dokumentów, liczbę użytkowników i sposób pracy zespołu, połączonych z pocztą, skanerami i folderami sieciowymi oraz z lokalnymi modelami AI.

Każdy dokument, zeskanowany lub elektroniczny, przechodzi przez rozpoznawanie tekstu (OCR), więc można go znaleźć po dowolnym słowie z treści. System sam przypisuje typ dokumentu, kontrahenta i tagi, ucząc się na wcześniejszych opisach, pobiera załączniki ze skrzynek pocztowych z pominięciem zbędnych plików, a papierowe oryginały oznacza numerami archiwalnymi ASN w postaci kodów kreskowych lub QR. Dzięki temu każdy oryginał jest jednoznacznie powiązany ze swoją wersją cyfrową, a jego miejsce w archiwum papierowym łatwo ustalić. Uprawnienia, czyli kto widzi i edytuje które dokumenty, są ustalane przed konfiguracją.

Takie wdrożenie sprawdza się najlepiej w firmach, które nie mają jeszcze rozbudowanego systemu do zarządzania dokumentami: w biurach usługowych, małych firmach produkcyjnych i handlowych oraz w zespołach pracujących w terenie. Tam, gdzie dokumenty obsługuje już system ERP, CRM albo pakiet korporacyjny, często lepsza jest inna ścieżka i mówimy o tym otwarcie przed rozpoczęciem prac. Dlaczego ustrukturyzowana kolekcja dokumentów jest punktem startowym dla wewnętrznej bazy wiedzy opartej na technologiach LLM, przeczytasz w artykule najpierw archiwum dokumentów, potem AI.

Prywatność, lokalne modele i sprzęt

Dokumenty firmy nie muszą trafiać do zewnętrznej chmury. Stos może działać na komputerze lub serwerze w biurze, w sieci prywatnej, z dostępem z zewnątrz przez tunel albo VPN, a jeśli wygoda ma pierwszeństwo, na prywatnym serwerze VPS z siecią prywatną. W obu przypadkach pliki nie są dostępne publicznie, a konfiguracja jest dostosowywana do wymagań RODO obowiązujących w danej firmie.

Ta sama zasada dotyczy funkcji AI. Zamiast wysyłać dokumenty do zewnętrznego dostawcy, firma może korzystać z lokalnych modeli językowych działających na własnym sprzęcie, a BeGiga projektuje taki serwer i dobiera podzespoły, łącznie z kartą graficzną odpowiednią do wybranego modelu. Jaki sprzęt dobrać do jakiego modelu, sprawdź w artykule lokalny model językowy w firmie: jaki sprzęt do jakiego modelu. Uporządkowany zbiór dokumentów staje się wtedy podstawą dla wewnętrznych asystentów, którzy odpowiadają na pytania o treść dokumentów i wskazują źródło, dla wyszukiwania po znaczeniu, generowania zestawień i szukania niespójności między umowami, fakturami i protokołami, czyli dla tych samych systemów RAG, o których mowa w sekcji o modelach językowych, ale bez uzależnienia od cen i warunków dostawców AI.

FAQ: Wdrożenia AI, LLM i wizji komputerowej

Czy BeGiga potrafi wesprzeć zespół albo projekt badawczy, który już istnieje?

Owszem. Współpraca może dotyczyć całego projektu, począwszy od analizy danych aż po wdrożenie, bądź też wybranego etapu, choćby przygotowania zbioru danych, ewaluacji systemu RAG albo przeniesienia modelu z prototypu na produkcję. W takiej sytuacji zespół BeGiga działa w narzędziach i repozytoriach klienta, w modelu współpracy B2B.

Które dane są niezbędne w projekcie computer vision?

To zależy od zadania oraz od tego, jak mocno obrazy odbiegają od tych, na których trenowano dostępne modele. Na początku trzeba przejrzeć dane, które firma już posiada, i ocenić, czy wystarczy dotrenować gotowy model, czy konieczne będzie zebranie oraz oznaczenie nowych zdjęć lub nagrań. Plan zbierania i etykietowania danych powstaje jeszcze przed treningiem, ponieważ wynik całego projektu zależy od ich jakości.

W jaki sposób sprawdzić, czy system RAG odpowiada prawidłowo?

Poprzez ewaluację na zestawie pytań przygotowanym pod konkretne zastosowanie, wraz z oczekiwanymi odpowiedziami i źródłami. Osobno mierzy się trafność wyszukiwania fragmentów oraz jakość samej odpowiedzi, a wyniki porównuje się po każdej zmianie modelu, promptów bądź sposobu dzielenia dokumentów. Po wdrożeniu jakość odpowiedzi wciąż podlega monitorowaniu, a wątpliwe przypadki trafiają do przeglądu przez człowieka.

Czy modele i dokumenty mogą pozostać na infrastrukturze firmy?

Tak. Modele językowe i systemy analizy dokumentów mogą być uruchamiane na serwerze w biurze, na prywatnym serwerze w chmurze albo na urządzeniach brzegowych, z dostępem z zewnątrz przez tunel lub VPN. Wybór zależy od rodzaju danych, wymagań RODO, budżetu i tego, kto ma mieć dostęp.