09 / Oprogramowanie i automatyzacja
Funkcje AI, które da się zmierzyć, a nie tylko pokazać na demie
Budujemy funkcje oparte na modelach językowych razem z tym, co decyduje o ich losie na produkcji: zestawem ewaluacyjnym, śledzeniem każdego wywołania i kontrolą kosztów.
Demo z modelem językowym robi wrażenie po dwóch dniach pracy. Problem zaczyna się później: nikt nie potrafi powiedzieć, jak często asystent odpowiada dobrze, co robi z pytaniem spoza swojego zakresu i ile kosztuje miesiąc jego działania. Funkcja, której nie da się ocenić, nie jest produktem. Jest ryzykiem, które ktoś prędzej czy później odkryje przy kliencie.
Podpiąć API modelu potrafi dziś prawie każdy. My traktujemy funkcję opartą na LLM jak system, który trzeba przetestować, zmierzyć i obserwować — tak samo jak każdy inny fragment produkcji. Nie dostajesz kolejnego demo — dostajesz funkcję, w której wiadomo, co jest sprawdzane, kiedy i z jakim wynikiem. Zdarza się też, że po analizie mówimy wprost, że modelu tu nie potrzeba: sporo rzeczy, o które firmy proszą „przez AI”, to w rzeczywistości problem z danymi albo z procesem, tańszy i pewniejszy do rozwiązania zwykłą automatyzacją.
Funkcja oparta na modelu językowym trafia do klientów tylko wtedy, gdy da się ją przetestować, podejrzeć jej zachowanie i rozliczyć jej koszt. Tak wygląda praca z modelami w środowiskach objętych nadzorem regulacyjnym — w tym w PwC i Roche, gdzie pracował założyciel firmy. W mniejszej firmie te trzy rzeczy kosztują niewiele więcej, a decydują o tym, czy funkcję w ogóle da się wypuścić.
Zakres usługi
Warsztat i ocena wykonalności
Z warsztatu wychodzisz z wiedzą, w co inwestować, a czego nie ruszać. Zaczynamy od przeglądu procesów, w których AI mogłoby coś zmienić, i od trzeźwej oceny każdego z nich: czy potrzebny jest tu model, czy wystarczy skrypt, czy dane w ogóle nadają się do użycia, ile to będzie kosztowało miesięcznie i co się stanie, gdy model się pomyli. Efekt to krótka lista z priorytetami — razem z pozycjami, które odradzamy.
- Przegląd procesów i wybór kandydatów do wdrożenia
- Ocena gotowości danych: jakość, dostępność, uprawnienia
- Rozstrzygnięcie: model językowy czy zwykła automatyzacja
- Szacunek kosztów i ryzyk przed rozpoczęciem prac
Wdrożenie funkcji opartych na LLM
Efekt trafia do narzędzi, w których zespół już pracuje — nie na osobną platformę „do AI”. Budujemy konkretne funkcje: asystenta odpowiadającego na podstawie dokumentów firmy, wyszukiwanie po wiedzy wewnętrznej, wyciąganie ustrukturyzowanych danych z faktur, umów i maili, klasyfikację zgłoszeń, przygotowywanie wstępnych odpowiedzi do akceptacji przez człowieka.
- Chatboty i asystenci odpowiadający na podstawie dokumentów firmy
- Wyszukiwanie po wiedzy wewnętrznej (RAG) zamiast przekopywania folderów
- Wyciąganie ustrukturyzowanych danych z dokumentów i wiadomości
- Klasyfikacja zgłoszeń i przygotowywanie wstępnych odpowiedzi
- Integracja z istniejącymi systemami i API
Jakość i ewaluacja AI
Ta część zwykle decyduje, czy funkcja przetrwa kontakt z klientem. Budujemy zestaw ewaluacyjny z prawdziwych przypadków z Twojej firmy i uruchamiamy go przy każdej zmianie promptu oraz przy każdej nowej wersji modelu. Osobno sprawdzamy, co dzieje się przy pytaniach spoza zakresu i przy próbach wyciągnięcia odpowiedzi, której model nie zna. Kryteria akceptacji ustalamy, zanim cokolwiek zobaczy klient — o słabych odpowiedziach dowiadujesz się przed klientami, nie od nich.
- Zestaw ewaluacyjny zbudowany na realnych przypadkach z firmy
- Testy regresji dla promptów i kolejnych wersji modelu
- Sprawdzanie zmyślonych odpowiedzi i pytań spoza zakresu
- Przegląd przez człowieka tam, gdzie stawka jest wysoka
- Kryteria akceptacji ustalone przed wypuszczeniem funkcji
Obserwowalność i koszty
Na produkcji musisz widzieć, co model naprawdę robi. Podpinamy śledzenie każdego wywołania — pytanie, kontekst, odpowiedź, czas, zużyte tokeny — w narzędziu do obserwowalności LLM; pracujemy m.in. z Langfuse. Do tego alerty, gdy jakość zaczyna się osuwać albo koszt odjeżdża od założeń.
- Śledzenie wywołań modelu: pytanie, kontekst, odpowiedź, czas
- Monitoring kosztu tokenów i limity chroniące budżet
- Alerty, gdy jakość odpowiedzi zaczyna spadać
- Zbieranie ocen od użytkowników i wracanie z nimi do ewaluacji
Bezpieczeństwo, dane i zgodność
Ustalamy wprost, jakie dane mogą trafić do modelu, a jakie nie mogą opuścić firmy, i projektujemy rozwiązanie zgodnie z tym ustaleniem. Przeglądamy wdrożenie pod kątem błędów charakterystycznych dla LLM: instrukcji wstrzykiwanych przez treść dokumentów, danych wyciekających w odpowiedziach, kluczy trzymanych po stronie przeglądarki. To projektowanie i przegląd bezpieczeństwa, nie formalne testy penetracyjne.
- Ustalenie, jakie dane mogą trafić do modelu, a jakie nie
- Przegląd pod kątem wstrzykiwania instrukcji i wycieku danych
- Klucze i wywołania modelu po stronie serwera, nie w przeglądarce
- Retencja logów i rozmów, kwestie RODO i przetwarzania w UE
Typowe sytuacje
Pilotażowy chatbot zrobił świetne wrażenie na prezentacji, ale nikt w firmie nie chce podpisać się pod wypuszczeniem go do klientów.
Skrzynka wsparcia tonie w pytaniach, na które odpowiedź jest ta sama od trzech lat.
Wiedza firmy siedzi w PDF-ach, procedurach i folderach na SharePoint, a znalezienie czegokolwiek wymaga zapytania konkretnej osoby.
Zarząd pyta, „co robimy z AI”, a na stole nie ma ani listy konkretnych zastosowań, ani oceny, ile miałyby kosztować.
Na czym możesz polegać
- Działająca funkcja wpięta w systemy używane na co dzień, a nie prototyp żyjący pod osobnym linkiem.
- Decyzja «wydajemy / nie wydajemy» oparta na dowodach — zestaw ewaluacyjny uruchamiany przy każdej zmianie promptu, wersji modelu i źródeł wiedzy, z wynikiem, który da się pokazać na spotkaniu.
- Widzisz, co model naprawdę odpowiada użytkownikom i ile to kosztuje — śledzenie wywołań i podgląd kosztów zamiast domysłów.
- Pisemna rekomendacja — łącznie z tym, czego nie warto oddawać modelowi i dlaczego.
Technologie
- Python
- TypeScript
- LLM APIs
- RAG
- Langfuse
- PyTest
- PostgreSQL
- AWS
- CI/CD
Projekty z tego obszaru
Wybrane realizacje, w których ten zakres był częścią pracy.
ThomasSeekerAI
Prywatny handlarz codziennie ręcznie przeczesywał OLX, Otomoto, Allegro i kilka mniejszych serwisów w poszukiwaniu rzeczy wartych odsprzedaży. Zbudowaliśmy wewnętrzne narzędzie, które przejmuje tę pracę: wyszukiwania opisane zwykłym zdaniem prowadzi cyklicznie w tle, odsiewa szum i układa resztę według oceny okazji — godziny ręcznego przeglądania zamienione w automat.
Prywatne narzędzie do wyszukiwania okazji z analizą AI
Pytania o tę usługę
Nie zawsze, i jest to pierwsza rzecz, którą ustalamy, bo przesądza o architekturze. Część zastosowań da się obsłużyć przetwarzaniem w regionie UE i z wyłączonym uczeniem na przesyłanych treściach. Część danych można zanonimizować albo w ogóle nie wysyłać. Tam, gdzie wymagania są ostre, rozważamy model uruchamiany na własnej infrastrukturze — z uczciwą informacją, że kosztuje więcej i zwykle daje słabsze wyniki. Mówimy, co z czego wynika, zamiast zapewniać, że „wszystko jest bezpieczne”.
Stąd, że ją mierzymy. Zbieramy realne pytania i dokumenty z Twojej firmy razem z odpowiedziami, jakich oczekujesz, a potem uruchamiamy ten zestaw przy każdej zmianie: promptu, wersji modelu, źródeł wiedzy. Widać wtedy nie tylko, że „chyba jest lepiej”, ale które przypadki się poprawiły, a które popsuły. Osobno sprawdzamy zachowanie przy pytaniach spoza zakresu, bo dobrze zbudowany asystent ma powiedzieć „nie wiem”, a nie wymyślić coś, co brzmi wiarygodnie.
Często taniej wychodzi zwykła automatyzacja i mówimy o tym już na pierwszej rozmowie. Model językowy zarabia na siebie tam, gdzie w grę wchodzi swobodny tekst: pytania zadawane na sto sposobów, dokumenty o różnym układzie, treści, których nie opisze sztywna reguła. Jeśli zadanie ma jasne reguły, skrypt będzie tańszy, szybszy i przewidywalny. Wolimy stracić zlecenie na wdrożenie AI, niż sprzedać model tam, gdzie wystarczyło poprawić proces.
Wdrożenie kończy się tym, że macie do tego narzędzia: śledzenie wywołań, podgląd kosztów, alerty i zestaw ewaluacyjny, który zespół umie uruchomić sam. Modele i ich wersje zmieniają się jednak po stronie dostawcy, więc przy funkcjach dotykających klientów proponujemy stałą opiekę: regularny przegląd jakości odpowiedzi i reakcję, gdy coś zaczyna się psuć. Pracujemy zdalnie z firmami z całej Polski, a w Bydgoszczy i okolicy także na miejscu — warsztat startowy wychodzi lepiej przy jednym stole.
Powiązane usługi
Testowanie oprogramowania
Testy manualne i automatyczne, testy API, UI i regresji oraz strategia testów — proces jakości, który realnie zabezpiecza wydania.
Automatyzacja i integracje
Kopiowanie danych między systemami, ręczne raporty i przepisywanie dokumentów zamieniamy w skrypty i integracje, które działają same.
Tworzenie oprogramowania
Oprogramowanie pisane pod konkretny problem: systemy wewnętrzne, MVP, integracje i przejęcie aplikacji po innym wykonawcy — zaprojektowane pod procesy firmy, nie odwrotnie.
Sprawdźmy, czy AI rozwiąże u Ciebie prawdziwy problem
Pierwsza rozmowa jest bezpłatna. Opowiedz, co miałoby robić AI w Twojej firmie, a odpowiemy konkretnie: co byśmy zrobili — model językowy czy zwykła automatyzacja — jak zmierzymy, że działa, ile to może kosztować i od czego zacząć. Jeśli model się tu nie zwróci, powiemy to wprost.
- kontakt@jakubzajac.eu
- Telefon
- +48 573 021 012