Skip to main content

Budowa własnego frameworka do ewaluacji LLM w n8n

Jak zbudować low-code framework do ewaluacji LLM na n8n. Obejmuje kluczowe pojęcia jak LLM-as-a-Judge, własne metryki i wdrażanie zmian w AI z pewnością.

Jeśli kiedykolwiek budowałeś aplikację opartą na generatywnym AI, znasz to uczucie: jedna mała zmiana w promptcie, podmiana modelu albo drobna korekta węzła potrafi zamienić doskonale działający proces w nieprzewidywalny bałagan. W przeciwieństwie do deterministycznego kodu, wyniki AI wnoszą element uroczego — i frustrującego — chaosu.

Dokładnie dlatego przy wdrażaniu AI nie można polegać na zgadywaniu. Potrzebujesz dedykowanego, powtarzalnego mechanizmu testowego: frameworka do ewaluacji LLM.

Po co framework do ewaluacji?

Framework ewaluacyjny przenosi proces rozwoju od zgadywania do konkretnych, mierzalnych dowodów. Dlaczego to ważne:

  • Wdrażaj z pewnością — wyłapuj regresje i przypadki brzegowe, zanim zrobią to użytkownicy.
  • Oceniaj zmiany obiektywnie — wiedz, czy poprawka promptu naprawdę poprawiła wyniki, czy tylko zmieniła styl pisania.
  • Eksperymentuj szybciej — testuj radykalne zmiany w bezpiecznej piaskownicy, bez ryzyka dla produkcji.
  • Decyduj o modelach na podstawie danych — szybko porównuj nowe wydania pod kątem kosztu, szybkości i trafności w Twoim konkretnym zadaniu.

Dlaczego akurat n8n?

n8n traktuje ewaluację jako ciągłą praktykę wbudowaną w workflow, a nie jednorazowy benchmark. Kluczowe zalety:

  • Wdrożenie na wizualnym płótnie — żadnych własnych skryptów w Pythonie ani zewnętrznej infrastruktury. Przeciągasz, upuszczasz i łączysz węzły.
  • Osobna ścieżka ewaluacji — logika testów trzymana całkowicie z dala od produkcyjnych triggerów.
  • Konfigurowalne metryki — mierz poprawność wyniku, bezpieczeństwo, trafność wywołań narzędzi, liczbę tokenów, czas wykonania i więcej.

Kluczowe metody ewaluacji do wdrożenia

1. LLM jako sędzia (LLM-as-a-Judge)

Złoty standard dla zadań otwartych, jak streszczanie czy pisanie kreatywne. Mocny model (np. Claude Sonnet albo GPT-4) ocenia wynik mniejszego modelu docelowego. W n8n konfigurujesz to wprost w węźle Evaluation, korzystając z wbudowanych metryk:

  • Poprawność (oparta na AI) — ocenia w skali 1–5, czy znaczenie odpowiedzi zgadza się z referencją.
  • Pomocność (oparta na AI) — ocenia w skali 1–5, czy odpowiedź odnosi się do zapytania.
  • Własne metryki — zdefiniuj własne kryteria, np. „czy AI utrzymało formalny ton?".

2. Ewaluacja RAG i workflow agentowych

Jeśli Twój proces korzysta z RAG albo wywołań narzędzi, musisz ocenić cały system. Metryka Tools Used w n8n sprawdza, czy agent poprawnie uruchomił właściwe narzędzie, a Poprawność (oparta na AI) potwierdza, że pobrana treść zgadza się z prawdą referencyjną.

3. Metryki ilościowe i deterministyczne

Dają jednoznaczne punkty danych uzupełniające oceny jakościowe:

  • Liczba tokenów — śledzenie kosztu w czasie.
  • Czas wykonania — monitorowanie wpływu opóźnień na doświadczenie użytkownika.
  • Kategoryzacja — zwraca 1 przy trafieniu, 0 przy pudle. Idealne do zadań klasyfikacyjnych.
  • Podobieństwo napisów — wyłapuje drobne błędy formatowania bez karania semantycznie poprawnych odpowiedzi.

4. Ewaluacja bezpieczeństwa i polityk z Guardrails

Węzeł Guardrails pozwala walidować wejścia i wyjścia w czasie rzeczywistym — sprawdzając toksyczność, dane osobowe albo własne polityki treści — i kierować nieudane przypadki do agentów zapasowych lub przeglądu przez człowieka.

Budowa ewaluacji analizy sentymentu krok po kroku

Żeby to skonkretyzować, oto jak zbudować framework ewaluacyjny dla procesu analizy sentymentu, który kategoryzuje przychodzące maile jako pozytywne, neutralne lub negatywne.

Krok 1: przygotuj prawdę referencyjną w Data Tables

Skorzystaj z funkcji Data Table w n8n, żeby stworzyć zbiór testowy. Celuj w trudne przypadki brzegowe:

  • Frustracja konkurencją — negatywny język, ale pozytywna intencja (chcą przejść do Ciebie).
  • Sarkazm — „Byłem zachwycony, gdy mój pipeline zamarzł na sześć godzin".
  • Sygnały mieszane — drobny komplement schowany w środku poważnej reklamacji.

Tabela powinna mieć kolumnę expected (prawda referencyjna) i kolumnę result (wypełnianą podczas przebiegów ewaluacji).

Krok 2: zbuduj workflow ewaluacyjny

Pobierz wszystkie rekordy z tabeli, przejdź po nich pętlą i przekaż każdy do węzła analizy sentymentu. Użyj węzła Check if Evaluating, żeby rozdzielić proces na dwie ścieżki:

  • Ścieżka ewaluacji — zapisuj wyniki z powrotem do tabeli, licz metryki.
  • Ścieżka produkcyjna — kieruj maile do odpowiedniego zespołu sprzedaży jak zwykle.

Zapobiega to „skażeniu testami", np. przypadkowemu wysłaniu zespołowi sprzedaży 50 przypadków testowych.

Krok 3: policz metryki

Skorzystaj z opcji Set Metrics w węźle Evaluation i wybierz wbudowaną metrykę Categorization. Zwraca 1 przy poprawnej klasyfikacji i 0 przy pomyłce — dokładnie to, czego potrzeba do śledzenia trafności.

💡 Precyzję, czułość i miarę F1 możesz policzyć przez opcję Custom Metrics.

Krok 4: uruchom i porównaj

Uruchamiaj ewaluacje z płótna albo korzystaj z zakładki Evaluations, żeby zobaczyć wykres metryk w czasie. W prawdziwym teście porównującym trzy modele Gemini na 10 trudnych przypadkach:

ModelTrafnośćCzas wykonania
Gemini 3 Pro100%~30 sekund
Gemini 2.5 Flash100%~1,6 sekundy
Gemini 2.5 Flash Lite100%~650 ms

Wszystkie trzy przeszły — ale Flash Lite był 46 razy szybszy niż Pro. Na tym polega siła frameworka ewaluacyjnego: decydujesz na podstawie danych, a nie założeń.

Dobre praktyki

  • Zawsze oddzielaj ewaluację od logiki produkcyjnej węzłem Check if Evaluating.
  • Zbuduj „złoty zbiór" z realnymi przypadkami brzegowymi i historycznymi wpadkami.
  • Łącz metryki jakościowe i ilościowe — sama szybkość nie opowiada całej historii.
  • Izoluj jedną zmienną naraz — nie podmieniaj modelu i promptu jednocześnie.
  • Okresowo audytuj swojego sędziego LLM — nie jest nieomylny, a jego prompt systemowy może wymagać dostrojenia.

Podsumowanie

Budując framework ewaluacyjny bezpośrednio w n8n, przechodzisz od zgadywania do wiedzy. Wyłapujesz regresje, zanim trafią na produkcję, mierzysz wpływ każdej zmiany promptu i obiektywnie porównujesz modele pod kątem kosztu i wydajności.

Zacznij od małego, zbuduj pierwszy zbiór testowy — i udanej automatyzacji!