Autorka tej propozycji, Angie Jones, przez lata była promotorką tradycyjnej piramidy automatyzacji. W artykule opublikowanym w lipcu przyznała jednak, że klasyczny schemat przestaje działać w starciu z agentami AI. Zamiast dzielić testy na znane do tej pory typy, nowa piramida porządkuje je według poziomu tolerancji na niepewność wyników.
Klasyczna piramida – przypomnienie
Klasyczna piramida automatyzacji, spopularyzowana przez Mike’a Cohna w książce „Succeeding with Agile” z 2009 roku (i promowana przez niego od około 2004 roku), to dobrze znany standard. U jej podstaw leżą testy jednostkowe, środek zajmuje warstwa usług, a wierzchołek testy UI. Główną zasadą jest to, że im wyższa warstwa, tym mniej piszemy testów, bo rośnie ich koszt, podatność na awarie i czas wykonania. Dążenie do ograniczenia testów interfejsu do minimum było głównym powodem, dla którego Cohn umieścił je na samym szczycie.
Źródło: https://www.mountaingoatsoftware.com/agile/the-forgotten-layer-of-the-test-automation-pyramid
Przez lata model ten działał jako uniwersalny punkt odniesienia. Ułatwiał zespołom rozmowy o pokryciu, kosztach i kompromisach bez potrzeby wracania do absolutnych podstaw. Jednocześnie jego sens regularnie podważano, dlatego najnowsza inicjatywa zmiany nie powinna być dla nikogo zaskoczeniem.
Zmiana założenia
Klasyczne podejście do testów wymaga stuprocentowej powtarzalności, co oznacza, że identycznym danym wejściowym odpowiada zawsze ten sam wynik. Agenty AI przełamują ten schemat przez niedeterminizm LLM-ów i wieloetapowe wywołania zewnętrznych narzędzi. Jak słusznie zauważa Angie Jones, prowadzi to do sytuacji dobrze znanej praktykom, w której wynik bywa technicznie bez zarzutu, ale z punktu widzenia biznesowego celu okazuje się kompletnie nietrafiony.
Narzucanie tu sztywnej klasyfikacji pass/fail wywołuje dwa efekty: niestabilność całego zestawu albo stopniowe usuwanie testów po cichu. Skoro tradycyjny podział utracił sens, strukturę trzeba zbudować na nowo. W proponowanym ujęciu kluczowym wyznacznikiem staje się margines tolerancji na niepewność wyników.
Propozycja nowego podziału warstw
Źródło: https://angiejones.tech/test-pyramid-for-ai-agents/
Podstawą nowej piramidy są elementy deterministyczne, czyli obszary wymagające bezwzględnej przewidywalności. Chodzi o klasyczne testy jednostkowe: weryfikację logiki ponawiania prób, limitów tur, schematów narzędzi czy delegowania zadań do subagentów. Zamiast jednak odwoływać się do żywych modeli, używa się mocków z przygotowanymi odpowiedziami. Ta warstwa jest szybka, tania i odporna na losowość, a przy tym ułatwia sprawdzanie scenariuszy awaryjnych. Jeśli pojawia się tu niestabilność, przyczyną jest defekt w kodzie aplikacji, a nie działanie AI.
Środek piramidy tworzy odtwarzalna rzeczywistość, stanowiąca odpowiednik testów integracyjnych. Agent komunikuje się tu z zewnętrznymi narzędziami i serwerami MCP, które zmieniają się przecież niezależnie od kodu zespołu. Z jednej strony mockowanie odcina nas od faktycznego zachowania systemu, z drugiej testy uruchamiane bezpośrednio na żywej infrastrukturze bardzo szybko tracą stabilność. Rozwiązaniem tego problemu jest nagranie realnej interakcji raz i odtwarzanie jej w pętli. W fazie nagrywania rejestruje się pełny ruch z żywym modelem i serwerami, by w procesie testowym operować już na bezpiecznej, powtarzalnej sesji. Asercje sprawdzają sekwencję wywoływanych narzędzi i logikę samego przepływu, a nie konkretny styl wypowiedzi AI.
Przy takim wyborze trzeba mieć na względzie pewne ograniczenia. Nagrana sesja nie uwzględni nowszych wersji modelu, jednak do weryfikacji reakcji własnego kodu na sensowną odpowiedź AI w zupełności to wystarcza.
Wyżej wchodzimy w obszar wydajności probabilistycznej i moment, w którym porzucamy klasyczne asercje na rzecz stałego pomiaru. Określonych zachowań agenta nie da się rzetelnie ocenić na podstawie jednej próby. Zespół uruchamia więc powtarzalne benchmarki po wiele razy i analizuje zagregowane dane. Skupia się na tym, czy agent doprowadził zadanie do końca, czy wybrać odpowiednie narzędzia i czy stworzył właściwe artefaktu. Zmienia się też rozumienie regresji: nie chodzi o to, że model odpowiedział inaczej niż wczoraj, ale o to, że spadła ogólna skuteczność systemu. O rzeczywistym stanie aplikacji świadczą wzorce, a nie jednostkowe wyniki.
Wierzchołek piramidy stanowi warstwa subiektywna nazywana vibes and judgment. To proces obecny w większości zespołów, choć rzadko formalizowany. Elementy tekstowe, takie jak streszczenia czy instrukcje, nie poddają się sztywnym szablonom. Rozwiązaniem stało się ustrukturyzowanie ocen: opracowano przejrzyste rubryki, a w rolę sędziego wcielono drugi model LLM. Prośba o weryfikację trafia do niego trzy razy, a ostateczny wynik ustala większość (przy braku jednomyślności decyduje czwarty głos). Taki zabieg zamienia subiektywne poczucie jakości w konkretny, mierzalny parametr.
Uzupełnieniem piramidy jest całościowy test typu smoke. Jego zadaniem jest sprawdzenie podstawowych funkcji agenta na pełnym procesie. System samodzielnie edytuje pliki, uruchamia komendy, rozpoznaje rozszerzenia, zarządza subagentami, wyłapuje defekty i przygotowuje raport. Porażka na tym etapie oznacza awarię krytycznego elementu. Warto też zwrócić uwagę na to, czego zespół postanowił nie robić. Testy angażujące żywy model LLM całkowicie wykluczono z potoku CI, uznając je za zbyt wolne, drogie i nieprzewidywalne. Przyjęto przejrzysty podział ról: CI weryfikuje deterministyczny fundament, benchmarki uruchamia się ręcznie, a ostateczną weryfikację jakości pozostawia się ludziom.
Pokrewne koncepcje
Tradycyjne podejście do testów od dawna dysponuje dwoma pojęciami, które odnoszą się do dokładnie tych samych wyzwań. Różnica polega na tym, że ujmują je w osobne ramy.
Pierwszym z nich jest testowanie oparte na ryzyku. Zamiast testować wszystko z jednakową siłą, kieruje ono zasoby tam, gdzie ryzyko jest największe, traktując je jako iloczyn prawdopodobieństwa awarii i jej skutków. Piramida Jones opiera się na dokładnie tym samym schemacie, zmienia jednak jeden z elementów. W klasycznym podejściu pytamy: ile testować, skoro brakuje czasu na wszystko? U Jones pytanie brzmi: jak w ogóle mierzyć, skoro niepewność na kolejnych poziomach ma zupełnie inną naturę – od pełnej przewidywalności w kodzie po losowość przy ocenie jakości treści? Miejsce ryzyka biznesowego zajmuje tu niepewność poznawcza, ale logika budowania warstw wywodzi się wprost z dobrze znanych zasad.
Drugim filarem jest testowanie eksploracyjne, zdefiniowane przez Cema Kanera i rozwinięte przez Jamesa Bacha jako jednoczesny proces uczenia się, projektowania i wykonywania testów. Szkoła eksploracyjna od początku odrzucała sztywny wzorzec odpowiedzi na rzecz osądu opartego na heurystykach. Warstwa vibes and judgment realizuje te zasady wprost. Przyjmuje, że weryfikacja jakości bywa procesem subiektywnej oceny, i nadaje tej ocenie powtarzalną formę. Rubryka oceny u Jones spełnia tu tę samą rolę, co karty testowe i heurystyki w eksploracji, czyli porządkują ludzki osąd, zamiast go sztucznie eliminować.
Te dwie koncepcje spotkały się zresztą już wcześniej i to w dosłownym wydaniu. Kaner i Bach opublikowali w 2004 roku wspólne materiały zatytułowane „Exploratory & Risk-Based Testing”. Było to naturalne połączenie, ponieważ oba podejścia wynikają z faktu, że czas i zasoby są ograniczone, sztywny wzorzec odpowiedzi często nie istnieje, a rygor testów należy elastycznie dopasowywać do poziomu niepewności i stawki. Model Angie Jones spina te dawne idee w całość i ubiera we współczesny język agentów, używając pojęć takich jak mocki providerów, serwery MCP, ustrukturyzowane benchmarki czy modele w roli sędziów.
Podsumowanie
Zostaje pytanie, na które tekst Jones nie odpowiada, choć nasuwa się ono samo. W testowaniu eksploracyjnym osąd należał do testera: to człowiek poznawał produkt, projektował kolejne kroki i oceniał, czy widzi defekt. W warstwie vibes and judgment tę rolę przejmuje drugi model językowy, a człowiek jedynie układa rubrykę i zerka w wyniki w razie potrzeby. Autorka nazywa to formalizacją osądu i pod kątem powtarzalności ma rację. Pytanie tylko, czy osąd ujęty w ramy i przekazany modelowi to dalej ta sama czynność poznawcza, którą szkoła eksploracyjna stawiała w centrum pracy testera, czy już jej delegacja. Sama Jones zostawia w swoim systemie przestrzeń na ludzką walidację i nie wpuszcza modeli-sędziów do CI.
A gdzie tę granicę postawią zespoły, które wdrożą jej model bez podobnej powściągliwości? To się dopiero okaże.
Redakcja testerzy.pl





