AI
01.10.2026
Autorzy:

Sztuka wyboru odpowiedniego modelu. Dlaczego stworzyliśmy Commerce & Enterprise Benchmark (CEB) 

Wybór modelu AI do systemów produkcyjnych rzadko sprowadza się do prostego porównania wykresów w publicznych rankingach. Marketingowe obietnice dostawców i akademickie testy rzadko dają odpowiedź na kluczowe pytania: jak dany LLM poradzi sobie z naszymi zadaniami, ile będzie kosztować realizacja zadań i jakiej wartości będą dane wyjściowe. Ewaluacja staje się wartościowa dopiero wtedy, gdy odzwierciedla nasze środowisko, w którym dany system ma pracować, gdy operuje problemami i zestawami danych zbieżnych z naszymi potrzebami. 

Commerce & Enterprise Benchmark (w skrócie CEB) adresuje te wyzwania w jednym pakiecie ewaluacyjnym. Zapewnia powtarzalny sposób badania możliwości i ograniczeń systemów sztucznej inteligencji przy użyciu zadań istotnych dla rozwiązań Commerce&Enterprise.  

Dlaczego stworzyliśmy własny benchmark AI? 

CEB to narzędzie, które stworzyliśmy na wewnętrzne potrzeby, aby powtarzalnie badać rzeczywiste możliwości modeli, agentów oraz harnessów, w codziennej pracy inżynieryjnej w Univio. Dziś otwieramy je i dzielimy się wnioskami na zewnątrz. 

Duża część istniejących benchmarków opiera się na danych syntetycznych oraz na zbiorach publicznych. Nie jest zaskoczeniem, że modele są trenowane na tych samych danych. W wielu przypadkach modele zajmują wysokie miejsce w zestawieniach tylko dlatego, że nauczyły się pytań na pamięć podczas treningu (tj. data contamination, czyli przeciek zadań do zbiorów treningowych) co sprawiło, że publiczne benchmarki mierzą pamięć modeli, a nie ich zdolność wnioskowania. 

Świetny wynik w SWEBench, MMLU czy GSM8K nie przekłada się na to, czy model poprawnie odmieni polskie nazwisko, będzie pracował efektywnie z Jirą i Hubspot albo nie zaburzy spójności dokumentu po 10 edycjach. 

Publiczne leaderboardy i CEB operują w różnych domenach. Te pierwsze bardzo często mierzą uniwersalne kompetencje akademickie. My testujemy odporność modeli na specyficzne wyzwania architektury Enterprise.

Czym jest CEB?  

To zamknięty zbiór zadań, wyselekcjonowanych z rzeczywistych problemów na które napotkali pracownicy Univio oraz nasi Partnerzy. Architektura testu bazuje na Inspect AI od UK AI Safety Institute, a zadania programistyczne uruchamiane są w izolowanych sandboxach.

Co dokładnie badamy? 

Stosujemy szereg wymiarów ewaluacji: 

  • Zadań językowych: deklinacja, ortografia, interpunkcja, znajomość słownictwa, weryfikowane niezależnie dla języka polskiego, angielskiego i niemieckiego. 
  • Długi kontekst i spójność edycji, działania multimodalne, działania z zadaniami które przekraczają dopuszczalny rozmiar kontekstu. 
  • Praca z danymi, narzędziami biznesowymi i integracjami technicznymi, np. Jira, Confluence, HubSpot, Excel. 
  • Praca z danymi ustrukturyzowanymi i kontraktami. 
  • Walidacja faktów – testy wiedzy identyfikujące knowledge cut-off oraz specjalistyczną wiedzę domenową. 
  • Programowanie i automatyzacja: na ten moment analizowana w językach JS, Python, PHP. 

Dzięki prywatnemu charakterowi benchmarku dane testowe nie trafiają do publicznych korpusów treningowych. Nie stosujemy danych syntetycznych, opieramy się na prawdziwych problemach, zanonimizowanych i zamkniętych w przypadkach testowych. 

Oprócz punktowania wyniku, wyliczamy też ilość zużytych tokenów oraz ich koszt. Rejestrujemy czas działania testu, ale nie bierzemy go pod uwagę w rankingach – nie uważamy tego za miarodajny wymiar w sytuacji, gdy inferencja jest realizowana przez sieć. Dążymy do obiektywnego pomiaru rzeczywistych kompetencji modeli w zastosowaniach komercyjnych. 

Czego CEB nie robi? 

Nie traktujemy naszego benchmarku jako uniwersalnego rankingu do każdego zastosowania. Mamy też świadomość jego obecnych ograniczeń, przykładowo baza zadań dla języka niemieckiego jest na razie zbyt skromna do wyciągania wiążących wniosków, ale stale ją rozbudowujemy. 

Nie szukamy też modelu idealnego do wszystkiego. Szukamy rozwiązań optymalnych dla konkretnych zastosowań i budżetów.

Na bieżąco sprawdzamy wydajność modeli AI w różnych scenariuszach i branżach. Jeśli ciekawi Cię, jak radzą sobie te, z których korzystasz w swojej firmie, to chętnie zderzymy nasze obserwacje z Twoją branżą i potrzebami. 

Zainteresował Cię ten temat? Zapraszamy do kontaktu z naszymi Architektami!

Nasi eksperci
/ Dzielą się wiedzą

Ekspercka wiedza
dla Twojego biznesu

Jak widać, przez lata zdobyliśmy ogromną wiedzę - i uwielbiamy się nią dzielić! Porozmawiajmy o tym, jak możemy Ci pomóc.

Napisz do nas

<dialogue.opened>