Jak działa ocena AI w TenderYeti

Metodologia — stan na sierpień 2026

Ta strona wyjaśnia, jak oceniamy trafność każdego napływającego przetargu publicznego względem Państwa działalności. Jest techniczna i uczciwa — mówimy, jakich modeli używamy, jakie dane dokąd trafiają i gdzie leżą rzeczywiste ograniczenia systemu. Jeśli porównują Państwo TenderYeti z konkurencją, to jest strona, którą warto przeczytać.

1. Co właściwie oznacza „ocena trafności”

Każdy zaindeksowany przetarg otrzymuje ocenę od 0,00 do 1,00 względem opisu działalności, który ustawiają Państwo w swoim koncie prostym językiem. Ocena 0,85 oznacza, że AI jest przekonana o dopasowaniu; 0,15 — że z przekonaniem je wyklucza. Codzienny e-mail z podsumowaniem jest filtrowany progiem, który Państwo kontrolują (domyślnie 0,60) — to Państwo decydują, ile szumu przepuścić.

Ocena jest względna wobec opisu Państwa działalności — nie jest to bezwzględna ocena jakości przetargu. To samo ogłoszenie może dostać 0,9 u dostawcy CMMS i 0,05 u firmy budowlanej.

2. Co AI faktycznie czyta

Dla każdego przetargu wysyłamy do LLM pełną treść ogłoszenia (tytuł + opis + zamawiający + typ ogłoszenia + kraj + kategoria zamówienia + szacunkowa wartość, o ile jest podana), a nie tylko tytuł. To istotne, bo duża część trafnych przetargów ma tytuły ogólnikowe („Usługi informatyczne — umowa ramowa”), a faktyczny przedmiot zamówienia kryje się w sekcji wymagań.

Analiza pełnej treści to powód, dla którego wychwytujemy przetargi, które umykają wyszukiwaniu słów kluczowych. To także realna przewaga oceny AI — nie da się jej odtworzyć alertem zapisanego wyszukiwania na TED czy SAM.gov.

3. Dwustopniowa weryfikacja LLM

Każdy przetarg przechodzi najpierw przez szybki model podstawowy. Ogłoszenia z jednoznacznym werdyktem (ocena ≤ 0,40 lub ≥ 0,70) są rozstrzygane na tym etapie. Ogłoszenia z pasma niepewności (0,40–0,69) są oceniane ponownie przez drugi, większy model weryfikujący. Daje to przepustowość małego modelu w łatwych przypadkach oraz osąd większego modelu w przypadkach granicznych — tych ~15% ogłoszeń, gdzie błędna ocena rzeczywiście kosztuje przegapioną szansę.

Oba modele widzą ten sam prompt: opis Państwa działalności, treść przetargu oraz ustrukturyzowane polecenia zwrócenia oceny, jednozdaniowego uzasadnienia i listy dopasowanych słów kluczowych. Uzasadnienie jest przechowywane razem z oceną, dzięki czemu widzą Państwo, dlaczego AI oceniła przetarg tak, a nie inaczej, a niezgodę można zgłosić z poziomu panelu.

4. Dopasowanie wielojęzyczne

Opis działalności piszą Państwo w jednym języku (zwykle po angielsku). Przetargi napływają w ponad 20 językach — niemieckim, francuskim, hiszpańskim, portugalskim, włoskim, niderlandzkim, polskim, rosyjskim, tureckim, arabskim i innych. Tę rozbieżność rozwiązujemy na dwa sposoby:

5. Priorytet ustawień użytkownika

W planie Pro każdy użytkownik w ramach konta może nadpisać wspólny prompt AI własnym. Starszy partner śledzący umowy ramowe powyżej 10 mln USD i młodszy analityk śledzący transakcyjne zapytania ofertowe w tym samym zespole widzą różne oceny tego samego przetargu, bo każdy widzi ocenę wygenerowaną względem własnego opisu działalności. Warstwa oceniająca wykonuje podwójne złączenie, tak by własna ocena użytkownika wygrywała z oceną domyślną konta.

6. Czego NIE robimy (i czego nie będziemy twierdzić)

7. Z jakiego dostawcy modeli korzystamy

Obecnie model podstawowy i weryfikujący to samodzielnie hostowane modele instrukcyjne o otwartych wagach (rodzina Qwen 2.5), działające na naszej własnej infrastrukturze GPU. Daje to kontrolę nad kosztami i prywatnością (brak uzależnienia od dostawcy, brak rozliczeń za token) oraz możliwość wymiany modeli bez przepisywania integracji. Gdy korzystamy z dostawców zewnętrznych (tłumaczenia, mechanizmy awaryjne), wysyłamy wyłącznie publiczny tekst przetargu oraz Państwa angielską listę słów kluczowych — nigdy dane konta ani dane rozliczeniowe. Lista podmiotów przetwarzających znajduje się w Polityce prywatności.

8. Jak obchodzimy się z błędami

Każdy użytkownik może z poziomu panelu zgłosić werdykt AI dla przetargu („oceniony wysoko, ale nietrafny” albo „oceniony nisko, a złożyłbym ofertę”). Zgłoszenia trafiają do wewnętrznej kolejki weryfikacji. Okresowo analizujemy zgłoszone przetargi w poszukiwaniu systematycznych luk — zwykle to brak w rozszerzeniach słów kluczowych albo zbyt ogólny opis działalności. Dostrajamy wielojęzyczny słownik i wskazówki promptu na podstawie prawdziwych informacji zwrotnych, nie syntetycznych benchmarków.

9. Świeżość danych

Nowe przetargi trafiają do indeksu i są oceniane zwykle w ciągu minut od publikacji na portalu źródłowym. Portale z cyklem aktualizacji godzinnym lub dziennym wyznaczają tu granicę — możemy być tylko tak świezi jak źródło. Codzienny e-mail z podsumowaniem wychodzi o wybranej przez Państwa godzinie (domyślnie 06:00 w strefie czasowej konta) ze wszystkim, co zostało ocenione od poprzedniego podsumowania.

Pytania o metodologię? Contact us at [email protected]. We answer technical evaluation questions in detail — a serious buyer deserves a serious answer.