Jak działa ocena AI w TenderYeti
Metodologia — stan na sierpień 2026
Ta strona wyjaśnia, jak oceniamy trafność każdego napływającego przetargu publicznego względem Państwa działalności. Jest techniczna i uczciwa — mówimy, jakich modeli używamy, jakie dane dokąd trafiają i gdzie leżą rzeczywiste ograniczenia systemu. Jeśli porównują Państwo TenderYeti z konkurencją, to jest strona, którą warto przeczytać.
1. Co właściwie oznacza „ocena trafności”
Każdy zaindeksowany przetarg otrzymuje ocenę od 0,00 do 1,00 względem opisu działalności, który ustawiają Państwo w swoim koncie prostym językiem. Ocena 0,85 oznacza, że AI jest przekonana o dopasowaniu; 0,15 — że z przekonaniem je wyklucza. Codzienny e-mail z podsumowaniem jest filtrowany progiem, który Państwo kontrolują (domyślnie 0,60) — to Państwo decydują, ile szumu przepuścić.
Ocena jest względna wobec opisu Państwa działalności — nie jest to bezwzględna ocena jakości przetargu. To samo ogłoszenie może dostać 0,9 u dostawcy CMMS i 0,05 u firmy budowlanej.
2. Co AI faktycznie czyta
Dla każdego przetargu wysyłamy do LLM pełną treść ogłoszenia (tytuł + opis + zamawiający + typ ogłoszenia + kraj + kategoria zamówienia + szacunkowa wartość, o ile jest podana), a nie tylko tytuł. To istotne, bo duża część trafnych przetargów ma tytuły ogólnikowe („Usługi informatyczne — umowa ramowa”), a faktyczny przedmiot zamówienia kryje się w sekcji wymagań.
Analiza pełnej treści to powód, dla którego wychwytujemy przetargi, które umykają wyszukiwaniu słów kluczowych. To także realna przewaga oceny AI — nie da się jej odtworzyć alertem zapisanego wyszukiwania na TED czy SAM.gov.
3. Dwustopniowa weryfikacja LLM
Każdy przetarg przechodzi najpierw przez szybki model podstawowy. Ogłoszenia z jednoznacznym werdyktem (ocena ≤ 0,40 lub ≥ 0,70) są rozstrzygane na tym etapie. Ogłoszenia z pasma niepewności (0,40–0,69) są oceniane ponownie przez drugi, większy model weryfikujący. Daje to przepustowość małego modelu w łatwych przypadkach oraz osąd większego modelu w przypadkach granicznych — tych ~15% ogłoszeń, gdzie błędna ocena rzeczywiście kosztuje przegapioną szansę.
Oba modele widzą ten sam prompt: opis Państwa działalności, treść przetargu oraz ustrukturyzowane polecenia zwrócenia oceny, jednozdaniowego uzasadnienia i listy dopasowanych słów kluczowych. Uzasadnienie jest przechowywane razem z oceną, dzięki czemu widzą Państwo, dlaczego AI oceniła przetarg tak, a nie inaczej, a niezgodę można zgłosić z poziomu panelu.
4. Dopasowanie wielojęzyczne
Opis działalności piszą Państwo w jednym języku (zwykle po angielsku). Przetargi napływają w ponad 20 językach — niemieckim, francuskim, hiszpańskim, portugalskim, włoskim, niderlandzkim, polskim, rosyjskim, tureckim, arabskim i innych. Tę rozbieżność rozwiązujemy na dwa sposoby:
- Rozszerzanie słów kluczowych. Utrzymujemy starannie dobrany słownik ponad 2 660 tłumaczeń typowych słów kluczowych zespołów ofertowych w 20 językach. Angielskie hasło „permit to work” dopasuje też „Arbeitserlaubnis”, „permis de travail”, „permesso di lavoro”, „разрешение на работу” itd. Nowe słowa kluczowe są tłumaczone automatycznie w locie przez wewnętrznie hostowany model NMT i zapisywane w pamięci podręcznej.
- Pełnotekstowy filtr wstępny. Zanim LLM w ogóle spojrzy na przetarg, filtrujemy go wielojęzycznym zestawem słów kluczowych na poziomie PostgreSQL — to zgrubna bramka „czy to w ogóle może być trafne?”. Ogłoszenia, które przejdą, trafiają do LLM na właściwą ocenę. Dzięki temu przetwarzamy ponad 500 000 przetargów dziennie bez wyczerpywania budżetu AI.
5. Priorytet ustawień użytkownika
W planie Pro każdy użytkownik w ramach konta może nadpisać wspólny prompt AI własnym. Starszy partner śledzący umowy ramowe powyżej 10 mln USD i młodszy analityk śledzący transakcyjne zapytania ofertowe w tym samym zespole widzą różne oceny tego samego przetargu, bo każdy widzi ocenę wygenerowaną względem własnego opisu działalności. Warstwa oceniająca wykonuje podwójne złączenie, tak by własna ocena użytkownika wygrywała z oceną domyślną konta.
6. Czego NIE robimy (i czego nie będziemy twierdzić)
- Nie publikujemy skalibrowanej wartości precision/recall. Nie przeprowadziliśmy badania z niezależnym panelem. Każdy, kto twierdzi „94,7% skuteczności” bez publicznej metodologii ewaluacji, cytuje liczbę, którą sam wymyślił. Nasza też by taka była. Co możemy powiedzieć: wewnętrzne kontrole wyrywkowe z prawdziwymi klientami osiągają >90% precyzji przy progu 0,60 w niszach oprogramowania BHP i CMMS. Wyniki będą się różnić w zależności od branży.
- Nie trenujemy modeli na Państwa słowach kluczowych ani ocenach trafności. Opis działalności jest promptem, nie sygnałem treningowym. Nie dostrajamy niczego pod konkretnego klienta.
- Nie wysyłamy do LLM danych konta ani danych rozliczeniowych. Do dostawcy modelu trafia wyłącznie publiczny tekst przetargu oraz opis Państwa działalności.
- Nie gwarantujemy zera fałszywych odrzuceń. Przetarg oceniony przez AI na 0,30 nadal może być dla Państwa dopasowany. Dlatego panel pokazuje całe spektrum, nie tylko podsumowanie — podsumowanie to krótka lista, nie pełny obraz.
7. Z jakiego dostawcy modeli korzystamy
Obecnie model podstawowy i weryfikujący to samodzielnie hostowane modele instrukcyjne o otwartych wagach (rodzina Qwen 2.5), działające na naszej własnej infrastrukturze GPU. Daje to kontrolę nad kosztami i prywatnością (brak uzależnienia od dostawcy, brak rozliczeń za token) oraz możliwość wymiany modeli bez przepisywania integracji. Gdy korzystamy z dostawców zewnętrznych (tłumaczenia, mechanizmy awaryjne), wysyłamy wyłącznie publiczny tekst przetargu oraz Państwa angielską listę słów kluczowych — nigdy dane konta ani dane rozliczeniowe. Lista podmiotów przetwarzających znajduje się w Polityce prywatności.
8. Jak obchodzimy się z błędami
Każdy użytkownik może z poziomu panelu zgłosić werdykt AI dla przetargu („oceniony wysoko, ale nietrafny” albo „oceniony nisko, a złożyłbym ofertę”). Zgłoszenia trafiają do wewnętrznej kolejki weryfikacji. Okresowo analizujemy zgłoszone przetargi w poszukiwaniu systematycznych luk — zwykle to brak w rozszerzeniach słów kluczowych albo zbyt ogólny opis działalności. Dostrajamy wielojęzyczny słownik i wskazówki promptu na podstawie prawdziwych informacji zwrotnych, nie syntetycznych benchmarków.
9. Świeżość danych
Nowe przetargi trafiają do indeksu i są oceniane zwykle w ciągu minut od publikacji na portalu źródłowym. Portale z cyklem aktualizacji godzinnym lub dziennym wyznaczają tu granicę — możemy być tylko tak świezi jak źródło. Codzienny e-mail z podsumowaniem wychodzi o wybranej przez Państwa godzinie (domyślnie 06:00 w strefie czasowej konta) ze wszystkim, co zostało ocenione od poprzedniego podsumowania.