Hoe de AI-scoring van TenderYeti werkt
Methodologie per augustus 2026
Deze pagina legt uit hoe we elke binnenkomende overheidsaanbesteding scoren op relevantie voor uw bedrijf. Hij is technisch en eerlijk — we vertellen u welke modellen we gebruiken, welke data waarheen gaat en waar de echte beperkingen van het systeem liggen. Evalueert u TenderYeti tegenover een concurrent, dan is dit de pagina om te lezen.
1. Wat de "relevantiescore" werkelijk betekent
Elke aanbesteding die we indexeren krijgt een score tussen 0,00 en 1,00 ten opzichte van de bedrijfsbeschrijving in natuurlijke taal die u in uw account instelt. Een score van 0,85 betekent dat de AI er vertrouwen in heeft dat de aanbesteding past; 0,15 betekent met vertrouwen niet. Uw dagelijkse overzichtsmail wordt gefilterd op een drempel die u zelf beheert (standaard 0,60), dus u bepaalt hoeveel ruis u doorlaat.
De score is relatief aan uw bedrijfsbeschrijving — geen absolute kwaliteitsbeoordeling van de aanbesteding. Dezelfde aankondiging kan 0,9 scoren voor een CMMS-leverancier en 0,05 voor een bouwbedrijf.
2. Wat de AI daadwerkelijk leest
Voor elke aanbesteding sturen we de LLM de volledige aankondigingstekst (titel + beschrijving + aanbestedende dienst + type aankondiging + land + inkoopcategorie + geraamde waarde indien aanwezig), niet alleen de titel. Dat is belangrijk, want een groot deel van de relevante aanbestedingen heeft een generieke titel ("Softwarediensten — raamovereenkomst") terwijl de eigenlijke intentie in de eisenparagraaf verstopt zit.
Het lezen van de volledige tekst is waarom we aanbestedingen vangen die trefwoordzoekopdrachten missen. Het is ook waarom AI-scoring een verdedigbaar voordeel is — u kunt het niet nabouwen met een opgeslagen zoekalert op TED of SAM.gov.
3. Tweetraps-LLM-review
Elke aanbesteding gaat eerst door een snel primair model. Aankondigingen met een stellig oordeel (score ≤ 0,40 of ≥ 0,70) worden bij die stap afgehandeld. Aankondigingen in de onzekere band (0,40–0,69) worden opnieuw gescoord door een tweede, groter reviewmodel. Zo krijgen we de doorvoer van een klein model op de makkelijke gevallen plus het oordeel van een groter model op de twijfelgevallen — de ~15% van de aankondigingen waar een verkeerde score u daadwerkelijk een gemiste kans kost.
Beide modellen zien dezelfde prompt: uw bedrijfsbeschrijving, de aanbestedingsinhoud en gestructureerde instructies om een score plus een onderbouwing in één zin plus een lijst van gematchte trefwoorden te geven. De onderbouwing wordt naast de score opgeslagen zodat u kunt zien waarom de AI een aanbesteding zo beoordeelde, en u kunt oneens zijn en dat vanuit het dashboard melden.
4. Meertalige matching
Uw bedrijfsbeschrijving is in één taal geschreven (meestal Engels). Aanbestedingen komen binnen in 20+ talen — Duits, Frans, Spaans, Portugees, Italiaans, Nederlands, Pools, Russisch, Turks, Arabisch en meer. We overbruggen die kloof op twee manieren:
- Trefwoorduitbreiding. We onderhouden een gecureerd woordenboek van 2.660+ vertalingen van gangbare bidteam-trefwoorden in 20 talen. Uw Engelse trefwoord "permit to work" matcht ook "Arbeitserlaubnis", "permis de travail", "permesso di lavoro", "разрешение на работу", enz. Nieuwe trefwoorden die u toevoegt worden on-the-fly automatisch vertaald via een intern gehost NMT-model en gecachet.
- Volledige-tekst-voorfilter. Voordat een LLM ooit naar een aanbesteding kijkt, filteren we op de meertalige trefwoordenset op PostgreSQL-niveau — een grove "zou dit relevant kunnen zijn?"-poort. Aankondigingen die daar doorheen komen, gaan naar de LLM voor de eigenlijke scoring. Zo kunnen we 500.000+ aanbestedingen per dag verwerken zonder het AI-budget uit te putten.
5. Voorrang per gebruiker
Op het Pro-abonnement kan elke gebruiker binnen een tenant de gedeelde AI-prompt overschrijven met een eigen prompt. Een senior partner die raamovereenkomsten van $ 10M+ volgt en een junior analist die transactionele RFQ's volgt in hetzelfde team zien verschillende scores voor dezelfde aanbesteding, omdat ieder de score ziet die tegen de eigen bedrijfsbeschrijving is gegenereerd. De scoringslaag doet een dubbele join zodat de eigen score van de aanvrager wint van de tenant-fallback.
6. Wat we NIET doen (en niet zullen claimen)
- We publiceren geen gekalibreerd precision/recall-cijfer. We hebben geen studie met een onafhankelijk panel uitgevoerd. Wie "94,7% nauwkeurig" claimt zonder publieke evaluatiemethodologie, citeert een verzonnen getal. Het onze zou dat ook zijn. Wat we wél kunnen zeggen: interne steekproeven met echte klanten halen >90% precisie bij drempel 0,60 in de niches HSE-software en CMMS. Uw resultaten zullen per domein verschillen.
- We trainen niet op uw trefwoorden of op uw relevantie-oordelen. Uw bedrijfsbeschrijving is een prompt, geen trainingssignaal. We finetunen niets klantspecifieks.
- We sturen uw account- of factuurgegevens niet naar de LLM. Alleen de publieke aanbestedingstekst plus uw bedrijfsbeschrijving gaan naar de modelaanbieder.
- We garanderen geen nul valse negatieven. Een aanbesteding die de AI 0,30 geeft, kan alsnog bij u passen. Daarom toont het dashboard het hele spectrum, niet alleen de digest — de digest is de shortlist, niet het hele beeld.
7. Welke modelaanbieder we gebruiken
Momenteel zijn het primaire + reviewmodel zelf-gehoste open-weight instructiemodellen (Qwen 2.5-familie) op onze eigen GPU-infrastructuur. Dat geeft ons kostencontrole, privacycontrole (geen vendor lock-in, geen rekening per token) en de mogelijkheid om modellen te wisselen zonder integraties te herschrijven. Wanneer we wél gehoste aanbieders gebruiken (vertaling, fallbacks), is de enige verzonden data de publieke aanbestedingstekst plus uw Engelse trefwoordenlijst — nooit account- of factuurgegevens. Onze lijst van subverwerkers staat in het Privacybeleid.
8. Hoe we met fouten omgaan
Elke gebruiker kan het AI-oordeel over een aanbesteding vanuit het dashboard markeren ("deze scoorde hoog maar is irrelevant" of "deze scoorde laag maar ik zou hebben ingeschreven"). Meldingen belanden in een interne reviewwachtrij. We inspecteren gemarkeerde aanbestedingen periodiek om systematische gaten te vinden — meestal een gemiste trefwoorduitbreiding of een te generieke bedrijfsbeschrijving. We stemmen het meertalige woordenboek en de promptrichtlijnen af op echte feedback, niet op synthetische benchmarks.
9. Actualiteit van de data
Nieuwe aanbestedingen staan doorgaans binnen enkele minuten na publicatie op het bronportaal in de index en zijn dan gescoord. Portalen met uur- of dagcycli begrenzen dit — we kunnen slechts zo vers zijn als de bron. Uw dagelijkse overzichtsmail wordt verstuurd op het door u gekozen tijdstip (standaard 06:00 tenant-tijdzone) met alles wat sinds de vorige digest is gescoord.