Come funziona il punteggio AI di TenderYeti
Metodologia aggiornata ad agosto 2026
Questa pagina spiega come valutiamo la rilevanza di ogni gara d'appalto pubblica in arrivo rispetto alla Sua attività. È tecnica e onesta — Le diciamo quali modelli usiamo, quali dati vanno dove e dove stanno i limiti reali del sistema. Se sta confrontando TenderYeti con un concorrente, questa è la pagina da leggere.
1. Cosa significa davvero "punteggio di rilevanza"
Ogni gara che indicizziamo riceve un punteggio tra 0,00 e 1,00 rispetto alla descrizione in linguaggio naturale della Sua attività impostata nel Suo account. Un punteggio di 0,85 significa che l'AI è sicura che la gara sia pertinente; 0,15 significa che è sicura del contrario. L'email di riepilogo giornaliera è filtrata da una soglia che controlla Lei (predefinita 0,60), quindi decide Lei quanto rumore lasciar passare.
Il punteggio è relativo alla descrizione della Sua attività — non è una valutazione assoluta della qualità della gara. Lo stesso bando può ottenere 0,9 per un fornitore di CMMS e 0,05 per un'impresa di costruzioni.
2. Cosa legge davvero l'AI
Per ogni gara inviamo all'LLM il testo completo del bando (titolo + descrizione + stazione appaltante + tipo di avviso + paese + categoria di appalto + valore stimato ove presente), non solo il titolo. È importante perché una parte considerevole delle gare rilevanti ha titoli generici ("Servizi software — accordo quadro") con l'oggetto reale sepolto nella sezione dei requisiti.
La lettura del testo completo è il motivo per cui intercettiamo gare che la ricerca per parole chiave perde. È anche il motivo per cui il punteggio AI è un vantaggio difendibile — non si può replicare con un avviso di ricerca salvata su TED o SAM.gov.
3. Revisione LLM a due livelli
Ogni gara passa prima attraverso un modello primario veloce. I bandi con un verdetto sicuro (punteggio ≤ 0,40 o ≥ 0,70) si chiudono a quel passaggio. I bandi che cadono nella fascia incerta (0,40–0,69) vengono rivalutati da un secondo modello di revisione, più grande. Così otteniamo la velocità di un modello piccolo sui casi facili più il giudizio di un modello grande sui casi limite — quel ~15% di bandi dove sbagliare il punteggio Le costa davvero un'opportunità persa.
Entrambi i modelli vedono lo stesso prompt: la descrizione della Sua attività, il contenuto della gara e istruzioni strutturate per produrre un punteggio, una motivazione in una frase e un elenco di parole chiave corrispondenti. La motivazione viene salvata insieme al punteggio, così può vedere perché l'AI ha valutato una gara in quel modo, e può segnalare i disaccordi dalla dashboard.
4. Corrispondenza multilingue
La descrizione della Sua attività è scritta in una lingua (di solito l'inglese). Le gare arrivano in più di 20 lingue — tedesco, francese, spagnolo, portoghese, italiano, olandese, polacco, russo, turco, arabo e altre. Gestiamo il divario in due modi:
- Espansione delle parole chiave. Manteniamo un dizionario curato con oltre 2.660 traduzioni delle parole chiave più comuni degli uffici gare in 20 lingue. La Sua parola chiave inglese "permit to work" corrisponde anche a "Arbeitserlaubnis", "permis de travail", "permesso di lavoro", "разрешение на работу", ecc. Le nuove parole chiave che aggiunge vengono tradotte al volo da un modello NMT ospitato internamente e messe in cache.
- Pre-filtro full-text. Prima che un LLM guardi una gara, filtriamo sull'insieme multilingue di parole chiave a livello PostgreSQL — una porta grossolana del tipo "potrebbe essere rilevante?". I bandi che passano vanno all'LLM per la valutazione vera e propria. Questo ci permette di elaborare oltre 500.000 gare al giorno senza esaurire il budget AI.
5. Precedenza per utente
Sul piano Pro, ogni utente di un tenant può sostituire il prompt AI condiviso con il proprio. Un partner senior che segue accordi quadro da oltre 10 M$ e un analista junior che segue RFQ transazionali nello stesso team vedono punteggi diversi per la stessa gara, perché ciascuno vede il punteggio generato rispetto alla propria descrizione dell'attività. Il livello di valutazione fa un doppio join, così il punteggio personale del richiedente prevale sul fallback del tenant.
6. Cosa NON facciamo (e non affermeremo)
- Non pubblichiamo un valore calibrato di precisione/richiamo. Non abbiamo condotto uno studio con un panel indipendente. Chiunque dichiari "accurato al 94,7%" senza una metodologia di valutazione pubblica sta citando un numero inventato. Anche il nostro lo sarebbe. Quello che possiamo dire: i controlli a campione interni con clienti reali raggiungono una precisione >90% alla soglia 0,60 nelle nicchie software HSE e CMMS. I risultati variano a seconda del settore.
- Non addestriamo i modelli sulle Sue parole chiave né sui Suoi giudizi di rilevanza. La descrizione della Sua attività è un prompt, non un segnale di addestramento. Non facciamo fine-tuning specifico per cliente.
- Non inviamo all'LLM i Suoi dati di account o di fatturazione. Al fornitore del modello vanno solo il testo pubblico della gara e la descrizione della Sua attività.
- Non garantiamo zero falsi negativi. Una gara che l'AI valuta 0,30 potrebbe comunque fare al caso Suo. Per questo la dashboard mostra l'intero spettro, non solo il riepilogo — il riepilogo è la rosa dei candidati, non il quadro completo.
7. Quale fornitore di modelli usiamo
Oggi i modelli primario e di revisione sono modelli open-weight instruction-tuned auto-ospitati (famiglia Qwen 2.5) sulla nostra infrastruttura GPU. Questo ci dà controllo dei costi, controllo della privacy (nessun vincolo di fornitore, nessuna bolletta per token) e la possibilità di sostituire i modelli senza riscrivere le integrazioni. Quando usiamo provider esterni (traduzione, fallback), gli unici dati inviati sono il testo pubblico della gara e il Suo elenco di parole chiave in inglese — mai dati di account o di fatturazione. L'elenco dei sub-responsabili è nell'Informativa sulla privacy.
8. Come gestiamo gli errori
Ogni utente può segnalare dalla dashboard il verdetto AI di una gara ("punteggio alto ma irrilevante" oppure "punteggio basso ma avrei partecipato"). Le segnalazioni finiscono in una coda di revisione interna. Ispezioniamo periodicamente le gare segnalate per individuare lacune sistematiche — di solito una mancanza nell'espansione delle parole chiave o una descrizione dell'attività troppo generica. Regoliamo il dizionario multilingue e le indicazioni del prompt sulla base di feedback reale, non di benchmark sintetici.
9. Freschezza dei dati
Le nuove gare entrano nell'indice e vengono valutate in genere entro pochi minuti dalla pubblicazione sul portale di origine. I portali con cicli di aggiornamento orari o giornalieri pongono un limite — possiamo essere freschi solo quanto la fonte. La Sua email di riepilogo giornaliera parte all'orario che sceglie Lei (predefinito 06:00, fuso orario del tenant) con tutto ciò che è stato valutato dopo il riepilogo precedente.