Come funziona il punteggio AI di TenderYeti

Metodologia aggiornata ad agosto 2026

Questa pagina spiega come valutiamo la rilevanza di ogni gara d'appalto pubblica in arrivo rispetto alla Sua attività. È tecnica e onesta — Le diciamo quali modelli usiamo, quali dati vanno dove e dove stanno i limiti reali del sistema. Se sta confrontando TenderYeti con un concorrente, questa è la pagina da leggere.

1. Cosa significa davvero "punteggio di rilevanza"

Ogni gara che indicizziamo riceve un punteggio tra 0,00 e 1,00 rispetto alla descrizione in linguaggio naturale della Sua attività impostata nel Suo account. Un punteggio di 0,85 significa che l'AI è sicura che la gara sia pertinente; 0,15 significa che è sicura del contrario. L'email di riepilogo giornaliera è filtrata da una soglia che controlla Lei (predefinita 0,60), quindi decide Lei quanto rumore lasciar passare.

Il punteggio è relativo alla descrizione della Sua attività — non è una valutazione assoluta della qualità della gara. Lo stesso bando può ottenere 0,9 per un fornitore di CMMS e 0,05 per un'impresa di costruzioni.

2. Cosa legge davvero l'AI

Per ogni gara inviamo all'LLM il testo completo del bando (titolo + descrizione + stazione appaltante + tipo di avviso + paese + categoria di appalto + valore stimato ove presente), non solo il titolo. È importante perché una parte considerevole delle gare rilevanti ha titoli generici ("Servizi software — accordo quadro") con l'oggetto reale sepolto nella sezione dei requisiti.

La lettura del testo completo è il motivo per cui intercettiamo gare che la ricerca per parole chiave perde. È anche il motivo per cui il punteggio AI è un vantaggio difendibile — non si può replicare con un avviso di ricerca salvata su TED o SAM.gov.

3. Revisione LLM a due livelli

Ogni gara passa prima attraverso un modello primario veloce. I bandi con un verdetto sicuro (punteggio ≤ 0,40 o ≥ 0,70) si chiudono a quel passaggio. I bandi che cadono nella fascia incerta (0,40–0,69) vengono rivalutati da un secondo modello di revisione, più grande. Così otteniamo la velocità di un modello piccolo sui casi facili più il giudizio di un modello grande sui casi limite — quel ~15% di bandi dove sbagliare il punteggio Le costa davvero un'opportunità persa.

Entrambi i modelli vedono lo stesso prompt: la descrizione della Sua attività, il contenuto della gara e istruzioni strutturate per produrre un punteggio, una motivazione in una frase e un elenco di parole chiave corrispondenti. La motivazione viene salvata insieme al punteggio, così può vedere perché l'AI ha valutato una gara in quel modo, e può segnalare i disaccordi dalla dashboard.

4. Corrispondenza multilingue

La descrizione della Sua attività è scritta in una lingua (di solito l'inglese). Le gare arrivano in più di 20 lingue — tedesco, francese, spagnolo, portoghese, italiano, olandese, polacco, russo, turco, arabo e altre. Gestiamo il divario in due modi:

5. Precedenza per utente

Sul piano Pro, ogni utente di un tenant può sostituire il prompt AI condiviso con il proprio. Un partner senior che segue accordi quadro da oltre 10 M$ e un analista junior che segue RFQ transazionali nello stesso team vedono punteggi diversi per la stessa gara, perché ciascuno vede il punteggio generato rispetto alla propria descrizione dell'attività. Il livello di valutazione fa un doppio join, così il punteggio personale del richiedente prevale sul fallback del tenant.

6. Cosa NON facciamo (e non affermeremo)

7. Quale fornitore di modelli usiamo

Oggi i modelli primario e di revisione sono modelli open-weight instruction-tuned auto-ospitati (famiglia Qwen 2.5) sulla nostra infrastruttura GPU. Questo ci dà controllo dei costi, controllo della privacy (nessun vincolo di fornitore, nessuna bolletta per token) e la possibilità di sostituire i modelli senza riscrivere le integrazioni. Quando usiamo provider esterni (traduzione, fallback), gli unici dati inviati sono il testo pubblico della gara e il Suo elenco di parole chiave in inglese — mai dati di account o di fatturazione. L'elenco dei sub-responsabili è nell'Informativa sulla privacy.

8. Come gestiamo gli errori

Ogni utente può segnalare dalla dashboard il verdetto AI di una gara ("punteggio alto ma irrilevante" oppure "punteggio basso ma avrei partecipato"). Le segnalazioni finiscono in una coda di revisione interna. Ispezioniamo periodicamente le gare segnalate per individuare lacune sistematiche — di solito una mancanza nell'espansione delle parole chiave o una descrizione dell'attività troppo generica. Regoliamo il dizionario multilingue e le indicazioni del prompt sulla base di feedback reale, non di benchmark sintetici.

9. Freschezza dei dati

Le nuove gare entrano nell'indice e vengono valutate in genere entro pochi minuti dalla pubblicazione sul portale di origine. I portali con cicli di aggiornamento orari o giornalieri pongono un limite — possiamo essere freschi solo quanto la fonte. La Sua email di riepilogo giornaliera parte all'orario che sceglie Lei (predefinito 06:00, fuso orario del tenant) con tutto ciò che è stato valutato dopo il riepilogo precedente.

Domande sulla metodologia? Contact us at [email protected]. We answer technical evaluation questions in detail — a serious buyer deserves a serious answer.