Comment fonctionne la notation IA de TenderYeti
Méthodologie en date d'août 2026
Cette page explique comment nous notons chaque appel d'offres entrant selon sa pertinence pour votre activité. Elle est technique et honnête — nous vous disons quels modèles nous utilisons, quelles données vont où, et où se situent les vraies limites du système. Si vous évaluez TenderYeti face à un concurrent, c'est la page à lire.
1. Ce que signifie vraiment le « score de pertinence »
Chaque appel d'offres indexé reçoit un score entre 0,00 et 1,00 par rapport à la description d'entreprise en langage naturel définie dans votre compte. Un score de 0,85 signifie que l'IA est confiante que l'avis correspond ; 0,15 signifie qu'il ne correspond pas. Votre digest quotidien est filtré par un seuil que vous contrôlez (0,60 par défaut) — vous décidez du niveau de bruit à laisser passer.
Le score est relatif à votre description d'entreprise — ce n'est pas une note de qualité absolue de l'avis. Le même avis peut obtenir 0,9 pour un éditeur de GMAO et 0,05 pour une entreprise de construction.
2. Ce que l'IA lit réellement
Pour chaque avis, nous envoyons au LLM le corps complet (titre + description + acheteur + type d'avis + pays + catégorie d'achat + valeur estimée le cas échéant), pas seulement le titre. C'est essentiel : une grande partie des avis pertinents portent un titre générique (« Services logiciels — accord-cadre ») et l'intention réelle est enfouie dans la section des exigences.
La lecture du texte intégral est la raison pour laquelle nous trouvons des appels d'offres que la recherche par mots-clés rate. C'est aussi pourquoi la notation IA est un avantage défendable — impossible à répliquer avec une alerte de recherche enregistrée sur TED ou SAM.gov.
3. Revue LLM à deux niveaux
Chaque avis passe d'abord par un modèle primaire rapide. Les avis au verdict sûr (score ≤ 0,40 ou ≥ 0,70) sont réglés à cette étape. Ceux qui tombent dans la bande incertaine (0,40–0,69) sont re-notés par un second modèle de revue, plus grand. Cela combine le débit d'un petit modèle sur les cas faciles et le jugement d'un grand modèle sur les cas limites — les ~15 % d'avis où une erreur de score vous coûte réellement une opportunité.
Les deux modèles reçoivent le même prompt : votre description d'entreprise, le contenu de l'avis, et des instructions structurées pour produire un score, une justification en une phrase et une liste de mots-clés correspondants. La justification est stockée avec le score afin que vous voyiez pourquoi l'IA a noté un avis ainsi — et vous pouvez signaler vos désaccords depuis le tableau de bord.
4. Correspondance multilingue
Votre description d'entreprise est rédigée dans une langue (généralement l'anglais). Les avis arrivent dans plus de 20 langues — allemand, français, espagnol, portugais, italien, néerlandais, polonais, russe, turc, arabe et plus. Nous gérons ce décalage de deux manières :
- Expansion des mots-clés. Nous maintenons un dictionnaire de 2 660+ traductions des termes courants des équipes d'appels d'offres dans 20 langues. Votre mot-clé anglais « permit to work » correspond aussi à « Arbeitserlaubnis », « permis de travail », « permesso di lavoro », « разрешение на работу », etc. Les nouveaux mots-clés sont traduits à la volée par un modèle NMT hébergé en interne et mis en cache.
- Préfiltre plein texte. Avant qu'un LLM ne voie un avis, nous filtrons au niveau PostgreSQL sur l'ensemble multilingue des mots-clés — une porte grossière « cela pourrait-il être pertinent ? ». Ce qui passe va au LLM pour la notation réelle. Cela nous permet de traiter 500 000+ avis par jour sans épuiser le budget IA.
5. Priorité par utilisateur
Dans la formule Pro, chaque utilisateur d'une organisation peut remplacer le prompt IA partagé par le sien. Un associé senior qui suit des accords-cadres de 10 M$+ et un analyste junior qui suit des demandes de devis transactionnelles voient, dans la même équipe, des scores différents pour le même avis — chacun le score calculé sur sa propre description. La couche de notation fait une double jointure : le score propre de l'appelant l'emporte sur le repli de l'organisation.
6. Ce que nous ne faisons PAS (et ne prétendons pas)
- Nous ne publions pas de chiffre calibré de précision/rappel. Nous n'avons pas mené d'étude indépendante. Quiconque revendique « 94,7 % de précision » sans méthodologie d'évaluation publique cite un chiffre inventé. Le nôtre le serait aussi. Ce que nous pouvons dire : nos vérifications internes avec de vrais clients dépassent >90 % de précision au seuil 0,60 dans les niches logiciels HSE et GMAO. Vos résultats varieront selon le domaine.
- Nous n'entraînons rien sur vos mots-clés ni sur vos jugements de pertinence. Votre description d'entreprise est un prompt, pas un signal d'entraînement. Nous ne faisons aucun fine-tuning spécifique client.
- Nous n'envoyons pas vos données de compte ou de facturation au LLM. Seuls le texte public de l'avis et votre description d'entreprise vont au fournisseur de modèle.
- Nous ne garantissons pas zéro faux négatif. Un avis noté 0,30 par l'IA peut quand même vous convenir. C'est pourquoi le tableau de bord montre tout le spectre, pas seulement le digest — le digest est la shortlist, pas l'image complète.
7. Quel fournisseur de modèles nous utilisons
Aujourd'hui, les modèles primaire et de revue sont des modèles open-weight auto-hébergés (famille Qwen 2.5) sur notre propre infrastructure GPU. Cela nous donne le contrôle des coûts, le contrôle de la confidentialité (pas de dépendance fournisseur, pas de facturation au token) et la liberté de changer de modèle sans réécrire les intégrations. Quand nous utilisons des fournisseurs hébergés (traduction, replis), seuls le texte public de l'avis et votre liste de mots-clés en anglais sont transmis — jamais les données de compte ou de facturation. La liste de nos sous-traitants figure dans la Politique de confidentialité.
8. Comment nous gérons les erreurs
Chaque utilisateur peut signaler le verdict IA d'un avis depuis le tableau de bord (« noté haut mais hors sujet » ou « noté bas mais j'aurais soumissionné »). Ces signalements alimentent une file de revue interne. Nous inspectons régulièrement les avis signalés pour repérer les lacunes systématiques — le plus souvent un manque d'expansion de mots-clés ou une description d'entreprise trop générique. Nous ajustons le dictionnaire multilingue et les consignes de prompt sur la base de retours réels, pas de benchmarks synthétiques.
9. Fraîcheur des données
Les nouveaux avis arrivent généralement dans l'index et sont notés en quelques minutes après leur publication sur le portail source. Les portails à cycle horaire ou quotidien bornent ce délai — nous ne pouvons être plus frais que la source. Votre digest quotidien part à l'heure choisie (06:00 par défaut, fuseau de l'organisation) avec tout ce qui a été noté depuis le digest précédent.