TenderYetiのAIスコアリングの仕組み
2026年8月時点のメソドロジー
このページでは、受信するすべての政府入札案件を、御社との関連度でどのようにスコアリングしているかを説明します。技術的で、正直な内容です — 使用しているモデル、どのデータがどこへ送られるか、そしてシステムの実際の限界がどこにあるかをお伝えします。TenderYetiを競合製品と比較検討しているなら、まず読むべきページです。
1. 「関連度スコア」が実際に意味するもの
インデックス化されるすべての入札案件には、アカウントに設定した自然言語の事業内容に照らして0.00〜1.00のスコアが付きます。スコア0.85は、AIがその案件が適合すると確信していることを意味し、0.15は適合しないと確信していることを意味します。毎日のダイジェストメールはお客様が管理するしきい値(デフォルト0.60)でフィルタリングされるため、どこまでノイズを許容するかはお客様が決められます。
スコアは御社の事業内容に対する相対値であり、入札案件そのものの絶対的な品質評価ではありません。同じ公告が、CMMSベンダーには0.9、建設会社には0.05となることもあります。
2. AIが実際に読んでいるもの
すべての入札案件について、LLMにはタイトルだけでなく、公告の本文全体(タイトル+説明+発注者+公告種別+国+調達カテゴリー+記載があれば推定金額)を送信します。これが重要なのは、関連性の高い案件のかなりの割合が一般的なタイトル(「ソフトウェアサービス — フレームワーク契約」など)を持ち、実際の意図が要件セクションに埋もれているためです。
本文全体を読むからこそ、キーワード検索では見逃す案件をキャッチできます。そしてこれこそが、AIスコアリングが揺るがない強みである理由です — TEDやSAM.govの保存検索アラートでは再現できません。
3. 二段階LLMレビュー
すべての入札案件は、まず高速なプライマリモデルを通ります。判定に確信がある公告(スコア0.40以下または0.70以上)は、その段階で確定します。不確実な帯域(0.40〜0.69)に入った公告は、2つ目のより大きなレビューモデルが再スコアリングします。これにより、簡単なケースでは小さなモデルのスループットを、境界線上のケース — スコアを誤ると実際に機会損失につながる約15%の公告 — ではより大きなモデルの判断力を得られます。
両モデルは同じプロンプトを見ます:御社の事業内容、入札案件の内容、そしてスコア+一文の根拠+一致キーワードのリストを出力するための構造化された指示です。根拠はスコアとともに保存されるため、AIがなぜその評価をしたのかを確認でき、異議があればダッシュボードからフラグを立てられます。
4. 多言語マッチング
事業内容は1つの言語(通常は英語)で記述されます。一方、入札案件はドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語、オランダ語、ポーランド語、ロシア語、トルコ語、アラビア語など、20以上の言語で届きます。このミスマッチを2つの方法で処理しています:
- キーワード展開。入札チームがよく使うキーワードについて、20言語・2,660件以上の翻訳を収録した精選辞書を維持しています。英語のキーワード「permit to work」は、「Arbeitserlaubnis」「permis de travail」「permesso di lavoro」「разрешение на работу」などにもマッチします。新しく追加したキーワードは、社内ホスティングのNMTモデルによってその場で自動翻訳され、キャッシュされます。
- 全文プレフィルター。LLMが入札案件を見る前に、PostgreSQLレベルで多言語キーワードセットによるフィルタリングを行います — 「関連する可能性があるか?」という粗いゲートです。通過した公告だけが、実際のスコアリングのためにLLMへ送られます。これにより、AI予算を使い果たすことなく、1日50万件以上の入札案件を処理できます。
5. ユーザーごとの優先適用
Proプランでは、テナント内の各ユーザーが、共有AIプロンプトを自分専用のものでオーバーライドできます。同じチームでも、1,000万ドル超のフレームワーク契約を追うシニアパートナーと、トランザクション型のRFQを追う若手アナリストとでは、同じ案件に異なるスコアが表示されます。それぞれが、自分自身の事業内容に対して生成されたスコアを見るからです。スコアリング層はダブルジョインを行い、本人のスコアがテナントのフォールバックより優先されます。
6. 私たちがしないこと(そして主張しないこと)
- 較正済みの適合率/再現率の数値は公表していません。独立パネルによる評価研究を実施していないためです。公開された評価手法なしに「精度94.7%」を謳う者は、自分で作った数字を引用しています。私たちが出しても同じことです。言えるのはこれだけです:実際の顧客との内部スポットチェックでは、HSEソフトウェアとCMMSのニッチにおいて、しきい値0.60で90%超の適合率を達成しました。数値はドメインによって変わります。
- お客様のキーワードや関連性の判断を学習に使うことはありません。事業内容はプロンプトであり、訓練シグナルではありません。顧客固有のファインチューニングは一切行いません。
- アカウント情報や請求データをLLMに送ることはありません。モデルプロバイダーに送られるのは、公開されている入札テキストと御社の事業内容だけです。
- 偽陰性ゼロは保証しません。AIが0.30と採点した案件が、御社には適合するかもしれません。だからこそ、ダッシュボードはダイジェストだけでなく全スペクトラムを表示します — ダイジェストはショートリストであって、全体像ではありません。
7. 使用しているモデルプロバイダー
現在、プライマリモデルとレビューモデルは、自社GPUインフラで稼働するセルフホストのオープンウェイト指示チューニング済みモデル(Qwen 2.5ファミリー)です。これにより、コスト管理、プライバシー管理(ベンダーロックインなし、トークン単位の課金なし)、そして統合を書き直すことなくモデルを入れ替えられる柔軟性を確保しています。ホスト型プロバイダーを使う場合(翻訳、フォールバック)も、送信されるのは公開されている入札テキストと英語のキーワードリストのみで、アカウント情報や請求データは決して送りません。サブプロセッサーの一覧はプライバシーポリシーにあります。
8. 間違いへの対処
すべてのユーザーは、ダッシュボードから入札案件のAI判定にフラグを立てられます(「高スコアだが無関係」または「低スコアだが自分なら入札した」)。フラグは社内のレビューキューに入ります。フラグの付いた案件を定期的に検査し、系統的なギャップ — 大抵はキーワード展開の抜けか、事業内容の記述が汎用的すぎるケース — を特定します。合成ベンチマークではなく、実際のフィードバックに基づいて多言語辞書とプロンプトガイダンスをチューニングしています。
9. データの鮮度
新しい入札案件は通常、ソースポータルでの公開から数分以内にインデックスに登録され、スコアリングされます。更新サイクルが1時間ごと・1日ごとのポータルではそれが上限になります — ソースより新鮮にはなれません。毎日のダイジェストメールは、指定した時刻(デフォルトはテナントのタイムゾーンで06:00)に、前回のダイジェスト以降にスコアリングされたすべてをお届けします。