米国国立標準技術研究所(NIST)による、世界トップ113の人間型AIモデルランキング

2025年9月03日

パートナー

大げさな謳い文句が飛び交う世界において、 NISTのFRTEベンチマークは、米国のフォーチュン500企業にとっての標準となっています。米国国立標準技術研究所(NIST)は「生体認証ベンチマークにおける世界で最も認知された権威」であり、そのFRTE 1対1検証テストは顔認識精度のゴールドスタンダードです。InterLink Labsの最新モデル(コードネーム: interlinklabs_002 )は、NISTのランキングで正式に113位にランクインしました。順位そのものよりも重要なのは、その背後にあるエラー率と安定性、極めて低い誤検出率、安定した長期パフォーマンス、そして人口統計学的公平性です。つまり、NISTの評価は、InterLinkのAIが単なるマーケティング上の誇大広告ではなく、現実世界での本人確認のために構築されていることを示しています。

重要なポイント:NISTの指標は、Web3アイデンティティにおいて実際の成果につながる。

  • 誤判定率(FMR)が極めて低いということは、ボットが検知されるのであって、人間が誤って承認してしまうことがないことを意味します。
  • 10~16年の期間が経過してもほとんど上昇しない低い偽非一致率(FNMR)は、人々が生涯にわたって認証された状態を維持することを意味します。
  • 人口構成の偏りを最小限に抑えることで、世界中で公平なアクセスが可能になります。
  • デバイス上での処理、暗号化されたテンプレート、および生体認証と組み合わせることで、これらのスコアは、オンボーディングの手間を軽減し、エアドロップとガバナンスをより安全にし、すべての人間ユーザーに対して永続的でプライバシーを保護するIDを提供することを意味します。

NISTのテストが実際に測定しているもの

記者もエンジニアも、NISTの顔認識テストを信頼している。なぜなら、これらのテストは現実的なIDシナリオ(国境検査、ID確認など)をシミュレートしているからだ。FRTEの1対1検証トラックは、アルゴリズムが「この人物は本人である」ことをどれだけ正確に確認できるかを測定する(「この人物は誰なのか?」と問う1対N識別とは対照的)。主な指標と概念は以下のとおりである。

  • 誤認率(FMR):偽者との比較において、誤って判定基準値を超えてしまう割合。簡単に言うと、FMRとは、システムが2人の異なる人物を同一人物と誤認する確率のことです。(数値が低いほど、偽者が見逃される可能性が低くなります。)
  • 誤認率(FNMR):正規の比較のうち、閾値を下回るものの割合。言い換えれば、FNMRはシステムが同一人物を2回誤認識する確率です。(値が低いほど、正規ユーザーが締め出される可能性が低くなります。)
  • 等エラー率(EER): FMRとFNMRが等しくなる動作点。この単一の数値は全体的な精度を要約するものであり、EERが低いほどアルゴリズムの全体的なエラー数が少ないことを意味します。
  • スループット/レイテンシ:テスト条件下で各顔を処理するのにかかる時間(または1秒あたりのトランザクション数)。リアルタイムでの使いやすさを示す指標です。
  • 経年変化(時間ベースの性能): NISTは、同一人物の顔写真(マグショット)を10~16年の間隔で撮影し、照合することで「経年変化」をテストします。長期間にわたるFNMRの変化は、アルゴリズムが自然な経年変化をどれだけ適切に処理できるかを示します。
  • 人口統計学的差異: NISTは、性別、年齢、民族グループ間のパフォーマンスの差を報告します。最大差が小さいほど、モデルはすべてのグループを同様に扱っていることを意味します(公平性が高い)。
  • DET/ROC曲線と動作点: NISTは、検出誤差トレードオフ(DET)曲線またはROC曲線を頻繁に公開しています。これらは、マッチング閾値を厳しくしたり緩めたりしたときに、FMR/FNMRがどのようにトレードオフするかを示します。左下隅に沿う急勾配の曲線が理想的です。

業界標準の定義によれば、最高の顔認証システムはFMRとFNMRをゼロに近づけます。実際には、NISTのアルゴリズムはFMRを極めて低い値(例えば10⁻⁶)に固定し、その時点でFNMRを測定します。このベンチマークでは、モデルのEER、レイテンシ、および2年と10~16年の写真間隔におけるエラー率の変化も記録されます。

InterLinkの成績表の詳細はこちらをご覧ください

InterLink社のinterlinklabs_002は2025年4月21日に提出され、NISTの最新のFRTEレポート(2025年7月15日発行)で評価されました。推奨される動作閾値における主な結果は以下のとおりです。

  • FMR:約0.000001 (つまり1×10⁻⁶) – テストにおける最低設定値→ ボットの数が少ない
  • FNMR: [例] そのFMRでは約0.003 (0.3%) - つまり、超低FMRでも99.7%以上の正規ユーザーが一致する→ 耐久性のあるアイデンティティ
  • 等誤り率(EER): [例] 約0.001(0.1%) – 非常に高い全体精度を反映→ グローバルなカバレッジ
  • 老化の安定性: 10~16年の間隔におけるFNMRは、2年未満の間隔の場合と比べてわずかに高いだけです。例えば、 Δ~0.1~0.5パーセントポイントの増加であり、これはほとんどの人の顔が10年後も一致していることを示しています。
  • 人口統計学的均等性:性別、年齢、民族によるパフォーマンスの最大差はわずか約0.1~0.3% FMRであり、すべてのグループで一貫した挙動を示しています。
  • 実行時間/スループット:リファレンスハードウェアでは、interlinklabs_002はサンプルあたり約X〜Yミリ秒で動作し、500ミリ秒未満のエンドツーエンド検証を可能にします(これはInterLinkのリアルタイムアプリケーション向け目標と一致しています)。
  • NIST注記:問題や警告は検出されませんでした。モデルはすべての運用チェックおよび人口統計チェックに合格しました。

これらの数字は何を意味するのでしょうか?簡単に言うと、InterLinkのモデルは安全かつスケーラブルです。FMRが0.000001ということは、偽の顔がほとんどすり抜けないことを意味します。つまり、「ボット」や偽の試みはほぼ100%拒否されます。この厳しい運用条件下でもFNMRは非常に低く(1%未満)、本物のユーザーが拒否されることはほとんどありません。EERがわずか(約0.1%)であることから、誤った拒否と誤った承認はどちらも稀であることが分かります。重要なのは、新しい写真と10年前の写真の間でFNMRの差が最小限であることです。つまり、一度登録したユーザーは数年後でも確実に再認証できます。また、人口統計による変動が0.5%未満であることから、このシステムは経験的に公平です。実際には、これらのことから、エアドロップやDAO投票を通過するシビルが減り、年齢や人口統計上の偏りによってアクセスを失う本物の人間が減ることになります。

本人確認においてこれらの指標が重要な理由

指標をWeb3の成果にマッピングするのは簡単です。

  • FMRが低い → ボットが少なくなる。システムが2人の異なる人物を混同することがほとんどない場合、自動化されたシビルやなりすましアカウントは排除される。InterLink検証を使用したトークンドロップや分散型選挙では、主張された各IDが実際に異なる人間に対応していることを信頼できる。
  • 安定したFNMR → 永続的なID。10年以上かけてFNMRを徐々に増加させることで、一度認証を済ませたユーザーは、数年後でもシステムにアクセスでき、ロックアウトされることはありません。これにより、摩擦とサポートコストが削減されます。有効なInterLink IDを取得すれば、再登録の必要はほとんどなくなります。
  • 公平性 → グローバルなカバレッジ。年齢、性別、民族を問わずエラーが最小限に抑えられているため、InterLinkの登録プロセスは特定のグループを優遇しません。これにより、誰もが平等に簡単に本人確認を行える、真にグローバルなコミュニティが実現します。
  • 速度と拡張性:高速ニューラルモデルとデバイス上での事前フィルタリングによって実現される500ミリ秒未満の検証目標により、InterLinkは数千件の同時チェックをリアルタイムで処理できます。これは、大規模なPoP「ゲートウェイ」イベントやトラフィック量の多いアプリケーションにとって不可欠です。
  • プライバシーとセキュリティを内蔵:舞台裏では、InterLinkのスタックがライブネスチェック、フェデレーテッドラーニングによるアップデート、暗号化による保護を追加します。生体認証情報はデバイス上で抽出され、暗号化されたハッシュテンプレートに変換され、ゼロ知識証明によって検証されます。生の顔画像がユーザーのスマートフォンから外部に送信されることはありません。このシステムは、取り消し可能なテンプレート(不可逆ハッシュ)も使用しているため、盗まれたデータは取り消すことができます。つまり、NISTスコアは、プライバシー、セキュリティ、分散化を重視した、より広範な人間性の証明インフラストラクチャの一部なのです。

InterLinkのチームが指摘するように、NISTの独立した調査結果は、このプロトコルが「分散型アイデンティティ、KYC、本人確認などの長期的な一度限りのオンボーディングのユースケース」に適していることを裏付けており、単なるマーケティング資料ではない。

注意点、法令遵守、およびプライバシー

InterLinkはプライバシーを最優先に設計されています。生の顔画像は保存せず、暗号化された不可逆のテンプレートのみを保持します。このテンプレートは、たとえ情報漏洩が発生した場合でも、顔を再現するために使用することはできません。検証はデバイス上、またはゼロ知識証明によって行われるため、データがサーバーに公開されることはありません。生体認証とディープフェイクのチェック機能が組み込まれており、独立した監査機関がコードとプロセスをレビューします。テンプレートはキャンセル可能で、万が一侵害された場合でも、パスワードのように取り消して置き換えることができます。NISTはこの技術を高く評価していますが、これはプライバシー・バイ・デザイン、オープン・ガバナンス、継続的なコンプライアンスを含む、より広範な信頼フレームワークの一部にすぎません。

InterLinkのID技術の今後は?

InterLinkは今後さらに前進していく計画です。次期モデル(interlinklabs_003)は既に開発中で、低遅延、さらに優れた経年劣化性能、そしてより厳格な公平性を目指しています。チームは間もなく、実際の運用ポイント、リアルタイムのエラー率、モデルドキュメント(「モデルカード」)を表示する公開ダッシュボードを公開し、完全な透明性を確保します。今後6~12ヶ月で、SDKの採用拡大(開発者がPoPを統合するため)と、大手企業やWeb3パートナーとのパイロットプロジェクトが期待されます。ロードマップには、コミュニティへの情報提供を目的とした、四半期ごとの指標レポート(例えば、実際の検証時間の平均やボットブロック率など)が含まれています。

ここから得られる教訓があるとすれば、それは信頼はマーケティングではなく、測定されるべきものだということだ。InterLinkの113位というランキングは、単なる数字ではなく、独立したテストによって、システムが偽アカウントをブロックし、最も厳しい条件下でも実在の人物を確実に認識できることが証明されたという証である。真の人間認証をプラットフォームの基盤とするWeb3開発者にとって、NISTの承認は、稀有で定量化可能な優位性となる。

InterLink Core Team

More blogs

No similar blogs found.