nerfWatch()
ストックにはログインが必要です
AIモデルの性能を毎日ベンチマークし、コミュニティの評価も確認
Artificial Intelligence
GitHub
Open Source
Tech
概要
- nerfWatch()は、複数のAIモデルに毎日同じ100問をAPI経由で実行し、性能の変化を継続的に追跡するサービスです。
- 各モデル自身の追跡開始後7日間を基準にするため、モデル間の単純比較ではなく、個々のモデルの性能低下や回復を確認できます。
主な特徴
- 推論・論理・コード読解・指示追従・長文処理を含む課題をコードで採点し、測定スコアと日々のコミュニティ投票を並べて表示します。
- 性能がベースラインを下回ったときや回復したときにメールで通知。オープンソースのテストエンジンにより、評価方法を確認できます。
- 追跡開始直後は基準値の構築中で、十分なデータが集まるまでは「Too soon」と表示されます。
こんな人におすすめ
- AIモデルのアップデート後に性能が落ちていないか、単発の回答ではなく継続的なテスト結果で確認したい人に適しています。
- APIで提供されるモデルの品質変化を監視したい開発者やチーム、評価基盤を自分でも検証・拡張したい人に向いています。
- 測定結果と実際の利用者の体感を比較しながら、どのモデルやテスト項目を追跡すべきか考えたい人にも役立ちます。
投票数: 0