Les jobs d’Évaluation LLM sont en Aperçu sur W&B Multi-tenant Cloud. Les ressources de calcul sont gratuites pendant la période d’aperçu. En savoir plus
- Si un benchmark affiche
truedans la colonne OpenAI Model Scorer, il utilise des modèles OpenAI pour le scoring. Un administrateur d’organisation ou d’équipe doit ajouter une clé API OpenAI comme secret d’équipe. Lorsque vous configurez un job d’évaluation avec un benchmark soumis à cette exigence, définissez le champ Scorer API key sur ce secret.- Si un benchmark contient un lien dans la colonne jeu de données Hugging Face à accès restreint, il nécessite l’accès à un jeu de données Hugging Face à accès restreint. Un administrateur d’organisation ou d’équipe doit demander l’accès au jeu de données sur Hugging Face, créer un jeton d’accès utilisateur Hugging Face et configurer un secret d’équipe avec la clé d’accès. Lorsque vous configurez un benchmark soumis à cette exigence, définissez le champ Hugging Face Token sur ce secret.
Connaissances
Raisonnement
Mathématiques
Code
Lecture
Contexte long
Sécurité
Domaine spécialisé
Multimodal
Suivi d’instructions
Système
Étapes suivantes
- Évaluer un point de contrôle du modèle
- Évaluer un modèle hébergé via API
- Voir les détails de benchmarks spécifiques sur AISI Inspect Evals