Passer au contenu principal
Les jobs d’Évaluation LLM sont en Aperçu sur W&B Multi-tenant Cloud. Les ressources de calcul sont gratuites pendant la période d’aperçu. En savoir plus
Cette page répertorie les benchmarks d’évaluation proposés par LLM Evaluation Jobs, par catégorie. Pour exécuter certains benchmarks, un administrateur d’équipe doit ajouter les clés API requises comme secrets au niveau de l’équipe. N’importe quel membre de l’équipe peut ensuite spécifier le secret lors de la configuration d’un job d’évaluation.
  • Si un benchmark affiche true dans la colonne OpenAI Model Scorer, il utilise des modèles OpenAI pour le scoring. Un administrateur d’organisation ou d’équipe doit ajouter une clé API OpenAI comme secret d’équipe. Lorsque vous configurez un job d’évaluation avec un benchmark soumis à cette exigence, définissez le champ Scorer API key sur ce secret.
    • Si un benchmark contient un lien dans la colonne jeu de données Hugging Face à accès restreint, il nécessite l’accès à un jeu de données Hugging Face à accès restreint. Un administrateur d’organisation ou d’équipe doit demander l’accès au jeu de données sur Hugging Face, créer un jeton d’accès utilisateur Hugging Face et configurer un secret d’équipe avec la clé d’accès. Lorsque vous configurez un benchmark soumis à cette exigence, définissez le champ Hugging Face Token sur ce secret.

Connaissances

Évaluez les connaissances factuelles dans divers domaines, comme la science, le langage et le raisonnement général.

Raisonnement

Évaluez les capacités de pensée logique, de résolution de problèmes et de raisonnement de bon sens.

Mathématiques

Évaluez la capacité à résoudre des problèmes mathématiques à différents niveaux de difficulté, de l’école primaire jusqu’aux problèmes de niveau concours.

Code

Évaluez les capacités en programmation et en développement logiciel, comme le débogage, la prédiction d’exécution du code et l’appel de fonctions.

Lecture

Évaluez la compréhension de l’écrit et l’extraction d’informations à partir de textes complexes.

Contexte long

Évaluez la capacité à traiter et à raisonner dans des contextes étendus, y compris la récupération d’informations et la reconnaissance de motifs.

Sécurité

Évaluez l’alignement, la détection des biais, la résistance aux contenus dangereux et la véracité.

Domaine spécialisé

Évaluez les connaissances spécialisées en médecine, chimie, droit, biologie et dans d’autres domaines professionnels.

Multimodal

Évaluez la compréhension visuelle et du langage en combinant des données visuelles et textuelles.

Suivi d’instructions

Évalue le respect d’instructions spécifiques et des exigences de mise en forme.

Système

Validation de base du système et vérifications préalables.

Étapes suivantes