LLM 평가 작업은 W&B Multi-tenant Cloud에서 프리뷰 기능으로 제공됩니다. 프리뷰 기간에는 컴퓨팅이 무료입니다. 자세히 알아보기
- 벤치마크의 OpenAI Model Scorer 열에
true가 있으면 해당 벤치마크는 채점에 OpenAI 모델을 사용합니다. 조직 또는 팀 관리자는 OpenAI API 키를 팀 secret으로 추가해야 합니다. 이 요구 사항이 있는 벤치마크로 평가 작업을 설정할 때는 Scorer API key 필드에 해당 secret을 설정하세요.- 벤치마크의 제한된 Hugging Face 데이터셋 열에 링크가 있으면 해당 벤치마크는 접근이 제한된 Hugging Face 데이터셋에 대한 액세스가 필요합니다. 조직 또는 팀 관리자는 Hugging Face에서 데이터셋에 대한 액세스를 요청하고, Hugging Face 사용자 액세스 토큰을 생성한 다음, 해당 액세스 키로 팀 secret을 구성해야 합니다. 이 요구 사항이 있는 벤치마크를 설정할 때는 Hugging Face Token 필드에 해당 secret을 설정하세요.
지식
추론
수학
코드
읽기
긴 컨텍스트
안전
도메인 특화
멀티모달
지시사항 준수
시스템
다음 단계
- 모델 체크포인트 평가하기
- 호스팅된 API 모델 평가하기
- AISI Inspect Evals에서 특정 벤치마크의 세부 정보 보기