Vai al contenuto

Edizione sperimentalePrima selezione di fonti e guide

Come funziona
supervenio.
Menu e sezioni
Ricerca & community

Segnalazione automatica

Ai2 presenta BenchMIRT, metodo per analizzare cosa misurano davvero i benchmark degli LLM

Ai2 ha introdotto BenchMIRT, metodo basato sulla Item Response Theory multidimensionale che analizza i benchmark degli LLM a livello di singolo prompt. Addestrato su 100 LLM, 16 benchmark e oltre 34.000 domande, individua due dimensioni dominanti: sicurezza e ragionamento generale. Secondo gli autori può aiutare a distinguere i segnali che compongono un punteggio aggregato e a identificare le domande più informative per valutare le capacita' dei modelli.

Fonte originale: Hugging Face — blog (si apre in una nuova scheda)2 min di letturaScheda compilata il

Data di pubblicazione riportata dalla fonte: . Non indica l’entrata in vigore di una norma.

Sintesi automatica di una fonte primaria, sottoposta a controlli automatici. Consulta il documento originale per il contesto completo.

La segnalazione

Ai2 ha introdotto BenchMIRT, metodo basato sulla Item Response Theory multidimensionale che analizza i benchmark degli LLM a livello di singolo prompt. Addestrato su 100 LLM, 16 benchmark e oltre 34.000 domande, individua due dimensioni dominanti: sicurezza e ragionamento generale. Secondo gli autori può aiutare a distinguere i segnali che compongono un punteggio aggregato e a identificare le domande più informative per valutare le capacita' dei modelli.

Come leggere questa scheda

Le dichiarazioni sono attribuite alla fonte. Questa scheda non certifica prestazioni, conformita o stato di vigenza di norme e non sostituisce una valutazione professionale.