Vai al contenuto

Edizione sperimentalePrima selezione di fonti e guide

Come funziona
supervenio.
Menu e sezioni
Ricerca & community

Segnalazione automatica

Multiverse Computing presenta il metodo Quantization-Aware Healing per modelli LLM compressi a 4 bit

Il blog di Hugging Face illustra il paper di Multiverse Computing sul Quantization-Aware Healing, tecnica che distilla da un modello originale pre-compressione invece che dal checkpoint recuperato. Applicata a GPT-OSS 120B compresso a 60B e quantizzato in MXFP4, l'azienda riporta risultati superiori al proprio checkpoint bfloat16 su 7 benchmark su 9, con guadagni maggiori su ragionamento a contesto lungo e matematica, e minore instabilita' rispetto al quantization-aware training.

Fonte originale: Hugging Face — blog (si apre in una nuova scheda)2 min di letturaScheda compilata il

Data di pubblicazione riportata dalla fonte: . Non indica l’entrata in vigore di una norma.

Sintesi automatica di una fonte primaria, sottoposta a controlli automatici. Consulta il documento originale per il contesto completo.

La segnalazione

Il blog di Hugging Face illustra il paper di Multiverse Computing sul Quantization-Aware Healing, tecnica che distilla da un modello originale pre-compressione invece che dal checkpoint recuperato. Applicata a GPT-OSS 120B compresso a 60B e quantizzato in MXFP4, l'azienda riporta risultati superiori al proprio checkpoint bfloat16 su 7 benchmark su 9, con guadagni maggiori su ragionamento a contesto lungo e matematica, e minore instabilita' rispetto al quantization-aware training.

Come leggere questa scheda

Le dichiarazioni sono attribuite alla fonte. Questa scheda non certifica prestazioni, conformita o stato di vigenza di norme e non sostituisce una valutazione professionale.