Vai al contenuto

Edizione sperimentalePrima selezione di fonti e guide

Come funziona
supervenio.
Menu e sezioni
Ricerca & community

Segnalazione automatica

Hugging Face: transformers supporta i quantizzati GGUF di llama.cpp per l'inferenza locale

Hugging Face annuncia il supporto per eseguire modelli GGUF in transformers tramite le API from_pretrained, riutilizzando i kernel ggml di llama.cpp. L'attenzione iniziale e' sull'inferenza locale su Apple Silicon, con punti di controllo quantizzati del Qwen3.5. Il formato GGUF include pesi, tokenizer e chat template; i modelli possono essere serviti con transformers serve su API compatibile OpenAI.

Fonte originale: Hugging Face — blog (si apre in una nuova scheda)2 min di letturaScheda compilata il

Data di pubblicazione riportata dalla fonte: . Non indica l’entrata in vigore di una norma.

Sintesi automatica di una fonte primaria, sottoposta a controlli automatici. Consulta il documento originale per il contesto completo.

La segnalazione

Hugging Face annuncia il supporto per eseguire modelli GGUF in transformers tramite le API from_pretrained, riutilizzando i kernel ggml di llama.cpp. L'attenzione iniziale e' sull'inferenza locale su Apple Silicon, con punti di controllo quantizzati del Qwen3.5. Il formato GGUF include pesi, tokenizer e chat template; i modelli possono essere serviti con transformers serve su API compatibile OpenAI.

Come leggere questa scheda

Le dichiarazioni sono attribuite alla fonte. Questa scheda non certifica prestazioni, conformita o stato di vigenza di norme e non sostituisce una valutazione professionale.