Vai al contenuto

Edizione sperimentalePrima selezione di fonti e guide

Come funziona
supervenio.
Menu e sezioni
Ricerca & community

Segnalazione automatica

Hugging Face: NeoMME, encoder multimodale e multilingue per il retrieval di documenti visivi

Il team Hcompany presenta NeoMME, encoder multimodali multilingue da 260M e 800M parametri che elaborano testo e patch di immagini in un unico Transformer bidirezionale, senza vision tower ne' decoder causale. NeoMME-Retriever, per il recupero di documenti visivi su pagine-immagine, restituisce embedding dense e late-interaction in un solo passaggio; compressione fino a 6 kB per pagina. Checkpoint rilasciati con licenza Apache 2.0 e disponibili in Hugging Face Transformers.

Fonte originale: Hugging Face — blog (si apre in una nuova scheda)2 min di letturaScheda compilata il

Data di pubblicazione riportata dalla fonte: . Non indica l’entrata in vigore di una norma.

Sintesi automatica di una fonte primaria, sottoposta a controlli automatici. Consulta il documento originale per il contesto completo.

La segnalazione

Il team Hcompany presenta NeoMME, encoder multimodali multilingue da 260M e 800M parametri che elaborano testo e patch di immagini in un unico Transformer bidirezionale, senza vision tower ne' decoder causale. NeoMME-Retriever, per il recupero di documenti visivi su pagine-immagine, restituisce embedding dense e late-interaction in un solo passaggio; compressione fino a 6 kB per pagina. Checkpoint rilasciati con licenza Apache 2.0 e disponibili in Hugging Face Transformers.

Come leggere questa scheda

Le dichiarazioni sono attribuite alla fonte. Questa scheda non certifica prestazioni, conformita o stato di vigenza di norme e non sostituisce una valutazione professionale.