Vai al contenuto

Edizione sperimentalePrima selezione di fonti e guide

Come funziona
supervenio.
Menu e sezioni
La biblioteca pratica

Segnalazione automatica

ZDTaichu5.0-9B: modello multimodale per comprensione visiva, ragionamento spaziale e uso di strumenti

Modello multimodale da 9B che combina un backbone linguistico Qwen3.5-9B con un encoder visivo C-RADIOv4-H. Accetta testo, immagini a risoluzione libera e video, gestendo documenti, grafici, OCR, matematica visiva, ragionamento spaziale, comprensione embodied e compiti agentici multi-turno con strumenti.

Fonte originale: Hugging Face — modelli AI (si apre in una nuova scheda)2 min di letturaScheda compilata il

Attività del repository o del modello riportata dalla piattaforma:

Segnalazione automatica di una risorsa pubblicata da terzi. Il conteggio misura stelle o apprezzamenti sulla piattaforma alla data indicata; non certifica qualità o sicurezza.

Uso pratico

Analisi e comprensione di immagini, documenti, diagrammi e video; question answering visivo; ragionamento spaziale 2D/3D; ricerca su robotica e IA embodied; supporto a compiti agentici in cui l'esecuzione degli strumenti resta a carico dell'applicazione.

Compatibilità dichiarata

Non dichiarata nella documentazione consultata

Licenza e accesso

Non rilevata nei metadati Hugging Face; controllare la licenza nel model card

Prima di usare o installare

Controlla il codice o la scheda originale, la licenza, i permessi richiesti e i dati che la risorsa può consultare. Le stelle e i like non sono una verifica di sicurezza.