Segnalazione automatica
ZDTaichu5.0-9B: modello multimodale per comprensione visiva, ragionamento spaziale e uso di strumenti
Modello multimodale da 9B che combina un backbone linguistico Qwen3.5-9B con un encoder visivo C-RADIOv4-H. Accetta testo, immagini a risoluzione libera e video, gestendo documenti, grafici, OCR, matematica visiva, ragionamento spaziale, comprensione embodied e compiti agentici multi-turno con strumenti.
Attività del repository o del modello riportata dalla piattaforma:
Segnalazione automatica di una risorsa pubblicata da terzi. Il conteggio misura stelle o apprezzamenti sulla piattaforma alla data indicata; non certifica qualità o sicurezza.
Uso pratico
Analisi e comprensione di immagini, documenti, diagrammi e video; question answering visivo; ragionamento spaziale 2D/3D; ricerca su robotica e IA embodied; supporto a compiti agentici in cui l'esecuzione degli strumenti resta a carico dell'applicazione.
Compatibilità dichiarata
Non dichiarata nella documentazione consultata
Licenza e accesso
Non rilevata nei metadati Hugging Face; controllare la licenza nel model card
Prima di usare o installare
Controlla il codice o la scheda originale, la licenza, i permessi richiesti e i dati che la risorsa può consultare. Le stelle e i like non sono una verifica di sicurezza.