Un'azienda del settore dell'istruzione sta creando un'app che consente agli utenti di digitare una domanda o caricare un'immagine di una domanda. L'app dovrebbe restituire una risposta scritta e una spiegazione. Quale tipo di modello si adatta meglio a questo caso d'uso?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Modello linguistico multimodale di grandi dimensioni.
Perché questa è la risposta
Un modello linguistico multimodale di grandi dimensioni (LLM multimodale) è la scelta migliore perché può elaborare input da più modalità (testo e immagini) e generare output in diverse modalità (testo). In questo caso, l'app accetta input testuali o immagini di domande e restituisce risposte testuali con spiegazioni, il che rientra nelle capacità di un LLM multimodale. Un modello di visione artificiale è progettato principalmente per analizzare e comprendere immagini, ma non può generare risposte testuali complesse o spiegazioni. Un modello di diffusione è utilizzato per la generazione di immagini o altri dati, non per la comprensione multimodale e la generazione di testo. Un modello di sintesi vocale converte il testo in parlato, che non è l'obiettivo principale di questa applicazione.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta