Firma edukacyjna tworzy aplikację, która pozwala użytkownikom wpisać pytanie lub przesłać zdjęcie pytania. Aplikacja powinna zwracać pisemną odpowiedź i wyjaśnienie. Jaki typ modelu najlepiej pasuje do tego przypadku użycia?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Large multi-modal language model.
Dlaczego to jest odpowiedź
Duży wielomodalny model językowy (LMM) jest najlepszym wyborem, ponieważ potrafi przetwarzać i integrować informacje z wielu modalności, takich jak tekst (wpisane pytanie) i obrazy (zdjęcie pytania). Może następnie generować spójne odpowiedzi tekstowe, w tym wyjaśnienia, co dokładnie odpowiada wymaganiom aplikacji. Model wizji komputerowej mógłby przetworzyć obraz, ale nie wygenerowałby kompleksowej odpowiedzi tekstowej z wyjaśnieniem. Model dyfuzyjny służy głównie do generowania obrazów lub innych danych, a nie do analizy i odpowiadania na pytania w obu modalnościach. Model zamiany tekstu na mowę przekształca tekst na dźwięk, co nie jest podstawową funkcjonalnością wymaganą w tym przypadku.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana