ある教育系企業が、ユーザーが質問を入力したり、質問の写真をアップロードしたりできるアプリを構築しています。このアプリは、書面による回答と説明を返す必要があります。このユースケースに最適なモデルのタイプはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 大規模マルチモーダル言語モデル.
これが解答である理由
大規模マルチモーダル言語モデルは、テキストと画像の両方の入力を処理し、書面による回答と説明を生成できるため、このユースケースに最適です。ユーザーは質問をテキストまたは画像で入力し、モデルはそれらを理解して適切なテキスト応答を生成できます。 コンピュータービジョンモデルは画像分析に特化していますが、テキスト生成はできません。拡散モデルは主に画像生成に使用されます。テキスト読み上げモデルはテキストを音声に変換するもので、このシナリオの要件とは異なります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要