Компания хочет выполнять инференс на периферийных устройствах с абсолютно минимально возможной задержкой, используя языковые модели. Какой подход к развертыванию лучше всего это обеспечивает?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Развернуть оптимизированные малые языковые модели (SLM) непосредственно на периферийных устройствах.
Почему это правильный ответ
Развертывание оптимизированных малых языковых моделей (SLM) непосредственно на периферийных устройствах обеспечивает минимальную задержку, так как инференс происходит локально без сетевых задержек. SLM меньше и требуют меньше вычислительных ресурсов, что делает их подходящими для периферийных устройств. Развертывание больших языковых моделей (LLM) на периферийных устройствах непрактично из-за их размера и высоких требований к ресурсам. Использование централизованных API LLM или SLM, даже с асинхронными вызовами, всегда будет вносить сетевую задержку, что противоречит требованию "абсолютно минимально возможной задержки".
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется