Сравнение моделей Llama Guard 4 12B vs Qwen3 VL 235B A22B Instruct

Сравнение моделей Llama Guard 4 12B vs Qwen3 VL 235B A22B Instruct по цене, контексту и дате релиза.

meta-llama

Llama Guard 4 12B

meta-llama/llama-guard-4-12b

Llama Guard 4 — мультимодальная предобученная модель на базе Llama 4 Scout, дообученная для классификации безопасности контента. Как и предыдущие версии, она может использоваться для классификации контента как во входных данных LLM (классификация промптов), так и в ответах LLM (классификация ответов). Она действует как LLM — генерирует текст, указывающий, является ли заданный запрос или ответ безопасным или небезопасным, и если небезопасным, перечисляет нарушенные категории контента. Llama Guard 4 выровнена по стандартизированной таксономии рисков MLCommons и создана для поддержки мультимодальных возможностей Llama 4. В частности, она объединяет возможности предыдущих моделей Llama Guard, обеспечивает модерацию контента на английском и ряде поддерживаемых языков, а также расширенную работу со смешанными запросами «текст+изображение», включая несколько изображений. Кроме того, Llama Guard 4 интегрирована в Llama Moderations API, расширяя надёжную классификацию безопасности для текста и изображений.

Контекст 163K

Вход / 1M ₽20.52

Выход / 1M ₽20.52

Выпущена 30 Apr 2025

К модели

qwen

Qwen3 VL 235B A22B Instruct

qwen/qwen3-vl-235b-a22b-instruct

Qwen3-VL-235B-A22B Instruct — open‑weight мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Instruct‑вариант нацелен на общее использование в vision‑language задачах (VQA, разбор документов, извлечение данных из графиков/таблиц, многоязычный OCR). Серия делает акцент на устойчивом восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (2D/3D привязка) и длинной визуальной интерпретации, показывая конкурентные результаты на публичных мультимодальных бенчмарках как в восприятии, так и в рассуждениях. Помимо анализа, Qwen3‑VL поддерживает агентное взаимодействие и использование инструментов: может следовать сложным инструкциям в многоизображенных, многоходовых диалогах; сопоставлять текст с временными шкалами видео для точных запросов по времени; и управлять элементами GUI для задач автоматизации. Модели также поддерживают визуальные рабочие процессы программирования — превращение скетчей/макетов в код и помощь в отладке UI — при сохранении сильной текстовой производительности, сопоставимой с флагманскими языковыми моделями Qwen3. Это делает Qwen3‑VL подходящей для продакшн‑сценариев: document AI, многоязычный OCR, помощь в разработке UI, пространственные задачи и исследования агентных vision‑language систем.

Контекст 262K

Вход / 1M ₽22.80

Выход / 1M ₽100.32

Выпущена 23 Sep 2025

К модели