Сравнение моделей Gemma 3 4B vs Qwen3 VL 30B A3B Instruct

Сравнение моделей Gemma 3 4B vs Qwen3 VL 30B A3B Instruct по цене, контексту и дате релиза.

google

Gemma 3 4B

google/gemma-3-4b-it

Gemma 3 вводит мультимодальность, поддерживая входы «изображение+текст» и текстовые выходы. Она обрабатывает контекст до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в математике, рассуждениях и чате, включая структурированные выходы и вызов функций.

Контекст 131K

Вход / 1M ₽4.56

Выход / 1M ₽9.12

Выпущена 13 Mar 2025

К модели

qwen

Qwen3 VL 30B A3B Instruct

qwen/qwen3-vl-30b-a3b-instruct

Qwen3-VL-30B-A3B-Instruct — мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Instruct‑вариант оптимизирован под следование инструкциям для общих мультимодальных задач. Она отлично справляется с восприятием реальных/синтетических категорий, 2D/3D пространственной привязкой и длинным визуальным пониманием, показывая конкурентные результаты на мультимодальных бенчмарках. Для агентных сценариев она поддерживает многоизображенные многоходовые инструкции, выравнивание по таймлайнам видео, автоматизацию GUI и визуальное программирование — от эскизов до отладки UI. Текстовая производительность соответствует флагманским моделям Qwen3, что делает её подходящей для document AI, OCR, помощи в UI, пространственных задач и исследований агентных систем.

Контекст 131K

Вход / 1M ₽17.10

Выход / 1M ₽68.40

Выпущена 6 Oct 2025

К модели