Сравнение моделей Gemma 3 12B vs Llama 3.2 11B Vision Instruct

Сравнение моделей Gemma 3 12B vs Llama 3.2 11B Vision Instruct по цене, контексту и дате релиза.

×
google
Gemma 3 12B
google/gemma-3-12b-it

Gemma 3 вводит мультимодальность, поддерживая входы «изображение+текст» и текстовые выходы. Она обрабатывает контекст до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в математике, рассуждениях и чате, включая структурированные выходы и вызов функций. Gemma 3 12B — вторая по размеру в семействе Gemma 3 после [Gemma 3 27B](google/gemma-3-27b-it)

Контекст 131K
Вход / 1M ₽4.56
Выход / 1M ₽14.82
Выпущена 13 Mar 2025
×
meta-llama
Llama 3.2 11B Vision Instruct
meta-llama/llama-3.2-11b-vision-instruct

Llama 3.2 11B Vision — мультимодальная модель на 11 млрд параметров для задач, сочетающих визуальные и текстовые данные. Она хорошо подходит для описания изображений, visual Q&A и других сценариев, где требуется объединить генерацию языка с визуальными рассуждениями. Модель обучена на большом наборе пар «изображение‑текст» и подходит для анализа изображений, создания контента, клиентских ассистентов и исследовательских задач.

Контекст 131K
Вход / 1M ₽5.59
Выход / 1M ₽5.59
Выпущена 25 Sep 2024