Google выпустила EmbeddingGemma 2: модель для локального поиска по разным типам данных
EmbeddingGemma 2 преобразует текст, изображения, видео, аудио и код в векторы. Google заявляет, что модель с 740 млн параметров показывает результаты на мультимодальных тестах на уровне конкурентов вдвое крупнее.

Модель предназначена для поиска по разным типам данных
Google выпустила EmbeddingGemma 2 — модель с открытыми весами, которая преобразует текст, изображения, видео, аудио и код в числовые векторы. Это позволяет находить и сопоставлять похожий контент.
В модели 740 млн параметров. Google называет её самой компактной в своём классе и заявляет, что на мультимодальных тестах она превосходит конкурирующие модели размером до двух раз больше.
По данным опубликованного описания EmbeddingGemma 2 набрала 78,68 балла на Massive Text Embedding Benchmark (Code). Предыдущая версия получила 68,76 балла; Google отмечает, что результат новинки сопоставим с показателями значительно более крупных моделей.
EmbeddingGemma 2 можно запускать в браузере
Модель работает локально, без ключа API. В браузере с использованием WebGPU обработка одного запроса занимает, по данным источника, около 20–70 миллисекунд, а приложению требуется примерно 191 МБ оперативной памяти. Google также заявляет, что модель позволяет сократить объём хранилища локальной векторной базы данных до шести раз.
Для задач только с текстом, согласно описанию, достаточно версии с 270 млн параметров. В сочетании с небольшими открытыми моделями, например Gemma 4, EmbeddingGemma 2 может использоваться в офлайн-приложениях RAG: данные при этом не нужно отправлять на внешние серверы.
Веса доступны на Hugging Face и Kaggle. Google также опубликовала руководство для разработчиков и документацию модели.
Источники
Продолжить чтение
В ленте материалов: 1