Google выпустила EmbeddingGemma 2 — открытую модель для поиска по текстам, коду, изображениям, аудио и видео прямо на смартфоне

Google представила новую открытую модель искусственного интеллекта EmbeddingGemma 2. Она предназначена для поиска по текстам, коду, изображениям, аудио и видео непосредственно на устройстве пользователя. Модель позволяет искать объекты или события в коллекции медиафайлов по их текстовому описанию, не отправляя данные в облако. Об этом сообщает «3dnews».
Модель превращает разные виды данных в единый формат — числовые векторы из 768 значений, отражающие содержание. В результате текстовый запрос можно соотнести с изображением или звуком, даже если у файла нет подходящего названия и описания. То есть вместо совпадения слов система сопоставляет близость содержимого по смыслу.
Главное отличие EmbeddingGemma 2 от первой версии заключается в возможности обработки изображений и звука напрямую. Новая модель устраняет необходимость в комбинации из распознавания речи, генерации подписей к изображениям и отдельной модели для текстового поиска. Для видео можно индексировать кадры вместе с фрагментами аудио и находить конкретные моменты.
EmbeddingGemma 2 основана на архитектуре открытой Gemma 4 и распространяется по допускающей коммерческое использование модели Apache 2.0. При размере 740 млн параметров и может работать локально на современных потребительских устройствах. В профильных тестах MTEB (Massive Text Embedding Benchmark) для кода и MAEB (Massive Audio Embedding Benchmark), утверждает разработчик, она продемонстрировала лучшие результаты для моделей размером до 1 млрд параметров.
Модель не уступает и даже превосходит более крупные аналоги в задачах, связанных с текстом, изображениями и звуком. Её модульная архитектура позволяет использовать 270 млн параметров для текстовых задач, для мультимодальных функций и обработки изображений потребуется подключить кодировщики размером ещё 170 млн параметров, а также для аудио — ещё 300 млн параметров.
Технология Matryoshka Representation Learning (MRL) позволяет динамически сокращать размерность выходных векторов с 768 до 512, 256 или 128 элементов, можно на величину до шести раз сократить занимаемый векторными базами данных объём памяти. EmbeddingGemma 2 эффективно работает даже при ограниченных ресурсах. В тестах на Pixel 11 Pro квантование помогло модели занять 191 Мбайт оперативной памяти для весов, отвечающих только за текст и около 567 Мбайт в мультимодальном варианте.
По сравнению с моделью первого поколения, новая версия сохранила высокую эффективность в работе с многоязычным текстом. в бенчмарке MTEB Code она повысила результат с 68,76 до 78,68 балла, что делает её подходящей для индексирования кодовой базы и поиска информации для ИИ-агентов, пишущих код.
Локальная работа на устройствах обеспечивает конфиденциальность данных пользователей. В сочетании со «старшей» Gemma 4 служебная EmbeddingGemma 2 позволяет реализовать на устройстве конвейеры RAG (Retrieval-Augmented Generation), так как обе модели используют один токенизатор и аудиокодировщик, что обеспечивает работу в единой среде с меньшим суммарным потреблением памяти.
Веса моделей доступны на платформах Hugging Face и Kaggle, а вскоре появятся на Gemini Enterprise Agent Platform. EmbeddingGemma 2 запускается и встраивается с помощью стандартных средств, включая transformers, llama.cpp, Ollama и LM Studio.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.