ТЕХНОЛОГИИ

Google представила EmbeddingGemma 2 — компактную ИИ-модель для локального мультимодального поиска

Новая открытая модель Google ищет по тексту, коду, изображениям, аудио и видео прямо на смартфоне, без передачи данных в облако.

Google выпустила EmbeddingGemma 2 — открытую модель искусственного интеллекта, которая позволяет искать текст, код, изображения, аудио и видео непосредственно на устройстве пользователя. Модель может работать на смартфоне и обходится без отправки данных в облако.

Принцип работы EmbeddingGemma 2 основан на преобразовании разных типов данных в единый числовой формат — векторы из 768 значений, которые отражают смысловое содержание файла. Благодаря этому текстовый запрос можно сопоставить с изображением или звукозаписью даже в том случае, если у файла нет подходящего названия или описания: система ищет совпадения не по словам, а по смысловой близости содержимого.

Ключевое отличие новой версии от предыдущей — расширение возможностей за пределы текста. EmbeddingGemma 2 обрабатывает изображения и звук напрямую, без необходимости собирать отдельный конвейер из распознавания речи, генерации подписей к картинкам и текстового поиска. Для видео модель может индексировать одновременно кадры и фрагменты звука, что позволяет находить конкретные моменты в ролике.

Модель построена на архитектуре открытой Gemma 4 и распространяется по лицензии Apache 2.0, допускающей коммерческое использование. Архитектура EmbeddingGemma 2 модульная: базовый блок для работы только с текстом занимает 270 млн параметров, для подключения обработки изображений требуется ещё 170 млн, а для аудио — ещё 300 млн параметров.

Для экономии памяти разработчики применили технологию Matryoshka Representation Learning, которая позволяет динамически сокращать размерность выходных векторов с 768 до 512, 256 или 128 элементов — это снижает объём памяти, занимаемый векторными базами данных, до шести раз.

Google утверждает, что в тестах MTEB (Massive Text Embedding Benchmark) для кода и MAEB (Massive Audio Embedding Benchmark) модель показала лучшие результаты среди систем размером до 1 млрд параметров, превзойдя при этом более крупные модели в задачах работы с текстом, изображениями и звуком.

Веса EmbeddingGemma 2 доступны на платформах Hugging Face и Kaggle, в перспективе появятся на Gemini Enterprise Agent Platform. Модель совместима со стандартными инструментами запуска и встраивания — transformers, llama.cpp, Ollama, LM Studio и другими. В паре со «старшей» моделью Gemma 4, которая использует общий токенизатор и аудиокодировщик, EmbeddingGemma 2 позволяет реализовать на устройстве конвейеры RAG (Retrieval-Augmented Generation) с меньшим суммарным потреблением памяти.

Почему это важно

Возможность искать по смыслу среди фото, видео и аудиозаписей прямо на устройстве, без подключения к интернету и передачи данных на сторонние серверы, повышает конфиденциальность пользователей — личные файлы не покидают смартфон. Компактный размер модели делает такие функции доступными даже на устройствах с ограниченными ресурсами, а улучшенные результаты в тестах на работу с кодом говорят о пригодности модели для индексации репозиториев и работы ИИ-агентов, помогающих программистам.

Главные цифры

  • 768 значений — размер вектора, в который модель преобразует данные любого типа
  • 740 млн параметров — полный размер модели EmbeddingGemma 2
  • 270 млн параметров — требуется только для работы с текстом
  • 170 млн параметров — дополнительно нужно для обработки изображений
  • 300 млн параметров — дополнительно нужно для обработки аудио
  • До 6 раз — возможное сокращение объёма памяти векторных баз благодаря MRL
  • 191 Мбайт — объём оперативной памяти для текстовых весов модели на Pixel 11 Pro
  • 567 Мбайт — объём памяти для мультимодальной версии на том же устройстве
  • С 68,76 до 78,68 балла — рост результата в бенчмарке MTEB Code по сравнению с первой версией модели

По материалам: 3dnews.ru