Google представила EmbeddingGemma 2 — компактную ИИ-модель для локального мультимодального поиска
Новая открытая модель Google ищет по тексту, коду, изображениям, аудио и видео прямо на смартфоне, без передачи данных в облако.
Google выпустила EmbeddingGemma 2 — открытую модель искусственного интеллекта, которая позволяет искать текст, код, изображения, аудио и видео непосредственно на устройстве пользователя. Модель может работать на смартфоне и обходится без отправки данных в облако.
Принцип работы EmbeddingGemma 2 основан на преобразовании разных типов данных в единый числовой формат — векторы из 768 значений, которые отражают смысловое содержание файла. Благодаря этому текстовый запрос можно сопоставить с изображением или звукозаписью даже в том случае, если у файла нет подходящего названия или описания: система ищет совпадения не по словам, а по смысловой близости содержимого.
Ключевое отличие новой версии от предыдущей — расширение возможностей за пределы текста. EmbeddingGemma 2 обрабатывает изображения и звук напрямую, без необходимости собирать отдельный конвейер из распознавания речи, генерации подписей к картинкам и текстового поиска. Для видео модель может индексировать одновременно кадры и фрагменты звука, что позволяет находить конкретные моменты в ролике.
Модель построена на архитектуре открытой Gemma 4 и распространяется по лицензии Apache 2.0, допускающей коммерческое использование. Архитектура EmbeddingGemma 2 модульная: базовый блок для работы только с текстом занимает 270 млн параметров, для подключения обработки изображений требуется ещё 170 млн, а для аудио — ещё 300 млн параметров.
Для экономии памяти разработчики применили технологию Matryoshka Representation Learning, которая позволяет динамически сокращать размерность выходных векторов с 768 до 512, 256 или 128 элементов — это снижает объём памяти, занимаемый векторными базами данных, до шести раз.
Google утверждает, что в тестах MTEB (Massive Text Embedding Benchmark) для кода и MAEB (Massive Audio Embedding Benchmark) модель показала лучшие результаты среди систем размером до 1 млрд параметров, превзойдя при этом более крупные модели в задачах работы с текстом, изображениями и звуком.
Веса EmbeddingGemma 2 доступны на платформах Hugging Face и Kaggle, в перспективе появятся на Gemini Enterprise Agent Platform. Модель совместима со стандартными инструментами запуска и встраивания — transformers, llama.cpp, Ollama, LM Studio и другими. В паре со «старшей» моделью Gemma 4, которая использует общий токенизатор и аудиокодировщик, EmbeddingGemma 2 позволяет реализовать на устройстве конвейеры RAG (Retrieval-Augmented Generation) с меньшим суммарным потреблением памяти.
Почему это важно
Возможность искать по смыслу среди фото, видео и аудиозаписей прямо на устройстве, без подключения к интернету и передачи данных на сторонние серверы, повышает конфиденциальность пользователей — личные файлы не покидают смартфон. Компактный размер модели делает такие функции доступными даже на устройствах с ограниченными ресурсами, а улучшенные результаты в тестах на работу с кодом говорят о пригодности модели для индексации репозиториев и работы ИИ-агентов, помогающих программистам.
Главные цифры
- 768 значений — размер вектора, в который модель преобразует данные любого типа
- 740 млн параметров — полный размер модели EmbeddingGemma 2
- 270 млн параметров — требуется только для работы с текстом
- 170 млн параметров — дополнительно нужно для обработки изображений
- 300 млн параметров — дополнительно нужно для обработки аудио
- До 6 раз — возможное сокращение объёма памяти векторных баз благодаря MRL
- 191 Мбайт — объём оперативной памяти для текстовых весов модели на Pixel 11 Pro
- 567 Мбайт — объём памяти для мультимодальной версии на том же устройстве
- С 68,76 до 78,68 балла — рост результата в бенчмарке MTEB Code по сравнению с первой версией модели
По материалам: 3dnews.ru