Волна ИИПодписаться
← Назад
Модели и агенты

Google DeepMind выпустила EmbeddingGemma 2: 740M параметров для поиска по тексту, коду, видео и звуку

06.10.2026 · marktechpost.com ↗

Google DeepMind представила EmbeddingGemma 2 — открытую модель для создания векторных представлений контента любого типа. Она построена на архитектуре Gemma 4 и переводит текст, код, картинки, видео и звук в одно пространство из 768 измерений. Такой подход позволяет искать по смыслу: текстовый запрос находит фото, голосовая заметка — видеоклип, а товарная карточка с текстом, изображениями и демо-роликом превращается в единый вектор. Лицензия Apache 2.0, веса доступны на Hugging Face и Kaggle, также вышли сборки для Ollama, llama.cpp GGUF и LiteRT.

Архитектура модульная: текст и код обрабатывает backbone на 270M параметров, к нему опционально подключаются vision-энкодер на 170M и аудио-энкодер на 300M. Разработчик может загрузить только нужную часть: 270M для текста, 440M для текста с изображениями, 570M для текста с аудио или все 740M. При этом все конфигурации работают в общем векторном пространстве — запрос, обработанный текстовой версией, найдёт документы, которые индексировал полный вариант. Контекстное окно выросло до 8192 токенов, это в 4 раза больше первой версии: примерно 29 изображений, 58 видеокадров или 5,5 минут аудио.

На бенчмарках Google заявляет лидерство среди мультимодальных embedding-моделей с менее чем 1B параметров на MTEB Code и MAEB. Прирост кода на MTEB составил 9,92 пункта (примерно 14%) по сравнению с первой EmbeddingGemma. Качество мультиязычного текста осталось примерно на том же уровне: MTEB multilingual v2 — 61,36 против 61,15 у предшественницы. Более крупные модели всё ещё вырываются вперёд, но у них выше требования к памяти.

Модель создавали для работы на устройстве: с квантованием на Pixel 11 Pro активная память для текстовой версии — около 191 МБ, для полной мультимодальной — примерно 567 МБ. На MacBook M5 Pro обработка одного изображения занимает 37,3 мс. Благодаря Matryoshka Representation Learning вектор можно ужать до 512, 256 или 128 измерений, что сокращает хранилище до 6 раз с минимальной потерей качества — при 256 измерениях мультиязычный MTEB проседает лишь на 0,95 пункта. Это делает EmbeddingGemma 2 удобным выбором для локального поиска, классификации и конфиденциального RAG, когда данные не должны покидать устройство.

Источник: marktechpost.com
← Все новости AI Wave